Texte PDF lisible
Silktide vérifie si le texte de vos documents PDF existe en tant que vrai texte, et non uniquement comme des images de texte. Une page numérisée ressemble à l’identique à une page saisie au clavier, mais seul le texte saisi est lisible par les logiciels.
Pourquoi c’est important
Lorsqu’un PDF ne contient pas de , un n’a rien à annoncer — tout le document est muet pour les personnes aveugles ou malvoyantes. Personne ne peut sélectionner, copier ou rechercher le texte, les moteurs de recherche ne peuvent pas indexer le contenu, et les outils de traduction ne peuvent pas le traiter.
Cela se produit le plus souvent avec des documents papier numérisés enregistrés directement en PDF, et avec des outils de conception qui aplatissent le texte en images lors de l’export. Ces documents sont courants justement là où ils font le plus de mal : formulaires, politiques et documents archivés.
Comment y remédier
- Exportez le PDF à partir du document numérique d’origine — un traitement de texte ou un outil de mise en page — au lieu de scanner une impression. Cela préserve le vrai texte.
- Pour les documents qui n’existent que sur papier, numérisez-les puis lancez l’, fonctionnalité incluse dans la plupart des outils PDF. Relisez le texte reconnu, car l’OCR fait des erreurs.
- Pour les contenus importants, envisagez de publier une page web plutôt qu’un PDF (ou en complément du PDF) — les pages HTML sont plus faciles à maintenir accessibles.
Rendre le texte lisible est la première étape ; un document pleinement accessible a aussi besoin de structure. Voir Remédiation PDF pour savoir comment Silktide peut réparer des documents pour vous.
Comment Silktide teste ceci
- Analyser chaque document PDF trouvé sur votre site web.
- Extraire tout texte réel que contient le document.
- Signaler le document lorsqu’aucun mot lisible ne peut être extrait, ce qui signifie que son contenu n’existe que sous forme d’images.
Chaque document réussit ou échoue dans son ensemble.
Dépannage
Je peux lire le PDF sans problème
Vos yeux lisent l’image du texte ; les logiciels ne le peuvent pas. Pour voir ce qu’une machine perçoit, essayez de sélectionner une phrase dans le PDF ou de rechercher un mot que vous voyez sur la page. Si vous ne pouvez pas le sélectionner ou le trouver, le texte est une image.
Le document est principalement composé d’images par conception
Un album photo ou une affiche peut légitimement contenir peu de texte. Si le document ne transmet rien au moyen de texte représenté en image, vous pouvez le constat.