読み取り可能なPDFテキスト
Silktideは、PDFドキュメント内のテキストが、単なるテキスト画像ではなく、実際のテキストとして存在するかどうかをテストします。スキャンしたページは入力したページと見た目が同じですが、ソフトウェアで読み取れるのは入力したページだけです。
重要な理由
PDFにが含まれていない場合、が読み上げるものは何もなく、ドキュメント全体が、全盲の人や弱視の人にとって無音になります。誰もテキストを選択、コピー、検索できず、検索エンジンはコンテンツをインデックス登録できず、翻訳ツールも処理できません。
これは、紙のドキュメントをスキャンしてそのままPDFとして保存した場合や、エクスポート時にテキストを画像に変換してしまうデザインツールを使った場合に、最もよく起こります。こうしたドキュメントは、最も大きな支障をもたらす場所、つまりフォーム、ポリシー、アーカイブ記録などで特によく使われています。
修正方法
- 印刷物をスキャンするのではなく、ワープロやレイアウトツールなど、元のデジタルドキュメントからPDFをエクスポートします。これにより、実際のテキストが保持されます。
- 紙でしか存在しないドキュメントはスキャンしてから、ほとんどのPDFツールに含まれているを実行します。OCRは誤りを犯すことがあるため、認識されたテキストを校正してください。
- 重要なコンテンツについては、PDFの代わりに、またはPDFと併せてウェブページを公開することを検討してください。HTMLページのほうがアクセシビリティを維持しやすくなります。
テキストを読み取り可能にすることは最初のステップです。完全にアクセシブルなドキュメントには、構造も必要です。Silktideがドキュメントを修復する方法については、PDFの修復をご覧ください。
Silktideによるテスト方法
- ウェブサイト上で見つかった各PDFドキュメントを分析します。
- ドキュメントに含まれる実際のテキストを抽出します。
- 読み取り可能な単語を抽出できない場合、つまりコンテンツが画像としてのみ存在する場合に、そのドキュメントを報告します。
各ドキュメントは、全体として合格または不合格になります。
トラブルシューティング
PDFを問題なく読めます
あなたの目はテキストの画像を読み取れますが、ソフトウェアは読み取れません。機械が見ているものを確認するには、PDF内の文を選択するか、ページ上に表示されている単語を検索してみてください。選択も検索もできない場合、そのテキストは画像です。
ドキュメントの大部分が意図的に画像になっています
写真アルバムやポスターには、テキストがほとんど含まれていなくても問題ありません。ドキュメントが、画像化されたテキストを通じて何も伝えていない場合は、この指摘をできます。