スキャンしたPDFは、ページを写した画像にすぎません。コンピューターにはピクセルが見えているだけで文字は認識されていないため、テキストを選択したり、一部を引用としてコピーしたり、Ctrl+Fでフレーズを検索したりすることはできません。これを解決するのがOCR(光学文字認識)です。ソフトウェアが画像を読み取って文字を認識し、スキャンの背後に目に見えないテキスト層を追加します。ページの見た目はまったく変わりませんが、検索と選択ができるようになります。
手順
OCRツールを開いてスキャンしたPDFをドロップし、ドキュメントの言語を選びます(これが重要です。想定すべきアルファベットと辞書がわかっていると、OCRの精度は大きく上がります)。ツールが全ページを処理し、検索可能なテキスト層を組み込んだ新しいPDFを返します。
処理はすべて弊社のサーバー上で行われ、ファイルは2時間後に削除されます。アカウント登録も透かしも不要です。
きれいに仕上げるコツ
可能なら300 DPIでスキャンしてください。解像度が低すぎると文字同士がにじんで見分けがつかなくなります。ページはまっすぐに保ちましょう。大きく傾いていると認識精度が落ちます。また、OCRは不完全な画像をベストエフォートで読み取る技術だという点も忘れないでください。手書き文字、装飾的なフォント、かすれたコピーは完璧には認識されません。