← všechny návody

Jak zpřístupnit naskenované PDF vyhledávání

Sken je jen obrázek stránky. Takhle z něj OCR udělá text, který můžete hledat, označovat a kopírovat — zhruba za minutu.

Naskenované PDF je jen obrázek stránky. Počítač v něm vidí pixely, ne slova — nejde v něm označit text, zkopírovat citaci ani najít frázi pomocí Ctrl-F. Řeší to OCR (optické rozpoznávání znaků): software přečte obrázek, rozpozná písmena a pod sken přidá neviditelnou textovou vrstvu. Stránka vypadá stejně, ale teď se dá prohledávat a označovat.

Jak na to

Otevřete nástroj OCR pro PDF, přetáhněte do něj naskenované PDF a vyberte jazyk dokumentu (na tom záleží — OCR je mnohem přesnější, když ví, jakou abecedu a slovník má očekávat). Nástroj zpracuje každou stránku a vrátí nové PDF s vypálenou prohledatelnou textovou vrstvou.

Vše běží na našich serverech a soubor se po dvou hodinách smaže — bez registrace, bez vodoznaku.

Tipy pro čistý výsledek

Pokud můžete, skenujte na 300 DPI — při nižším rozlišení se písmena rozmazávají do sebe. Držte stránky rovně; výrazné natočení rozpoznávání zhoršuje. A pamatujte, že OCR jen dělá, co může, s nedokonalými obrázky: rukopis, stylizovaná písma a vybledlé kopie nikdy nebudou dokonalé.