Naskenované PDF je jen obrázek stránky. Počítač v něm vidí pixely, ne slova — nejde v něm označit text, zkopírovat citaci ani najít frázi pomocí Ctrl-F. Řeší to OCR (optické rozpoznávání znaků): software přečte obrázek, rozpozná písmena a pod sken přidá neviditelnou textovou vrstvu. Stránka vypadá stejně, ale teď se dá prohledávat a označovat.
Jak na to
Otevřete nástroj OCR pro PDF, přetáhněte do něj naskenované PDF a vyberte jazyk dokumentu (na tom záleží — OCR je mnohem přesnější, když ví, jakou abecedu a slovník má očekávat). Nástroj zpracuje každou stránku a vrátí nové PDF s vypálenou prohledatelnou textovou vrstvou.
Vše běží na našich serverech a soubor se po dvou hodinách smaže — bez registrace, bez vodoznaku.
Tipy pro čistý výsledek
Pokud můžete, skenujte na 300 DPI — při nižším rozlišení se písmena rozmazávají do sebe. Držte stránky rovně; výrazné natočení rozpoznávání zhoršuje. A pamatujte, že OCR jen dělá, co může, s nedokonalými obrázky: rukopis, stylizovaná písma a vybledlé kopie nikdy nebudou dokonalé.