← svi vodiči

Kako da skenirani PDF postane pretraživ

Skenirani dokument je samo slika stranice. Evo kako OCR pretvara tu sliku u tekst koji možete pretraživati, označavati i kopirati — za otprilike minut.

Skenirani PDF je samo slika stranice. Tvoj računar vidi piksele, a ne reči — zato ne možeš da selektuješ tekst, kopiraš citat ili pronađeš frazu pomoću Ctrl-F. Rešenje je OCR (optičko prepoznavanje karaktera): softver čita sliku, prepoznaje slova i dodaje nevidljivi sloj teksta iza skena. Stranica izgleda identično, ali je sada pretraživa i tekst se može selektovati.

Kako to uraditi

Otvori OCR alatku, prevuci svoj skenirani PDF i izaberi jezik dokumenta (ovo je bitno — OCR je mnogo tačniji kad zna koje pismo i koji rečnik da očekuje). Alatka obrađuje svaku stranu i vraća novi PDF sa ugrađenim, pretraživim slojem teksta.

Sve se odvija na našim serverima, a fajl se briše dva sata kasnije — bez naloga, bez vodenog žiga.

Saveti za čist rezultat

Skeniraj na 300 DPI ako možeš — na nižoj rezoluciji se slova stapaju jedno u drugo. Drži stranice pravo; jak nagib šteti prepoznavanju. I zapamti: OCR čita nesavršene slike najbolje što može — rukopis, stilizovani fontovi i bledi fotokopirani dokumenti nikad neće biti prepoznati savršeno.