← усі посібники

Як зробити сканований PDF придатним для пошуку

Скан — це просто картинка сторінки. Ось як OCR перетворює її на текст, який можна шукати, виділяти й копіювати — приблизно за хвилину.

Сканований PDF — це просто зображення сторінки. Комп'ютер бачить пікселі, а не слова: текст не можна виділити, скопіювати цитату чи знайти фразу через Ctrl-F. Виправляє це OCR (оптичне розпізнавання символів): програма читає зображення, розпізнає літери й додає під скан невидимий шар тексту. Сторінка виглядає так само, але тепер у ній можна шукати й виділяти текст.

Як це зробити

Відкрийте інструмент OCR для PDF, перетягніть скановані сторінки та оберіть мову документа (це важливо — розпізнавання набагато точніше, коли програма знає, який алфавіт і словник очікувати). Інструмент обробляє кожну сторінку і повертає новий PDF із вбудованим шаром тексту, придатним для пошуку.

Усе відбувається на наших серверах, а файл видаляється через дві години — без реєстрації, без водяних знаків.

Поради для чистого результату

Скануйте з роздільною здатністю 300 DPI, якщо можете — при нижчій літери зливаються одна з одною. Тримайте сторінки рівно: сильний перекіс погіршує розпізнавання. І пам'ятайте, що OCR читає недосконалі зображення настільки добре, наскільки може: рукописний текст, стилізовані шрифти та бліді копії ніколи не розпізнаються ідеально.