Сканований PDF — це просто зображення сторінки. Комп'ютер бачить пікселі, а не слова: текст не можна виділити, скопіювати цитату чи знайти фразу через Ctrl-F. Виправляє це OCR (оптичне розпізнавання символів): програма читає зображення, розпізнає літери й додає під скан невидимий шар тексту. Сторінка виглядає так само, але тепер у ній можна шукати й виділяти текст.
Як це зробити
Відкрийте інструмент OCR для PDF, перетягніть скановані сторінки та оберіть мову документа (це важливо — розпізнавання набагато точніше, коли програма знає, який алфавіт і словник очікувати). Інструмент обробляє кожну сторінку і повертає новий PDF із вбудованим шаром тексту, придатним для пошуку.
Усе відбувається на наших серверах, а файл видаляється через дві години — без реєстрації, без водяних знаків.
Поради для чистого результату
Скануйте з роздільною здатністю 300 DPI, якщо можете — при нижчій літери зливаються одна з одною. Тримайте сторінки рівно: сильний перекіс погіршує розпізнавання. І пам'ятайте, що OCR читає недосконалі зображення настільки добре, наскільки може: рукописний текст, стилізовані шрифти та бліді копії ніколи не розпізнаються ідеально.