یک PDF اسکنشده فقط عکسی از یک صفحه است. کامپیوتر شما پیکسل میبیند، نه کلمه — پس نمیتوانید متن را انتخاب کنید، جملهای را کپی کنید یا با Ctrl-F عبارتی را پیدا کنید. راهحل OCR (تشخیص نوری کاراکتر) است: نرمافزار تصویر را میخواند، حروف را تشخیص میدهد و یک لایهٔ متنی نامرئی زیر اسکن اضافه میکند. ظاهر صفحه دقیقاً همان میماند، اما حالا قابل جستوجو و انتخاب است.
روش انجام کار
ابزار OCR را باز کنید، PDF اسکنشدهتان را در آن رها کنید و زبان سند را انتخاب کنید (این نکته مهم است — وقتی OCR بداند باید منتظر کدام الفبا و واژهنامه باشد، دقتش بهمراتب بیشتر میشود). ابزار همهٔ صفحهها را پردازش میکند و یک PDF تازه با لایهٔ متنی قابل جستوجو تحویل میدهد.
همهچیز روی سرورهای ما اجرا میشود و فایل دو ساعت بعد پاک میشود — بدون ثبتنام، بدون واترمارک.
نکاتی برای نتیجهٔ تمیزتر
اگر میتوانید با ۳۰۰ dpi اسکن کنید — وضوح کمتر باعث میشود حروف در هم ادغام شوند. صفحهها را صاف نگه دارید؛ کجی زیاد به تشخیص لطمه میزند. و بهخاطر داشته باشید که OCR تلاشی بهترینحالتممکن برای خواندن تصویرهای ناقص است: دستخط، فونتهای تزئینی و فتوکپیهای کمرنگ هیچوقت کامل خوانده نمیشوند.