همهٔ راهنماها →

چطور یک PDF اسکن‌شده را قابل جست‌وجو کنیم

اسکن فقط یک عکس از صفحه است. اینجا می‌بینید OCR چطور آن را به متنی تبدیل می‌کند که می‌توانید جست‌وجو، انتخاب و کپی کنید — در حدود یک دقیقه.

یک PDF اسکن‌شده فقط عکسی از یک صفحه است. کامپیوتر شما پیکسل می‌بیند، نه کلمه — پس نمی‌توانید متن را انتخاب کنید، جمله‌ای را کپی کنید یا با Ctrl-F عبارتی را پیدا کنید. راه‌حل OCR (تشخیص نوری کاراکتر) است: نرم‌افزار تصویر را می‌خواند، حروف را تشخیص می‌دهد و یک لایهٔ متنی نامرئی زیر اسکن اضافه می‌کند. ظاهر صفحه دقیقاً همان می‌ماند، اما حالا قابل جست‌وجو و انتخاب است.

روش انجام کار

ابزار OCR را باز کنید، PDF اسکن‌شده‌تان را در آن رها کنید و زبان سند را انتخاب کنید (این نکته مهم است — وقتی OCR بداند باید منتظر کدام الفبا و واژه‌نامه باشد، دقتش به‌مراتب بیشتر می‌شود). ابزار همهٔ صفحه‌ها را پردازش می‌کند و یک PDF تازه با لایهٔ متنی قابل جست‌وجو تحویل می‌دهد.

همه‌چیز روی سرورهای ما اجرا می‌شود و فایل دو ساعت بعد پاک می‌شود — بدون ثبت‌نام، بدون واترمارک.

نکاتی برای نتیجهٔ تمیزتر

اگر می‌توانید با ۳۰۰ dpi اسکن کنید — وضوح کمتر باعث می‌شود حروف در هم ادغام شوند. صفحه‌ها را صاف نگه دارید؛ کجی زیاد به تشخیص لطمه می‌زند. و به‌خاطر داشته باشید که OCR تلاشی بهترین‌حالت‌ممکن برای خواندن تصویرهای ناقص است: دست‌خط، فونت‌های تزئینی و فتوکپی‌های کم‌رنگ هیچ‌وقت کامل خوانده نمی‌شوند.