يبدو ملف PDF الممسوح ضوئيًا كمستند، لكنه يتصرف كصورة فوتوغرافية: لا يمكنك البحث فيه، ولا نسخ جملة منه، ولا أن تطلب من قارئ الشاشة قراءته بصوت عالٍ. والتعرف الضوئي على الحروف يحل ذلك. تقرأ أداة OCR لملفات PDF الكلمات في كل صفحة وتضعها فوقها كنص غير مرئي، فتبقى الصفحة كما هي تمامًا، لكن يصبح البحث فيها وتحديد نصها وفهرستها ممكنًا. وهي تقرأ 39 لغة، ولغتين معًا في المستندات التي تمزجهما، ويمكنها أيضًا أن تسلّمك النص في ملف مستقل.
طريقة استخدام OCR لملفات PDF
- أضف ملف PDF الممسوح. قوّم الصفحات المائلة أولًا باستخدام تقويم صفحات PDF للحصول على دقة أفضل.
- اختر لغة المستند، ولغة ثانية إذا كانت الصفحات تمزج لغتين.
- اختر PDF قابل للبحث أو ملف نصي، ثم اختر تشغيل OCR.
- نزّل النتيجة واختبرها بالبحث عن كلمة تراها في إحدى الصفحات.
كيف تُنشأ الطبقة القابلة للبحث
تُرسم كل صفحة بدقة 250 نقطة لكل بوصة، ويعثر محرك Tesseract على الكلمات في هذا الرسم. ثم تُوضع الكلمات فوق الصفحة الأصلية كنص غير مرئي، في مواضع الكلمات التي تراها نفسها. يحتفظ المسح الضوئي بدقته، ويبقى النص الحقيقي والرسومات والروابط في الصفحة كما كانت: لا يُضاف سوى الطبقة غير المرئية. وتبقى الصفحات التي تحتوي نصًا بالفعل، سواء كان مكتوبًا أو من OCR سابق، كما هي، لذا لا يؤدي تشغيل OCR مرتين إلى تكرار النص.
اختيار اللغة الصحيحة
يتعرف OCR على الحروف بنموذج خاص بلغة بعينها، لذا فإن اختيار لغة المستند الصحيحة أهم من أي إعداد آخر. تضم القائمة 39 لغة، منها العربية والصينية المبسطة والتقليدية واليونانية والعبرية والهندية واليابانية والكورية والروسية والتايلاندية والتركية والأوكرانية والأردية والفيتنامية، إضافةً إلى اللغات الأوروبية الرئيسية. وفي المستندات التي تمزج لغتين، مثل عقد بالعربية مع ملحق بالإنجليزية، اختر لغة ثانية فيُستخدم النموذجان معًا. ومع النموذج الخاطئ، تفقد رسالة فرنسية تُقرأ كإنجليزية علامات التشكيل وتتبدل كلماتها. وللمستندات الممسوحة بالخط العربي، يشرح دليلا OCR للعربية وOCR للأردية كيف تُجهّز المسح وما الدقة المتوقعة.
نتائج دقيقة
لا يتجاوز التعرف جودة المسح. تعمل الصفحات المستقيمة ذات الإضاءة المتساوية والتباين الجيد بأفضل صورة، ويساعد تقويم صفحات PDF عندما تكون مائلة. أما الخط الصغير والكتابة اليدوية والأختام فوق النص والتخطيطات متعددة الأعمدة فهي مواضع الأخطاء، لذا راجع الأسماء والأرقام والتواريخ. اختر ملف نصي لتحصل على الكلمات المُتعرَّف عليها في ملف .txt صفحةً بعد صفحة، أو تابع إلى تحويل PDF إلى Word للحصول على مستند قابل للتحرير. ويشرح دليل ملفات PDF القابلة للبحث طبقات النص بالتفصيل.
متى تُستخدم أداة OCR لملفات PDF
أرشيفات مستندات قابلة للبحث
ابحث بكلمة مفتاحية في سنوات من الرسائل والكشوف الممسوحة بدلًا من فتح الملفات واحدًا تلو الآخر.
نسخ نص من مستند ممسوح
حدد فقرة أو عنوانًا أو رقمًا مرجعيًا من صفحة ممسوحة وانسخه بدلًا من كتابته من جديد.
مقروء لقارئات الشاشة
تتيح طبقة النص لقارئات الشاشة قراءة الصفحات الممسوحة بصوت عالٍ، وهي الخطوة الأولى نحو مستند يسهل الوصول إليه.
قيود ينبغي معرفتها
تتعرف أداة OCR لملفات PDF على النص المطبوع بـ 39 لغة، حتى لغتين في المهمة الواحدة، وتحتاج إلى Tesseract وبيانات اللغة على الخادم. تبقى الصفحات التي تحتوي نصًا بالفعل كما هي. توقّع أخطاء في الخط الصغير والكتابة اليدوية والتخطيطات المعقدة، وراجع الأسماء والأرقام والتواريخ.
OCR لملفات PDF: أسئلة شائعة
كيف أعرف إن كان ملف PDF يحتاج إلى OCR؟
حاول تحديد كلمة بالمؤشر أو ابحث عن كلمة تراها. إذا لم يُعثر على شيء، أو لم تتمكن إلا من رسم مستطيل فوق الصفحة، فالنص جزء من صورة وسيفيد OCR.
هل يغيّر OCR مظهر المستند؟
لا. تبقى كل صفحة كما كانت، بجودة الصورة نفسها، وتُضاف الكلمات المُتعرَّف عليها فوقها كنص غير مرئي.
هل يستطيع OCR قراءة الكتابة اليدوية؟
صُمّم Tesseract للنص المطبوع. قد يُتعرّف أحيانًا على الحروف المنفصلة المكتوبة بعناية، لكن الخط المتصل عادةً لا، لذا لا تعتمد على OCR في الملاحظات المكتوبة بخط اليد.
هل يمكنني الحصول على النص فقط؟
نعم. اختر ملف نصي كناتج فتصلك الكلمات المُتعرَّف عليها في ملف .txt، صفحةً بصفحة. والصفحات التي كان فيها نص بالفعل تُسهم بنصها كما هو.
لماذا يقول OCR إن لغة ما غير مثبتة؟
تحتاج كل لغة إلى بيانات Tesseract على الخادم. وإذا كانت ناقصة، ينبّهك VelloDoc بدلًا من أن يعيد ملفًا بلا طبقة نص.