VelloDoc
المسح الضوئي وOCR

كيف تطبّق OCR على ملفات PDF العربية عبر الإنترنت: جودة المسح ونصائح للدقة

المستند العربي الممسوح مجرد صورة لنص: لا يمكنك البحث فيه عن اسم، ولا نسخ فقرة منه، ولا جعل قارئ الشاشة يقرؤه بصوت مسموع. يحوّل التعرف الضوئي على الحروف هذه الصور إلى نص من جديد، لكن العربية تطرح تحديات لا تعرفها الكتابات اللاتينية، من الحروف المتصلة التي يتغير شكلها إلى النقاط والعلامات التي يسهل ضياعها في مسح رديء. يشرح هذا الدليل كيف يتعامل OCR مع العربية، وكيف تجهّز الصفحات للحصول على نتيجة أفضل، وكيف تراجع ما تم التعرف عليه.

بقلم VelloDocآخر تحديث: مدة القراءة: 7 دقائق

جرّبها الآن: OCR لملفات PDF

تعرّف على الكلمات في الصفحات الممسوحة ضوئيًا وأضف طبقة نص غير مرئية لتتمكن من البحث في ملف PDF ونسخ نصه.

افتح صفحة OCR لملفات PDF الكاملة

اختر الملفات

أفلت الملفات هنا أو انقر للتصفح


يقبل: PDFالحد الأقصى 80 MBتُحذف بعد التسليم

يتعرف على 39 لغة، ولغتين معًا عند الحاجة. راجع النص المُتعرَّف عليه قبل الاعتماد عليه.

لماذا العربية أصعب على OCR

تُكتب العربية من اليمين إلى اليسار بخط متصل، فتتصل معظم الحروف بما يجاورها وتتخذ شكلًا مختلفًا في أول الكلمة أو وسطها أو آخرها أو عندما تأتي منفردة. وتشترك عدة حروف في الشكل الأساسي نفسه ولا يميزها إلا عدد نقاطها وموضعها، مثل ب وت وث، لذا قد تغيّر ذرة غبار أو نقطة مفقودة كلمةً كاملة. كما تُهمل نصوص كثيرة علامات الحركات القصيرة، بينما قد تتضمنها النصوص الدينية والشعرية والتعليمية كاملة، فتضيف علامات صغيرة فوق السطر وتحته. وتسير الأرقام والكلمات اللاتينية من اليسار إلى اليمين داخل جمل تُكتب من اليمين إلى اليسار. وعلى محرك OCR أن يفصل الحروف المتصلة، ويحافظ على كل نقطة وعلامة، ويعيد كل شيء إلى ترتيبه الصحيح، ولهذا تكون جودة المسح أهم في العربية منها في الإنجليزية.

كيف يتعرف VelloDoc على النص العربي

تستخدم أداة OCR لملفات PDF محرك Tesseract مفتوح المصدر مع بيانات اللغة العربية الخاصة به. عندما تختار العربية لغةً للتعرف، تُرسم كل صفحة بدقة تقارب 250 نقطة لكل بوصة، ويعثر Tesseract على الكلمات فيها، ثم يُوضع النص المتعرَّف عليه بشكل غير مرئي فوق كلمات الصفحة الأصلية. تبقى الصفحة بالمظهر نفسه، لكن يمكنك الآن البحث في نصها وتحديده ونسخه. وفي هذا الدليل تبدأ الأداة أعلاه واللغة العربية مختارة مسبقًا. وفي المستند الذي يمزج العربية والإنجليزية، اختر العربية وأضف الإنجليزية لغةً ثانية ليُتعرّف على الاثنتين. وتبقى الصفحات التي تحتوي نصًا قابلًا للتحديد كما هي، لذا لا تُقرأ في الملف المختلط إلا الصفحات الممسوحة.

مسح المستندات العربية لتعرّف أفضل

ابدأ بأوضح صفحة وأكثرها استواءً يمكنك الحصول عليها. على الماسح الضوئي، تُعد دقة 300 نقطة لكل بوصة بتدرج رمادي خيارًا افتراضيًا جيدًا للعربية المطبوعة؛ وقد يستفيد الخط الصغير جدًا أو النص المشكول بالكامل من دقة أعلى، ما دامت النتيجة حادة. ورغم أن الصفحات يُعاد رسمها بدقة تقارب 250 نقطة لكل بوصة من أجل التعرف، يبقى الأصل النظيف مهمًا، لأن الضبابية والتشويش والظلال تنتقل معها. ومع الهاتف، املأ الإطار بالصفحة، وأمسك الكاميرا موازية للورقة، واستخدم إضاءة متساوية بلا ظلال على النص. تجمع أداة المسح الضوئي إلى PDF صور الهاتف في ملف PDF واحد، لكنها لا تكتشف حواف الصفحة ولا تصحح المنظور، لذا اقصص صورك وقوّمها أولًا. ويتناول دليل المسح الأنظف بالهاتف الإضاءة والتأطير بالتفصيل.

قوّم الصفحات قبل تشغيل OCR

تربك الأسطر المائلة عملية التعرف، والحروف العربية المتصلة حساسة لذلك بشكل خاص، لأن المحرك يتتبع السطر الذي تستقر عليه الحروف. تكتشف أداة تقويم صفحات PDF زاوية كل صفحة وتقوّمها تلقائيًا. والترتيب مهم: فـ Tesseract يقرأ الأسطر المستقيمة بموثوقية أكبر بكثير من الأسطر المائلة. قوّم أولًا، ثم شغّل OCR على الملف المقوَّم. وإذا احتوى المستند على وجوه خلفية فارغة من مسح على الوجهين، فأزلها قبل التعرف باستخدام حذف الصفحات الفارغة، فهذا يوفر الوقت ويمنع ظهور صفحات فارغة في النتيجة.

مراجعة النص المتعرَّف عليه وإعادة استخدامه

افتح النتيجة وابحث عن بضع كلمات تراها على الصفحة، مثل اسم أو مكان. فإذا عثر البحث عليها، فطبقة النص تعمل. ثم راجع التفاصيل الأهم، لأن أخطاء OCR نادرًا ما تكون واضحة: الحروف المتشابهة التي لا يفرّقها إلا النقاط، والحروف في آخر الكلمات مثل ة وه أو ي وى، والتواريخ والأرقام. وتتعامل عارضات PDF بشكل مختلف مع النص المكتوب من اليمين إلى اليسار في طبقة غير مرئية، لذا قد يظهر النص المنسوخ بترتيب خاطئ في بعض التطبيقات؛ وكثيرًا ما تساعد تجربة عارض آخر. وللعمل على النص نفسه، تحفظه أداة تحويل PDF إلى TXT كملف نصي عادي يمكنك فتحه في أي محرر يدعم العربية، وتستعيده أداة تحويل PDF إلى Word كمستند قابل للتحرير دون التخطيط الأصلي.

مستندات سيجد OCR صعوبة معها

بعض المواد تتجاوز ببساطة ما يستطيع OCR متعدد الأغراض قراءته بموثوقية. فالكتابة اليدوية، والخط العربي الزخرفي، والمطبوعات القديمة جدًا أو التالفة، والنسخ المصوّرة الباهتة، تنتج عادةً أخطاء كثيرة أو لا تنتج نصًا على الإطلاق. والأختام والتواقيع فوق النص تُخفي حروفًا، وقد تُقرأ الجداول والتخطيطات متعددة الأعمدة بترتيب خاطئ، وقد يفقد النص المشكول بالكامل علاماته أو يضعها في غير مواضعها. ومع مستندات كهذه، قد تساعدك الطبقة القابلة للبحث في العثور على الصفحة الصحيحة، لكن ينبغي مراجعة المقاطع المهمة مقابل الصورة أو إعادة كتابتها. ويشرح دليل ملفات PDF القابلة للبحث طبقات النص ومتى يكون OCR الأداة المناسبة.

أسئلة

هل يستطيع VelloDoc قراءة الكتابة العربية اليدوية؟

ليس بشكل موثوق. صُممت بيانات اللغة العربية للنص المطبوع، لذا تنتج الكتابة اليدوية عادةً أخطاء كثيرة أو لا تنتج نصًا على الإطلاق.

لماذا يبدو النص العربي المنسوخ معكوسًا أو مقطّعًا؟

تتعامل عارضات PDF بشكل مختلف مع النص المكتوب من اليمين إلى اليسار في طبقات النص غير المرئية. جرّب عارضًا آخر، أو استخرج النص باستخدام تحويل PDF إلى TXT وافتحه في محرر يدعم العربية.

هل أختار العربية أم الإنجليزية لمستند مختلط؟

اختر العربية وأضف الإنجليزية لغةً ثانية. تُستخدم اللغتان معًا، وتُقرأ الكلمات الإنجليزية في المستند بموثوقية أكبر بكثير.

هل يغيّر OCR مظهر صفحاتي؟

لا. تحتفظ الصفحات بصورتها، ويُضاف النص المُتعرَّف عليه فوقها كطبقة غير مرئية. وتبقى الصفحات التي تحتوي نصًا قابلًا للتحديد بالفعل كما هي.

ما الدقة التي أمسح بها؟

تُعد 300 نقطة لكل بوصة خيارًا افتراضيًا جيدًا للعربية المطبوعة. وقد يستفيد الخط الصغير جدًا أو النص المشكول بالكامل من دقة أعلى، ما دام المسح حادًا.

أدوات لهذا الموضوع