لماذا العربية أصعب على OCR
تُكتب العربية من اليمين إلى اليسار بخط متصل، فتتصل معظم الحروف بما يجاورها وتتخذ شكلًا مختلفًا في أول الكلمة أو وسطها أو آخرها أو عندما تأتي منفردة. وتشترك عدة حروف في الشكل الأساسي نفسه ولا يميزها إلا عدد نقاطها وموضعها، مثل ب وت وث، لذا قد تغيّر ذرة غبار أو نقطة مفقودة كلمةً كاملة. كما تُهمل نصوص كثيرة علامات الحركات القصيرة، بينما قد تتضمنها النصوص الدينية والشعرية والتعليمية كاملة، فتضيف علامات صغيرة فوق السطر وتحته. وتسير الأرقام والكلمات اللاتينية من اليسار إلى اليمين داخل جمل تُكتب من اليمين إلى اليسار. وعلى محرك OCR أن يفصل الحروف المتصلة، ويحافظ على كل نقطة وعلامة، ويعيد كل شيء إلى ترتيبه الصحيح، ولهذا تكون جودة المسح أهم في العربية منها في الإنجليزية.
كيف يتعرف VelloDoc على النص العربي
تستخدم أداة OCR لملفات PDF محرك Tesseract مفتوح المصدر مع بيانات اللغة العربية الخاصة به. عندما تختار العربية لغةً للتعرف، تُرسم كل صفحة بدقة تقارب 250 نقطة لكل بوصة، ويعثر Tesseract على الكلمات فيها، ثم يُوضع النص المتعرَّف عليه بشكل غير مرئي فوق كلمات الصفحة الأصلية. تبقى الصفحة بالمظهر نفسه، لكن يمكنك الآن البحث في نصها وتحديده ونسخه. وفي هذا الدليل تبدأ الأداة أعلاه واللغة العربية مختارة مسبقًا. وفي المستند الذي يمزج العربية والإنجليزية، اختر العربية وأضف الإنجليزية لغةً ثانية ليُتعرّف على الاثنتين. وتبقى الصفحات التي تحتوي نصًا قابلًا للتحديد كما هي، لذا لا تُقرأ في الملف المختلط إلا الصفحات الممسوحة.
مسح المستندات العربية لتعرّف أفضل
ابدأ بأوضح صفحة وأكثرها استواءً يمكنك الحصول عليها. على الماسح الضوئي، تُعد دقة 300 نقطة لكل بوصة بتدرج رمادي خيارًا افتراضيًا جيدًا للعربية المطبوعة؛ وقد يستفيد الخط الصغير جدًا أو النص المشكول بالكامل من دقة أعلى، ما دامت النتيجة حادة. ورغم أن الصفحات يُعاد رسمها بدقة تقارب 250 نقطة لكل بوصة من أجل التعرف، يبقى الأصل النظيف مهمًا، لأن الضبابية والتشويش والظلال تنتقل معها. ومع الهاتف، املأ الإطار بالصفحة، وأمسك الكاميرا موازية للورقة، واستخدم إضاءة متساوية بلا ظلال على النص. تجمع أداة المسح الضوئي إلى PDF صور الهاتف في ملف PDF واحد، لكنها لا تكتشف حواف الصفحة ولا تصحح المنظور، لذا اقصص صورك وقوّمها أولًا. ويتناول دليل المسح الأنظف بالهاتف الإضاءة والتأطير بالتفصيل.
قوّم الصفحات قبل تشغيل OCR
تربك الأسطر المائلة عملية التعرف، والحروف العربية المتصلة حساسة لذلك بشكل خاص، لأن المحرك يتتبع السطر الذي تستقر عليه الحروف. تكتشف أداة تقويم صفحات PDF زاوية كل صفحة وتقوّمها تلقائيًا. والترتيب مهم: فـ Tesseract يقرأ الأسطر المستقيمة بموثوقية أكبر بكثير من الأسطر المائلة. قوّم أولًا، ثم شغّل OCR على الملف المقوَّم. وإذا احتوى المستند على وجوه خلفية فارغة من مسح على الوجهين، فأزلها قبل التعرف باستخدام حذف الصفحات الفارغة، فهذا يوفر الوقت ويمنع ظهور صفحات فارغة في النتيجة.
مراجعة النص المتعرَّف عليه وإعادة استخدامه
افتح النتيجة وابحث عن بضع كلمات تراها على الصفحة، مثل اسم أو مكان. فإذا عثر البحث عليها، فطبقة النص تعمل. ثم راجع التفاصيل الأهم، لأن أخطاء OCR نادرًا ما تكون واضحة: الحروف المتشابهة التي لا يفرّقها إلا النقاط، والحروف في آخر الكلمات مثل ة وه أو ي وى، والتواريخ والأرقام. وتتعامل عارضات PDF بشكل مختلف مع النص المكتوب من اليمين إلى اليسار في طبقة غير مرئية، لذا قد يظهر النص المنسوخ بترتيب خاطئ في بعض التطبيقات؛ وكثيرًا ما تساعد تجربة عارض آخر. وللعمل على النص نفسه، تحفظه أداة تحويل PDF إلى TXT كملف نصي عادي يمكنك فتحه في أي محرر يدعم العربية، وتستعيده أداة تحويل PDF إلى Word كمستند قابل للتحرير دون التخطيط الأصلي.
مستندات سيجد OCR صعوبة معها
بعض المواد تتجاوز ببساطة ما يستطيع OCR متعدد الأغراض قراءته بموثوقية. فالكتابة اليدوية، والخط العربي الزخرفي، والمطبوعات القديمة جدًا أو التالفة، والنسخ المصوّرة الباهتة، تنتج عادةً أخطاء كثيرة أو لا تنتج نصًا على الإطلاق. والأختام والتواقيع فوق النص تُخفي حروفًا، وقد تُقرأ الجداول والتخطيطات متعددة الأعمدة بترتيب خاطئ، وقد يفقد النص المشكول بالكامل علاماته أو يضعها في غير مواضعها. ومع مستندات كهذه، قد تساعدك الطبقة القابلة للبحث في العثور على الصفحة الصحيحة، لكن ينبغي مراجعة المقاطع المهمة مقابل الصورة أو إعادة كتابتها. ويشرح دليل ملفات PDF القابلة للبحث طبقات النص ومتى يكون OCR الأداة المناسبة.
أسئلة
هل يستطيع VelloDoc قراءة الكتابة العربية اليدوية؟
ليس بشكل موثوق. صُممت بيانات اللغة العربية للنص المطبوع، لذا تنتج الكتابة اليدوية عادةً أخطاء كثيرة أو لا تنتج نصًا على الإطلاق.
لماذا يبدو النص العربي المنسوخ معكوسًا أو مقطّعًا؟
تتعامل عارضات PDF بشكل مختلف مع النص المكتوب من اليمين إلى اليسار في طبقات النص غير المرئية. جرّب عارضًا آخر، أو استخرج النص باستخدام تحويل PDF إلى TXT وافتحه في محرر يدعم العربية.
هل أختار العربية أم الإنجليزية لمستند مختلط؟
اختر العربية وأضف الإنجليزية لغةً ثانية. تُستخدم اللغتان معًا، وتُقرأ الكلمات الإنجليزية في المستند بموثوقية أكبر بكثير.
هل يغيّر OCR مظهر صفحاتي؟
لا. تحتفظ الصفحات بصورتها، ويُضاف النص المُتعرَّف عليه فوقها كطبقة غير مرئية. وتبقى الصفحات التي تحتوي نصًا قابلًا للتحديد بالفعل كما هي.
ما الدقة التي أمسح بها؟
تُعد 300 نقطة لكل بوصة خيارًا افتراضيًا جيدًا للعربية المطبوعة. وقد يستفيد الخط الصغير جدًا أو النص المشكول بالكامل من دقة أعلى، ما دام المسح حادًا.