طبقات النص مقابل صور النص
يخزّن ملف PDF المُنشأ من معالج نصوص أو جدول بيانات أو متصفح ويب النصَّ كحروف: تُسجَّل كل حرف مع خطه وحجمه وموضعه على الصفحة. ولأن الملف يعرف الحروف الموجودة فيه، تستطيع برامج العرض البحث فيها وتحديدها ونسخها وتمريرها إلى التقنيات المساعدة. أما الماسح الضوئي أو كاميرا الهاتف فيعملان بطريقة مختلفة. فهما يسجلان صورة للصفحة، شبكة من البكسلات الملوّنة لا تدري أن بعض هذه البكسلات يشكّل كلمة «فاتورة». وقد تبدو النتيجة حادة تمامًا دون أن تحتوي أي نص على الإطلاق. وتخلط مستندات حقيقية كثيرة بين النوعين: عقد مُنتج رقميًا أُرفقت به صفحة توقيع ممسوحة، أو تقرير بملاحق مصوّرة. ولهذا يعثر البحث أحيانًا على كلمة في الصفحة 3 لا في الصفحة 12، مع أنك تستطيع قراءتها بوضوح في كلتيهما.
كيف تفحص ملف PDF في عشر ثوانٍ
أسرع اختبار هو محاولة تحديد كلمة. إذا تظللت الكلمات أثناء السحب، فالصفحة تحتوي طبقة نص. وإذا رسم المؤشر مستطيلًا على الصفحة بدلًا من ذلك، فأنت تنظر إلى صورة. والاختبار الثاني هو البحث عن كلمة تراها؛ فعدم وجود نتيجة لكلمة ظاهرة يعني أن تلك الصفحة لا تحتوي نصًا صالحًا للاستخدام. والتكبير دليل ثالث مفيد: فالنص الحقيقي يبقى حادًا عند أي تكبير، بينما يصبح النص الموجود في صورة ناعمًا ومبكسلًا. وفي المستندات المختلطة، افحص عدة صفحات لا الصفحة الأولى فقط. وإذا أردت أن ترى بالضبط ما يحتويه ملف PDF من نص، فإن أداة تحويل PDF إلى TXT تستخرجه؛ والملف الذي يعود فارغًا، أو فارغًا في صفحات معينة، يخبرك أين تغيب طبقة النص.
ما الذي يفعله OCR فعلًا
يحوّل التعرف الضوئي على الحروف صورَ النص إلى حروف مجددًا. يعثر البرنامج على أسطر النص في الصفحة، ويقسمها إلى كلمات وحروف، ويقارن الأشكال التي يراها بنموذج مدرَّب للغة، مختارًا الحروف والكلمات الأكثر احتمالًا. والناتج ليس مجرد تدفق من النص، بل نص مع مواضعه، بحيث يمكن وضع كل كلمة متعرَّف عليها فوق صورتها بالضبط. تستخدم أداة OCR لملفات PDF محرك Tesseract. تُرسم كل صفحة بدقة تقارب 250 نقطة لكل بوصة ويُتعرّف عليها، ثم يُوضع النص المتعرَّف عليه بشكل غير مرئي فوق الصفحة الأصلية، التي تحتفظ بصورتها. ويُسمى هذا الترتيب غالبًا PDF الساندويتش. وعندما تبحث، يعثر العارض على الكلمة المخفية ويظلل الموضع الذي تظهر فيه الكلمة المرئية، فتبدو الصفحة دون تغيير بينما تتصرف كمستند رقمي.
لماذا يهم إعداد اللغة
لا تتعرف محركات OCR على الحروف منفردة. فهي تعتمد على نماذج لغوية تعرف الحروف الموجودة وكيف تتصل وأي الكلمات محتملة. واختيار اللغة الصحيحة يحسّن الدقة تحسينًا كبيرًا: فنموذج إنجليزي يقرأ رسالة فرنسية سيشوّه الحروف المشكّلة ويخطئ في قراءة الكلمات التي لا يتوقعها، ونموذج للحروف اللاتينية لا يستطيع قراءة العربية أو الأردية إطلاقًا، لأن هاتين الكتابتين تستخدمان حروفًا مختلفة وتُكتبان من اليمين إلى اليسار. يوفّر VelloDoc 39 لغة، منها العربية والعبرية والهندية والصينية واليابانية والكورية، وتحتاج كل لغة إلى تثبيت بياناتها على الخادم. وفي المستندات التي تمزج اللغات، اختر اللغة الرئيسية وأضف الأخرى لغةً ثانية. وإذا لم تكن لغة ما مثبتة، تذكر الأداة ذلك بدلًا من إعادة ملف PDF بلا طبقة نص صالحة.
الحصول على نتائج دقيقة من المستندات الممسوحة
تُحسم معظم أخطاء OCR عند التقاط الصفحة لا عند التعرف عليها. فالدقة مهمة: كقاعدة تقريبية، يمنح مسح النص المطبوع العادي بدقة 300 نقطة لكل بوصة تفاصيلَ كافية للتعرف، ويستفيد الخط الصغير جدًا من دقة أعلى. والتباين مهم أيضًا، فالنص الداكن على ورق أبيض نظيف يُتعرّف عليه أفضل بكثير من النص الباهت على خلفيات رمادية أو مزخرفة. والأسطر المستقيمة مهمة لأن التعرف يتوقع صفوفًا مستوية من النص؛ وتصحح أداة تقويم صفحات PDF الميل الطفيف قبل التعرف. والصفحات الفارغة لا تضيف إلا وقت معالجة، وتزيلها أداة حذف الصفحات الفارغة. وتُعد الظلال والصفحات المنحنية قرب كعب الكتاب ولمعان الورق اللامع أكثر المشكلات شيوعًا في المسح بالهاتف؛ ويشرح دليل المسح الأنظف بالهاتف كيف تتجنبها.
مراجعة النص المتعرَّف عليه وتصحيحه
حتى OCR الجيد يرتكب أخطاء، وتتبع هذه الأخطاء أنماطًا. تُخلط الحروف المتشابهة: فالحرفان r وn متجاورين قد يصبحان m، ويتبادل الرقم 0 والحرف O مكانيهما، ويسهل الخلط بين 1 وl وI. وفي النص العربي قد تُفقد النقاط أو تُخلط الحروف المتشابهة في الشكل. وقد يخرج نص الجداول بترتيب غير متوقع، وقد تُقرأ الصفحات متعددة الأعمدة عرضيًا عبر الأعمدة بدلًا من قراءة كل عمود على حدة. وتستحق الأسماء والأرقام المرجعية والتواريخ والمبالغ أشد الانتباه، لأن رقمًا خاطئًا واحدًا يغيّر معناها مع بقائها معقولة المظهر. والفحص العملي هو البحث في ناتج OCR عن عدة كلمات وأرقام تراها على الصفحة. وفي المستندات التي تهم فيها الصياغة الدقيقة، كالسجلات القانونية أو المالية، تعامل مع النص المتعرَّف عليه كوسيلة مساعدة للبحث، واعتمد دائمًا على صورة الصفحة نفسها بوصفها النسخة المرجعية.
القابلية للبحث ليست هي إمكانية الوصول
طبقة النص خطوة كبيرة نحو إمكانية الوصول، لأن قارئات الشاشة تستطيع أخيرًا قراءة كلمات الصفحة الممسوحة بصوت مسموع. لكن ملف PDF متاحًا بالكامل يحتاج إلى أكثر من ذلك. فالمستندات المتاحة تحمل وسومًا تصف البنية، مثل أي نص عنوان، وأيها قائمة، وأي صورة تحتاج إلى وصف، وتحدد ترتيبًا للقراءة حتى تعرض التقنيات المساعدة المحتوى بتسلسل منطقي. ولا يضيف OCR هذه الوسوم. ويصف معيار PDF/UA ما تتطلبه إمكانية الوصول الكاملة. وعندما تحتاج إلى محتوى يسهل على الجميع قراءته، بما في ذلك على الهواتف، فإن تحويل ملف PDF القابل للبحث إلى صفحة ويب باستخدام تحويل PDF إلى HTML طريق عملي آخر، لأن نص HTML يتكيف مع الشاشة ويعمل بسلاسة مع ميزات إمكانية الوصول في المتصفح.
متى لا يكون OCR الأداة المناسبة
OCR مخصص للصفحات التي هي صور. ويترك VelloDoc الصفحات التي تحتوي نصًا بالفعل كما هي، لذا فإن تشغيله على ملف PDF رقمي يعيد الملف دون تغيير. وهناك استثناء مهم: بعض ملفات PDF الرقمية تحتوي نصًا يبدو طبيعيًا لكنه يُنسخ كرموز لا معنى لها، لأن الملف يخزّن الحروف دون معلومات عن الأحرف التي تمثلها. ويحل OCR ذلك بقراءة الصفحة المرئية بدلًا منها. وإذا كان لديك المستند الأصلي، فتصدير ملف PDF جديد منه أفضل دائمًا من التعرف على مستند ممسوح. وللأرشيفات طويلة الأمد، يكون الترتيب المنطقي: المسح، ثم التنظيف، ثم تشغيل OCR، ثم تحويل النتيجة باستخدام تحويل PDF إلى PDF/A حتى يبقى المستند القابل للبحث مقروءًا لسنوات. ويبيّن دليل أدوات التحسين كيف تتكامل هذه الخطوات. وللمستندات المكتوبة بالحروف العربية، راجع دليلي OCR لملفات PDF العربية وOCR لملفات PDF الأردية.
أسئلة
لماذا أرى النص لكن لا أستطيع البحث فيه؟
الصفحة صورة للنص لا النص نفسه، وهذا معتاد في المستندات الممسوحة وصور الهاتف. شغّل OCR لملفات PDF لإضافة طبقة نص قابلة للبحث.
هل يغيّر OCR مظهر ملف PDF؟
لا. يحتفظ VelloDoc بكل صفحة كما كانت ويضع فوقها الكلمات المُتعرَّف عليها كنص غير مرئي.
هل يستطيع OCR قراءة الكتابة اليدوية؟
عمومًا ليس بشكل موثوق. صُمم Tesseract للنص المطبوع؛ وقد يتعرف أحيانًا على الحروف المنفصلة المكتوبة بعناية، لكنه لا يتعرف عادةً على الخط اليدوي المتصل.
هل نص OCR دقيق بما يكفي للمستندات القانونية؟
استخدمه للعثور على المستندات والتنقل فيها، لكن تحقق من الأسماء والأرقام والتواريخ مقابل صورة الصفحة. فالصورة تبقى السجل المرجعي.
هل أشغّل OCR على ملف PDF قابل للبحث أصلًا؟
لا، ما لم يُنسخ نصه كرموز مشوشة. فتشغيل OCR على ملف PDF رقمي يستبدل النص الحقيقي بصورة وطبقة نص مخفية.