متن کی تہیں بمقابلہ متن کی تصاویر
ورڈ پروسیسر، اسپریڈشیٹ یا ویب براؤزر سے بنی PDF متن کو حروف کی صورت میں محفوظ کرتی ہے: ہر حرف اپنے فونٹ، سائز اور صفحے پر جگہ کے ساتھ ریکارڈ ہوتا ہے۔ چونکہ فائل جانتی ہے کہ اس میں کون سے حروف ہیں، ویوورز انہیں تلاش، منتخب اور کاپی کر سکتے ہیں اور معاون ٹیکنالوجی کو دے سکتے ہیں۔ اسکینر یا فون کیمرہ مختلف طریقے سے کام کرتا ہے۔ یہ صفحے کی تصویر ریکارڈ کرتا ہے، رنگین پکسلز کی ایک جالی جسے کوئی علم نہیں کہ ان میں سے کچھ پکسلز مل کر لفظ «انوائس» بناتے ہیں۔ نتیجہ بالکل واضح دکھائی دے سکتا ہے اور پھر بھی اس میں کوئی متن نہیں ہوتا۔ بہت سی حقیقی دستاویزات دونوں قسم کے صفحات ملاتی ہیں: ڈیجیٹل طور پر بنایا گیا معاہدہ جس کے ساتھ اسکین شدہ دستخطی صفحہ لگا ہو، یا تصویری ضمیموں والی رپورٹ۔ اسی لیے تلاش کبھی کوئی لفظ صفحہ 3 پر ڈھونڈ لیتی ہے مگر صفحہ 12 پر نہیں، حالانکہ آپ دونوں پر اسے صاف پڑھ سکتے ہیں۔
دس سیکنڈ میں PDF کیسے جانچیں
سب سے تیز جانچ کوئی لفظ منتخب کرنے کی کوشش ہے۔ اگر گھسیٹنے پر الفاظ نمایاں ہوں تو صفحے میں متن کی تہہ ہے۔ اگر کرسر اس کے بجائے صفحے پر مستطیل بنائے تو آپ تصویر دیکھ رہے ہیں۔ دوسری جانچ نظر آنے والا کوئی لفظ تلاش کرنا ہے؛ نظر آنے والے لفظ کا کوئی نتیجہ نہ ملنے کا مطلب ہے کہ اس صفحے پر قابلِ استعمال متن نہیں۔ زوم کرنا تیسرا مفید اشارہ ہے: اصل متن ہر تکبیر پر واضح رہتا ہے، جبکہ تصویر کا متن نرم اور پکسل زدہ ہو جاتا ہے۔ ملی جلی دستاویزات میں صرف پہلا نہیں بلکہ کئی صفحات جانچیں۔ اگر آپ بالکل دیکھنا چاہیں کہ PDF میں کون سا متن ہے تو PDF سے TXT اسے نکال دیتا ہے؛ جو فائل خالی واپس آئے، یا کچھ صفحات کے لیے خالی ہو، وہ بتا رہی ہے کہ متن کی تہہ کہاں غائب ہے۔
OCR حقیقت میں کیا کرتا ہے
آپٹیکل کریکٹر ریکگنیشن متن کی تصاویر کو دوبارہ حروف میں بدلتا ہے۔ سافٹ ویئر صفحے پر متن کی سطریں ڈھونڈتا ہے، انہیں الفاظ اور حروف میں الگ کرتا ہے، اور جو شکلیں دیکھتا ہے ان کا کسی زبان کے تربیت یافتہ ماڈل سے موازنہ کر کے سب سے ممکنہ حروف اور الفاظ چنتا ہے۔ نتیجہ صرف متن کا بہاؤ نہیں بلکہ مقامات کے ساتھ متن ہوتا ہے، اس لیے ہر پہچانا گیا لفظ اپنی تصویر کے عین اوپر رکھا جا سکتا ہے۔ PDF OCR Tesseract انجن استعمال کرتا ہے۔ ہر صفحہ تقریباً 250 DPI پر بنا کر پہچانا جاتا ہے، اور پہچانا گیا متن اصل صفحے کے اوپر پوشیدہ طور پر رکھا جاتا ہے، جو اپنی تصویر برقرار رکھتا ہے۔ اس ترتیب کو اکثر سینڈوچ PDF کہا جاتا ہے۔ جب آپ تلاش کرتے ہیں تو ویوور پوشیدہ لفظ ڈھونڈ کر وہ جگہ نمایاں کرتا ہے جہاں نظر آنے والا لفظ ہے، اس لیے صفحہ ویسا ہی دکھائی دیتا ہے مگر ڈیجیٹل دستاویز کی طرح برتاؤ کرتا ہے۔
زبان کی سیٹنگ کیوں اہم ہے
OCR انجن حروف کو الگ تھلگ نہیں پہچانتے۔ یہ زبان کے ماڈلز پر انحصار کرتے ہیں جو جانتے ہیں کہ کون سے حروف موجود ہیں، وہ کیسے جڑتے ہیں اور کون سے الفاظ ممکن ہیں۔ درست زبان چننا درستی کو بہت بہتر بناتا ہے: فرانسیسی خط پڑھنے والا انگریزی ماڈل اعراب والے حروف بگاڑ دے گا اور غیر متوقع الفاظ غلط پڑھے گا، اور لاطینی رسم الخط کا ماڈل عربی یا اردو بالکل نہیں پڑھ سکتا، کیونکہ یہ رسم الخط مختلف حروف استعمال کرتے ہیں اور دائیں سے بائیں لکھے جاتے ہیں۔ VelloDoc 39 زبانیں پیش کرتا ہے، جن میں عربی، عبرانی، ہندی، چینی، جاپانی اور کوریائی شامل ہیں، اور ہر زبان کا ڈیٹا سرور پر نصب ہونا ضروری ہے۔ کئی زبانوں والی دستاویزات میں بنیادی زبان چنیں اور دوسری کو دوسری زبان کے طور پر شامل کریں۔ اگر کوئی زبان نصب نہ ہو تو ٹول قابلِ استعمال متن کی تہہ کے بغیر PDF دینے کے بجائے یہ بات بتا دیتا ہے۔
اسکین سے درست نتائج حاصل کرنا
OCR کی زیادہ تر غلطیوں کا فیصلہ صفحہ پہچانتے وقت نہیں بلکہ اس کی تصویر لیتے وقت ہو جاتا ہے۔ ریزولوشن اہم ہے: عام اصول کے طور پر عام پرنٹ شدہ متن کو تقریباً 300 DPI پر اسکین کرنا شناخت کو کافی تفصیل دیتا ہے، اور بہت باریک تحریر کو اس سے زیادہ کا فائدہ ہوتا ہے۔ کنٹراسٹ بھی اہم ہے، اس لیے صاف سفید کاغذ پر گہرا متن سرمئی یا نقش دار پس منظر پر مدھم متن کے مقابلے میں کہیں بہتر پہچانا جاتا ہے۔ سیدھی سطریں اہم ہیں کیونکہ شناخت متن کی ہموار قطاروں کی توقع رکھتی ہے؛ PDF سیدھی کریں شناخت سے پہلے ہلکا جھکاؤ درست کر دیتا ہے۔ خالی صفحات صرف پروسیسنگ کا وقت بڑھاتے ہیں، اور خالی صفحات حذف کریں انہیں ہٹا دیتا ہے۔ سائے، کتاب کی جلد کے قریب مڑے ہوئے صفحات اور چمکدار کاغذ کی چکاچوند فون اسکین کے سب سے عام مسائل ہیں؛ فون سے صاف اسکین کی گائیڈ ان سے بچنے کا طریقہ بتاتی ہے۔
پہچانے گئے متن کی جانچ اور درستی
اچھا OCR بھی غلطیاں کرتا ہے، اور یہ غلطیاں کچھ نمونوں پر چلتی ہیں۔ ملتے جلتے حروف گڈمڈ ہو جاتے ہیں: ساتھ ساتھ لکھے r اور n حرف m بن سکتے ہیں، ہندسہ 0 اور حرف O جگہ بدل لیتے ہیں، اور 1، l اور I آسانی سے آپس میں مل جاتے ہیں۔ اردو متن میں نقطے غائب ہو سکتے ہیں یا ملتی جلتی شکل والے حروف بدل سکتے ہیں۔ ٹیبلز کا متن غیر متوقع ترتیب میں آ سکتا ہے، اور کئی کالموں والے صفحات کالم بہ کالم کے بجائے آر پار پڑھے جا سکتے ہیں۔ نام، حوالہ نمبر، تاریخیں اور رقوم سب سے زیادہ توجہ کی مستحق ہیں، کیونکہ ایک غلط ہندسہ معقول دکھائی دیتے ہوئے ان کا مطلب بدل دیتا ہے۔ ایک عملی جانچ یہ ہے کہ OCR کے نتیجے میں صفحے پر نظر آنے والے کئی الفاظ اور اعداد تلاش کریں۔ جن دستاویزات میں عین الفاظ اہم ہوں، جیسے قانونی یا مالی ریکارڈز، ان میں پہچانے گئے متن کو تلاش کی سہولت سمجھیں اور مستند ورژن کے طور پر ہمیشہ صفحے کی تصویر پر ہی بھروسا کریں۔
قابلِ تلاش ہونا قابلِ رسائی ہونے جیسا نہیں
متن کی تہہ رسائی کی طرف بڑا قدم ہے، کیونکہ اسکرین ریڈرز آخرکار اسکین شدہ صفحے کے الفاظ بلند آواز میں پڑھ سکتے ہیں۔ تاہم مکمل طور پر قابلِ رسائی PDF کو اس سے زیادہ درکار ہے۔ قابلِ رسائی دستاویزات میں ساخت بیان کرنے والے ٹیگز ہوتے ہیں، جیسے کون سا متن سرخی ہے، کون سا فہرست ہے اور کس تصویر کو وضاحت درکار ہے، اور وہ پڑھنے کی ترتیب طے کرتی ہیں تاکہ معاون ٹیکنالوجی مواد کو معقول ترتیب میں پیش کرے۔ OCR یہ ٹیگز شامل نہیں کرتا۔ PDF/UA معیار بتاتا ہے کہ مکمل رسائی کے لیے کیا ضروری ہے۔ جب آپ کو ایسا مواد چاہیے جو فون سمیت ہر ایک کے لیے پڑھنا آسان ہو تو قابلِ تلاش PDF کو PDF سے HTML کے ذریعے ویب صفحے میں بدلنا ایک اور عملی راستہ ہے، کیونکہ HTML متن اسکرین کے مطابق ڈھلتا ہے اور براؤزر کی رسائی کی خصوصیات کے ساتھ فطری طور پر کام کرتا ہے۔
جب OCR درست ٹول نہ ہو
OCR ان صفحات کے لیے ہے جو تصاویر ہیں۔ VelloDoc پہلے سے متن والے صفحات ویسے ہی چھوڑ دیتا ہے، اس لیے ڈیجیٹل PDF پر اسے چلانے سے فائل بغیر تبدیلی کے واپس آ جاتی ہے۔ ایک اہم استثنا ہے: کچھ ڈیجیٹل PDF میں ایسا متن ہوتا ہے جو دیکھنے میں درست لگتا ہے مگر کاپی کرنے پر بے معنی نکلتا ہے، کیونکہ فائل حروف کو یہ معلومات دیے بغیر محفوظ کرتی ہے کہ وہ کون سے حروفِ تہجی ہیں۔ OCR نظر آنے والا صفحہ پڑھ کر یہ مسئلہ حل کر دیتا ہے۔ اگر آپ کے پاس اصل دستاویز ہو تو اس سے نئی PDF ایکسپورٹ کرنا اسکین کی شناخت سے ہمیشہ بہتر ہے۔ طویل مدتی آرکائیو کے لیے معقول ترتیب یہ ہے: اسکین کریں، صاف کریں، OCR چلائیں، اور پھر نتیجے کو PDF سے PDF/A سے تبدیل کریں تاکہ قابلِ تلاش دستاویز برسوں تک پڑھنے کے قابل رہے۔ بہتر بنانے والے ٹولز کی گائیڈ دکھاتی ہے کہ یہ مراحل آپس میں کیسے جڑتے ہیں۔ عربی رسم الخط والی دستاویزات کے لیے عربی PDF کے لیے OCR اور اردو PDF کے لیے OCR کی گائیڈز دیکھیں۔
سوالات
میں متن دیکھ سکتا ہوں مگر تلاش کیوں نہیں کر سکتا؟
صفحہ خود متن کے بجائے متن کی تصویر ہے، جو اسکین اور فون تصاویر میں عام ہے۔ قابلِ تلاش متن کی تہہ شامل کرنے کے لیے PDF OCR چلائیں۔
کیا OCR میری PDF کی شکل بدلتا ہے؟
نہیں۔ VelloDoc ہر صفحہ جیسا تھا ویسا رکھتا ہے اور پہچانے گئے الفاظ اس کے اوپر پوشیدہ متن کے طور پر رکھتا ہے۔
کیا OCR ہاتھ کی لکھائی پڑھ سکتا ہے؟
عموماً قابلِ اعتماد طور پر نہیں۔ Tesseract پرنٹ شدہ متن کے لیے بنا ہے؛ صاف لکھے الگ الگ بڑے حروف کبھی پہچان لیے جاتے ہیں، مگر جڑی ہوئی لکھائی عموماً نہیں۔
کیا OCR کا متن قانونی دستاویزات کے لیے کافی درست ہے؟
اسے دستاویزات ڈھونڈنے اور ان میں گھومنے کے لیے استعمال کریں، مگر نام، اعداد اور تاریخیں صفحے کی تصویر سے ملا کر تصدیق کریں۔ تصویر ہی مستند ریکارڈ رہتی ہے۔
کیا پہلے سے قابلِ تلاش PDF پر OCR چلانا چاہیے؟
نہیں، جب تک اس کا متن کاپی کرنے پر بے ربط حروف کی صورت میں نہ نکلے۔ ڈیجیٹل PDF پر OCR اصل متن کی جگہ تصویر اور پوشیدہ متن کی تہہ رکھ دیتا ہے۔