VelloDoc
اسکیننگ اور OCR

اسکین شدہ اردو PDF کو OCR سے قابلِ تلاش کیسے بنائیں

اردو دستاویزات اکثر اسکین کی صورت میں شیئر ہوتی ہیں: عدالتی کاغذات، اسکول کے ریکارڈ، سرکاری خطوط، اخبار کے تراشے اور پرانی کتابیں۔ جب تک اسکین کا متن پہچانا نہ جائے، اس میں تلاش یا اس سے کاپی نہیں ہو سکتی۔ اردو ایک خاص چیلنج بڑھاتی ہے، کیونکہ زیادہ تر پرنٹ شدہ اردو نستعلیق انداز استعمال کرتی ہے، جس کے ترچھے اور ایک دوسرے پر چڑھے حروف سافٹ ویئر کے لیے عربی طباعت میں عام سیدھے نسخ انداز سے کہیں زیادہ مشکل ہیں۔ یہ گائیڈ بتاتی ہے کہ اردو OCR سے کیا توقع رکھیں، صفحات کیسے تیار کریں اور نتیجے سے زیادہ سے زیادہ فائدہ کیسے اٹھائیں۔

از VelloDocاپ ڈیٹ: پڑھنے کا وقت: 7 منٹ

ابھی آزمائیں: PDF OCR

اسکین شدہ صفحات کے الفاظ پہچانیں اور نظر نہ آنے والی متن کی تہہ شامل کریں تاکہ PDF میں تلاش اور کاپی کی جا سکے۔

PDF OCR کا مکمل صفحہ کھولیں

فائلیں منتخب کریں

فائلیں یہاں چھوڑیں یا براؤز کرنے کے لیے کلک کریں


قبول شدہ: PDFزیادہ سے زیادہ 80 MBفراہمی کے بعد حذف

39 زبانیں پہچانتا ہے، ضرورت ہو تو دو ایک ساتھ۔ پہچانے گئے متن پر بھروسہ کرنے سے پہلے اسے جانچ لیں۔

نستعلیق اور OCR کے لیے اس کی اہمیت

نستعلیق ایک رواں، خطاطانہ انداز ہے۔ کسی ایک ہموار سطر پر ٹکنے کے بجائے لفظ کے حروف دائیں سے بائیں ڈھلوان میں نیچے آتے ہیں، جڑے ہوئے حروف ایک دوسرے کے اوپر چڑھتے اور ملتے ہیں، اور نقطے ان کے درمیان کی چھوٹی جگہوں میں گھس جاتے ہیں۔ الفاظ اکثر جڑے ہوئے حروف کے کئی الگ گروہوں سے بنتے ہیں، اس لیے لفظ کے اندر کے خلا الفاظ کے درمیان کے خلا جیسے لگ سکتے ہیں۔ ان میں سے ہر خصوصیت OCR انجن کے لیے حروف الگ کرنا، ان کے نقطے برقرار رکھنا اور یہ طے کرنا مشکل بناتی ہے کہ الفاظ کہاں شروع اور ختم ہوتے ہیں۔ نسخ طرز کے اردو فونٹ میں پرنٹ ہونے والی دستاویزات، جو کچھ فارمز اور ڈیجیٹل دستاویزات استعمال کرتی ہیں، عموماً روایتی نستعلیق طباعت سے بہتر پہچانی جاتی ہیں۔ نتائج پر رائے قائم کرنے سے پہلے یہ جاننا مفید ہے کہ آپ کے پاس کون سا انداز ہے۔

VelloDoc کا اردو OCR کیسے کام کرتا ہے

PDF OCR اوپن سورس Tesseract انجن کو اس کے اردو زبان کے ڈیٹا کے ساتھ استعمال کرتا ہے۔ جب آپ اردو چنتے ہیں تو ہر صفحہ تقریباً 250 DPI پر بنایا جاتا ہے، الفاظ پہچانے جاتے ہیں، اور پہچانا گیا متن اصل صفحے کے اوپر پوشیدہ طور پر رکھا جاتا ہے، اس لیے صفحہ ویسا ہی دکھائی دیتا ہے مگر اس میں تلاش اور کاپی ہو سکتی ہے۔ اس گائیڈ پر اوپر والا ٹول اردو پہلے سے منتخب کر کے شروع ہوتا ہے۔ اردو دستاویزات کے لیے عربی کے بجائے اردو چنیں: اردو میں ایسے حروف ہیں جو عربی میں نہیں، جیسے ٹ، ڈ، ڑ، ں اور ے، اور اردو کا ڈیٹا اردو الفاظ کی بنیاد پر بنا ہے۔ اگر اردو دستاویز میں انگریزی الفاظ ہوں تو انگریزی کو دوسری زبان کے طور پر شامل کریں تاکہ دونوں رسم الخط پہچانے جائیں۔

اردو اسکین تیار کرنا

نستعلیق کی چھوٹی اور گنجان تفصیلات ہی سب سے پہلے خراب اسکین کا شکار ہوتی ہیں، اس لیے انجن کو جتنی ممکن ہو وضاحت دیں۔ پرنٹ شدہ صفحات گرے اسکیل میں 300 DPI یا اس سے زیادہ پر اسکین کریں، صفحات ہموار رکھیں تاکہ جلد کے قریب سطریں نہ مڑیں، اور اسکینر کا شیشہ صاف کریں۔ فون کے ساتھ یکساں روشنی میں ہر صفحے کی سیدھے اوپر سے تصویر لیں، فریم کو کاغذ سے بھریں اور سایوں سے بچیں۔ شناخت سے پہلے اسکین کمپریس نہ کریں: سخت JPEG کمپریشن ان نقطوں اور جوڑوں کو دھندلا دیتی ہے جو حروف میں فرق کرتے ہیں۔ آپ کے پاس جو بہترین ورژن ہو اس پر OCR چلائیں، اور اگر فائل چھوٹی کرنی ہو تو بعد میں تیار فائل کمپریس کریں۔

مراحل کی قابلِ اعتماد ترتیب

اسکین شدہ صفحات کے ڈھیر کے لیے اچھی ترتیب یہ ہے: فون کی تصاویر اسکین سے PDF سے ایک فائل میں جمع کریں، یا اپنے اسکینر کی PDF سے شروع کریں؛ دو طرفہ اسکین کی خالی پشت خالی صفحات حذف کریں سے ہٹائیں؛ ترچھے صفحات PDF سیدھی کریں سے سیدھے کریں؛ پھر OCR چلائیں۔ یہی ترتیب رکھیں، کیونکہ اردو تحریر کی سیدھی سطریں ترچھی سطروں کے مقابلے میں کہیں زیادہ قابلِ اعتماد طریقے سے پہچانی جاتی ہیں۔ آخر میں نتیجہ جانچیں اور ضرورت ہو تو PDF کمپریس کریں سے اس کا سائز کم کریں۔

پہچانے گئے اردو متن کی جانچ اور ترمیم

نتیجے میں صفحے پر نظر آنے والے چند الفاظ تلاش کریں۔ توقع رکھیں کہ کچھ تلاشیں لفظ موجود ہونے کے باوجود ناکام ہوں گی، کیونکہ ایک غلط پڑھا گیا حرف بھی مطابقت توڑ دیتا ہے۔ نام، اعداد اور تاریخیں احتیاط سے جانچیں؛ اردو دستاویزات مشرقی عربی ہندی ہندسے استعمال کر سکتی ہیں، اور ان کی شناخت کا طریقہ مختلف ہو سکتا ہے۔ متن ایڈٹ کرنے کے لیے PDF سے Word اسے قابلِ ترمیم دستاویز کے طور پر واپس لاتا ہے، اور PDF سے TXT اسے سادہ متن کے طور پر محفوظ کرتا ہے۔ دونوں میں سے کسی کو بھی ایسے پروگرام میں کھولیں جو دائیں سے بائیں اردو متن سپورٹ کرے، اور درستیوں کے لیے وقت رکھیں۔ مختلف ویوورز پوشیدہ تہوں میں دائیں سے بائیں متن کو مختلف طریقے سے سنبھالتے ہیں، اس لیے اگر کاپی کیا گیا متن بے ترتیب لگے تو کوئی دوسری ایپلیکیشن آزمائیں۔

جب OCR درست جواب نہ ہو

عام مقصد کا OCR ہاتھ کی لکھائی، آرائشی خطاطی، مدھم کاربن کاپیوں یا بری طرح خراب صفحات کے لیے نہیں بنا، اور آرائشی انداز میں لکھی اردو شاعری خاص طور پر مشکل ہے۔ ایسے مواد میں قابلِ تلاش تہہ درست صفحہ ڈھونڈنے میں پھر بھی مدد دے سکتی ہے، مگر خود متن قابلِ بھروسا نہیں ہوتا۔ اگر درستی بہت اہم ہو، مثلاً قانونی یا تعلیمی حوالے کے لیے، تو پہچانے گئے اقتباسات کا صفحے کی تصویر سے موازنہ کریں یا انہیں دوبارہ ٹائپ کریں۔ قابلِ تلاش PDF کی گائیڈ متن کی تہوں کی وضاحت کرتی ہے، اور عربی OCR کی گائیڈ عربی طباعت کے ملتے جلتے چیلنجز کا احاطہ کرتی ہے۔

سوالات

اردو متن کے لیے اردو چنوں یا عربی؟

اردو چنیں۔ اردو میں ایسے حروف ہیں جو عربی میں نہیں، اور اردو زبان کا ڈیٹا اردو الفاظ کی بنیاد پر بنا ہے۔

میرے پہچانے گئے اردو متن میں اتنی غلطیاں کیوں ہیں؟

نستعلیق طباعت OCR انجنوں کے لیے مشکل ہے، اور باریک تحریر، کم ریزولوشن، جھکاؤ اور شور غلطیاں بڑھاتے ہیں۔ 300 DPI یا اس سے زیادہ پر دوبارہ اسکین کریں، PDF سیدھی کریں سے صفحات سیدھے کریں اور نتیجہ احتیاط سے جانچیں۔

کیا میں OCR کے بعد اردو متن ایڈٹ کر سکتا ہوں؟

جی ہاں۔ اسے PDF سے Word یا PDF سے TXT سے نکالیں اور دائیں سے بائیں متن سپورٹ کرنے والے پروگرام میں ایڈٹ کریں۔ شناخت کی کچھ غلطیاں درست کرنے کی توقع رکھیں۔

کیا OCR ہاتھ سے لکھی اردو پر کام کرتا ہے؟

عموماً نہیں۔ زبان کا ڈیٹا پرنٹ شدہ متن کے لیے بنا ہے، اس لیے ہاتھ کی لکھائی ناقابلِ اعتماد نتائج دیتی ہے۔

کیا OCR کے بعد میری دستاویز رکھی جاتی ہے؟

نہیں۔ فائل ایک عارضی کام کے فولڈر میں پروسیس ہوتی ہے اور نتیجہ دینے کے بعد حذف کر دی جاتی ہے۔ فائل سیکیورٹی کا صفحہ تفصیلات بتاتا ہے۔

اس موضوع کے ٹولز