VelloDoc
اسکیننگ اور OCR

عربی PDF پر آن لائن OCR کیسے کریں: اسکین کا معیار اور درستی کے مشورے

اسکین شدہ عربی دستاویز صرف متن کی تصویر ہوتی ہے: آپ اس میں کوئی نام تلاش نہیں کر سکتے، پیراگراف کاپی نہیں کر سکتے اور اسکرین ریڈر سے بلند آواز میں نہیں پڑھوا سکتے۔ آپٹیکل کریکٹر ریکگنیشن ان تصاویر کو دوبارہ متن میں بدلتا ہے، مگر عربی ایسے چیلنج لاتی ہے جو لاطینی رسم الخط میں نہیں ہوتے، شکل بدلنے والے جڑے ہوئے حروف سے لے کر ان نقطوں اور علامتوں تک جو خراب اسکین میں آسانی سے ضائع ہو جاتی ہیں۔ یہ گائیڈ بتاتی ہے کہ OCR عربی کو کیسے سنبھالتا ہے، بہتر نتیجے کے لیے صفحات کیسے تیار کریں اور پہچانے گئے متن کی جانچ کیسے کریں۔

از VelloDocاپ ڈیٹ: پڑھنے کا وقت: 7 منٹ

ابھی آزمائیں: PDF OCR

اسکین شدہ صفحات کے الفاظ پہچانیں اور نظر نہ آنے والی متن کی تہہ شامل کریں تاکہ PDF میں تلاش اور کاپی کی جا سکے۔

PDF OCR کا مکمل صفحہ کھولیں

فائلیں منتخب کریں

فائلیں یہاں چھوڑیں یا براؤز کرنے کے لیے کلک کریں


قبول شدہ: PDFزیادہ سے زیادہ 80 MBفراہمی کے بعد حذف

39 زبانیں پہچانتا ہے، ضرورت ہو تو دو ایک ساتھ۔ پہچانے گئے متن پر بھروسہ کرنے سے پہلے اسے جانچ لیں۔

عربی OCR کے لیے زیادہ مشکل کیوں ہے

عربی دائیں سے بائیں جڑے ہوئے رسم الخط میں لکھی جاتی ہے، اس لیے زیادہ تر حروف اپنے ساتھ والے حروف سے جڑتے ہیں اور لفظ کے شروع، درمیان یا آخر میں، یا اکیلے ہونے پر مختلف شکل اختیار کرتے ہیں۔ کئی حروف کی بنیادی شکل ایک جیسی ہوتی ہے اور ان میں فرق صرف نقطوں کی تعداد اور جگہ کا ہوتا ہے، جیسے ب، ت اور ث، اس لیے مٹی کا ایک ذرہ یا غائب نقطہ لفظ بدل سکتا ہے۔ بہت سی تحریروں میں مختصر حرکات کی علامتیں نہیں ہوتیں، جبکہ مذہبی، شعری اور تعلیمی متن میں یہ مکمل ہو سکتی ہیں، جو سطر کے اوپر اور نیچے چھوٹی علامتیں بڑھا دیتی ہیں۔ دائیں سے بائیں جملوں کے اندر اعداد اور لاطینی الفاظ بائیں سے دائیں چلتے ہیں۔ OCR انجن کو جڑے ہوئے حروف الگ کرنے، ہر نقطہ اور علامت برقرار رکھنے اور سب کچھ درست ترتیب میں واپس رکھنے ہوتے ہیں، اسی لیے عربی کے لیے اسکین کا معیار انگریزی سے بھی زیادہ اہم ہے۔

VelloDoc عربی متن کیسے پہچانتا ہے

PDF OCR اوپن سورس Tesseract انجن کو اس کے عربی زبان کے ڈیٹا کے ساتھ استعمال کرتا ہے۔ جب آپ OCR زبان کے طور پر عربی چنتے ہیں تو ہر صفحہ تقریباً 250 DPI پر بنایا جاتا ہے، Tesseract اس پر الفاظ ڈھونڈتا ہے، اور پہچانا گیا متن اصل صفحے کے الفاظ کے اوپر پوشیدہ طور پر رکھا جاتا ہے۔ صفحہ ویسا ہی دکھائی دیتا ہے، مگر اب آپ اس کا متن تلاش، منتخب اور کاپی کر سکتے ہیں۔ اس گائیڈ پر اوپر والا ٹول عربی پہلے سے منتخب کر کے شروع ہوتا ہے۔ عربی اور انگریزی ملی دستاویز میں عربی چنیں اور انگریزی کو دوسری زبان کے طور پر شامل کریں تاکہ دونوں پہچانی جائیں۔ جن صفحات میں پہلے سے منتخب ہونے والا متن ہو وہ ویسے ہی رہتے ہیں، اس لیے ملی جلی فائل میں صرف اسکین شدہ صفحات پڑھے جاتے ہیں۔

بہتر شناخت کے لیے عربی دستاویزات اسکین کرنا

جتنا واضح اور ہموار صفحہ مل سکے اس سے شروع کریں۔ اسکینر پر گرے اسکیل میں 300 DPI پرنٹ شدہ عربی کے لیے اچھی طے شدہ سیٹنگ ہے؛ بہت باریک تحریر یا مکمل اعراب والے متن کو زیادہ ریزولوشن کا فائدہ ہو سکتا ہے، بشرطیکہ نتیجہ واضح رہے۔ اگرچہ شناخت کے لیے صفحات تقریباً 250 DPI پر دوبارہ بنائے جاتے ہیں، صاف ماخذ پھر بھی اہم ہے، کیونکہ دھندلاہٹ، شور اور سائے ساتھ منتقل ہوتے ہیں۔ فون کے ساتھ فریم کو صفحے سے بھریں، کیمرہ کاغذ کے متوازی رکھیں اور متن پر سایوں کے بغیر یکساں روشنی استعمال کریں۔ اسکین سے PDF فون کی تصاویر کو ایک PDF میں جمع کرتا ہے، مگر یہ صفحے کے کنارے نہیں پہچانتا اور نہ زاویہ درست کرتا ہے، اس لیے پہلے تصاویر کراپ اور سیدھی کریں۔ فون سے صاف اسکین کی گائیڈ روشنی اور فریم کو تفصیل سے بیان کرتی ہے۔

OCR چلانے سے پہلے صفحات سیدھے کریں

ترچھی سطریں شناخت کو الجھاتی ہیں، اور جڑے ہوئے عربی حروف اس معاملے میں خاص طور پر حساس ہیں کیونکہ انجن اسی لکیر کا پیچھا کرتا ہے جس پر حروف ٹکے ہوتے ہیں۔ PDF سیدھی کریں ہر صفحے کا زاویہ پہچان کر اسے خود بخود سیدھا کر دیتا ہے۔ ترتیب اہم ہے: Tesseract سیدھی سطریں ترچھی سطروں کے مقابلے میں کہیں زیادہ قابلِ اعتماد طریقے سے پڑھتا ہے۔ پہلے سیدھا کریں، پھر سیدھی کی گئی فائل پر OCR چلائیں۔ اگر دستاویز میں دو طرفہ اسکین کی خالی پشت والے صفحات ہوں تو شناخت سے پہلے انہیں خالی صفحات حذف کریں سے ہٹا دیں، جس سے وقت بچتا ہے اور نتیجے میں خالی صفحات نہیں آتے۔

پہچانے گئے متن کی جانچ اور دوبارہ استعمال

نتیجہ کھولیں اور صفحے پر نظر آنے والے چند الفاظ تلاش کریں، جیسے کوئی نام یا جگہ۔ اگر تلاش انہیں ڈھونڈ لے تو متن کی تہہ کام کر رہی ہے۔ پھر سب سے اہم تفصیلات جانچیں، کیونکہ OCR کی غلطیاں شاذ ہی واضح ہوتی ہیں: ملتے جلتے حروف جن میں صرف نقطوں کا فرق ہو، لفظ کے آخر کے حروف جیسے ة اور ه یا ي اور ى، تاریخیں اور اعداد۔ مختلف PDF ویوورز پوشیدہ تہہ میں دائیں سے بائیں متن کو مختلف طریقے سے سنبھالتے ہیں، اس لیے کاپی کیا گیا متن کچھ ایپلیکیشنز میں بے ترتیب دکھائی دے سکتا ہے؛ کوئی دوسرا ویوور آزمانا اکثر مدد دیتا ہے۔ خود متن پر کام کرنے کے لیے PDF سے TXT اسے سادہ متن کی فائل کے طور پر محفوظ کرتا ہے جسے آپ عربی سپورٹ کرنے والے کسی بھی ایڈیٹر میں کھول سکتے ہیں، اور PDF سے Word اسے اصل لے آؤٹ کے بغیر قابلِ ترمیم دستاویز کے طور پر واپس لاتا ہے۔

وہ دستاویزات جن میں OCR کو مشکل ہوگی

کچھ مواد عام مقصد کے OCR کی قابلِ اعتماد پڑھائی سے باہر ہوتا ہے۔ ہاتھ کی لکھائی، آرائشی خطاطی، بہت پرانے یا خراب پرنٹ اور مدھم فوٹو کاپیاں عموماً بہت سی غلطیاں دیتی ہیں یا کوئی متن نہیں دیتیں۔ متن پر لگی مہریں اور دستخط حروف چھپا دیتے ہیں، ٹیبلز اور کئی کالموں والے لے آؤٹ غلط ترتیب میں پڑھے جا سکتے ہیں، اور مکمل اعراب والا متن اپنی علامتیں کھو سکتا ہے یا غلط جگہ رکھ سکتا ہے۔ ایسی دستاویزات میں قابلِ تلاش تہہ درست صفحہ ڈھونڈنے میں پھر بھی مدد دے سکتی ہے، مگر اہم اقتباسات کو تصویر سے ملا کر جانچنا یا دوبارہ ٹائپ کرنا چاہیے۔ قابلِ تلاش PDF کی گائیڈ متن کی تہوں کی وضاحت کرتی ہے اور بتاتی ہے کہ OCR کب درست ٹول ہے۔

سوالات

کیا VelloDoc عربی ہاتھ کی لکھائی پڑھ سکتا ہے؟

قابلِ اعتماد طور پر نہیں۔ عربی زبان کا ڈیٹا پرنٹ شدہ متن کے لیے بنا ہے، اس لیے ہاتھ کی لکھائی عموماً بہت سی غلطیاں دیتی ہے یا کوئی متن نہیں دیتی۔

کاپی کیا گیا عربی متن الٹا یا ٹوٹا ہوا کیوں لگتا ہے؟

PDF ویوورز پوشیدہ متن کی تہوں میں دائیں سے بائیں متن کو مختلف طریقے سے سنبھالتے ہیں۔ کوئی دوسرا ویوور آزمائیں، یا PDF سے TXT سے متن نکال کر عربی سپورٹ کرنے والے ایڈیٹر میں کھولیں۔

ملی جلی دستاویز کے لیے عربی چنوں یا انگریزی؟

عربی چنیں اور انگریزی کو دوسری زبان کے طور پر شامل کریں۔ دونوں ایک ساتھ استعمال ہوتی ہیں، اور دستاویز کے انگریزی الفاظ کہیں زیادہ قابلِ اعتماد طریقے سے پڑھے جاتے ہیں۔

کیا OCR میرے صفحات کی شکل بدلتا ہے؟

نہیں۔ صفحات اپنی تصویر رکھتے ہیں، اور پہچانا گیا متن ان کے اوپر پوشیدہ تہہ کے طور پر شامل ہوتا ہے۔ جن صفحات میں پہلے سے منتخب ہونے والا متن ہو وہ ویسے ہی رہتے ہیں۔

مجھے کس ریزولوشن پر اسکین کرنا چاہیے؟

پرنٹ شدہ عربی کے لیے 300 DPI اچھی طے شدہ سیٹنگ ہے۔ بہت باریک تحریر یا مکمل اعراب والے متن کو زیادہ ریزولوشن کا فائدہ ہو سکتا ہے، بشرطیکہ اسکین واضح رہے۔

اس موضوع کے ٹولز