VelloDoc
PDF بہتر بنائیں

PDF OCR

39 زبانوں میں OCR سے اسکین شدہ PDF میں قابلِ تلاش اور قابلِ انتخاب متن کی تہہ شامل کریں۔ صفحات اپنی شکل برقرار رکھتے ہیں، اور متن الگ بھی نکالا جا سکتا ہے۔

فائلیں منتخب کریں

فائلیں یہاں چھوڑیں یا براؤز کرنے کے لیے کلک کریں


قبول شدہ: PDFزیادہ سے زیادہ 80 MBفراہمی کے بعد حذف

39 زبانیں پہچانتا ہے، ضرورت ہو تو دو ایک ساتھ۔ پہچانے گئے متن پر بھروسہ کرنے سے پہلے اسے جانچ لیں۔

متعلقہ ٹولز

اس کے بعد عموماً اٹھائے جانے والے اگلے قدم۔

اسکین شدہ PDF دستاویز جیسی دکھتی ہے مگر تصویر جیسا برتاؤ کرتی ہے: آپ اس میں تلاش نہیں کر سکتے، کوئی جملہ کاپی نہیں کر سکتے، اور نہ ہی اسکرین ریڈر سے اسے بلند آواز میں پڑھوا سکتے ہیں۔ آپٹیکل کریکٹر ریکگنیشن یہ مسئلہ حل کرتا ہے۔ PDF OCR ہر صفحے کے الفاظ پڑھ کر انہیں پوشیدہ متن کے طور پر صفحے کے اوپر رکھ دیتا ہے، اس لیے صفحہ بالکل ویسا ہی رہتا ہے مگر اس میں تلاش، متن کا انتخاب اور انڈیکسنگ ممکن ہو جاتی ہے۔ یہ 39 زبانیں پڑھتا ہے، ملی جلی زبانوں والی دستاویزات میں دو ایک ساتھ، اور متن کو الگ فائل میں بھی دے سکتا ہے۔

PDF OCR استعمال کرنے کا طریقہ

  1. اسکین شدہ PDF شامل کریں۔ بہتر درستی کے لیے ترچھے صفحات پہلے PDF سیدھی کریں سے سیدھے کر لیں۔
  2. دستاویز کی زبان چنیں، اور اگر صفحات میں دو زبانیں ملی ہوں تو دوسری زبان بھی۔
  3. قابلِ تلاش PDF یا ٹیکسٹ فائل چنیں، پھر OCR چلائیں منتخب کریں۔
  4. نتیجہ ڈاؤن لوڈ کریں اور کسی صفحے پر نظر آنے والا لفظ تلاش کر کے اسے آزمائیں۔

قابلِ تلاش تہہ کیسے بنتی ہے

ہر صفحہ 250 DPI پر بنایا جاتا ہے اور Tesseract انجن اس میں الفاظ تلاش کرتا ہے۔ پھر الفاظ اصل صفحے کے اوپر پوشیدہ متن کے طور پر، انہی جگہوں پر رکھے جاتے ہیں جہاں آپ کو نظر آنے والے الفاظ ہیں۔ اسکین اپنی ریزولوشن برقرار رکھتا ہے، اور صفحے کا اصل متن، ڈرائنگز اور لنکس جیسے تھے ویسے رہتے ہیں: صرف پوشیدہ تہہ شامل ہوتی ہے۔ جن صفحات میں پہلے سے متن ہو، چاہے ٹائپ کیا گیا ہو یا پچھلے OCR سے آیا ہو، وہ ویسے ہی رہتے ہیں، اس لیے OCR دو بار چلانے سے متن دوہرا نہیں ہوتا۔

درست زبان کا انتخاب

OCR کسی خاص زبان کے ماڈل سے حروف پہچانتا ہے، اس لیے دستاویز کی درست زبان چننا کسی بھی دوسری ترتیب سے زیادہ اہم ہے۔ فہرست میں 39 زبانیں ہیں، جن میں عربی، آسان اور روایتی چینی، یونانی، عبرانی، ہندی، جاپانی، کوریائی، روسی، تھائی، ترکی، یوکرینی، اردو اور ویتنامی کے ساتھ بڑی یورپی زبانیں شامل ہیں۔ دو زبانوں والی دستاویزات میں، جیسے انگریزی ضمیمے والا اردو معاہدہ، دوسری زبان چنیں تو دونوں ماڈل ایک ساتھ استعمال ہوتے ہیں۔ غلط ماڈل کے ساتھ انگریزی کے طور پر پڑھا گیا فرانسیسی خط اپنے اعرابی نشان کھو دیتا ہے اور الفاظ بدل جاتے ہیں۔ عربی رسم الخط والے اسکین کے لیے اردو OCR اور عربی OCR کی گائیڈز بتاتی ہیں کہ اسکین کیسے تیار کریں اور کتنی درستی کی توقع رکھیں۔

درست نتائج

شناخت اسکین سے بہتر نہیں ہو سکتی۔ سیدھے، یکساں روشنی والے اور اچھے کنٹراسٹ والے صفحات بہترین کام کرتے ہیں، اور ترچھے صفحات کے لیے PDF سیدھی کریں مدد کرتا ہے۔ باریک تحریر، ہاتھ کی لکھائی، متن پر لگی مہریں اور کئی کالموں والے لے آؤٹ وہ جگہیں ہیں جہاں غلطیاں آتی ہیں، اس لیے نام، نمبر اور تاریخیں جانچ لیں۔ پہچانے گئے الفاظ صفحہ بہ صفحہ ‎.txt فائل میں لینے کے لیے ٹیکسٹ فائل چنیں، یا قابلِ تدوین دستاویز کے لیے PDF سے Word پر جائیں۔ قابلِ تلاش PDF کی گائیڈ متن کی تہوں کو تفصیل سے سمجھاتی ہے۔

PDF OCR کب استعمال ہوتا ہے

قابلِ تلاش دستاویزی آرکائیو

فائلیں ایک ایک کر کے کھولنے کے بجائے برسوں کے اسکین شدہ خطوط اور اسٹیٹمنٹس کو کلیدی لفظ سے تلاش کریں۔

اسکین سے متن کاپی کرنا

اسکین شدہ صفحے سے کوئی پیراگراف، پتا یا حوالہ نمبر دوبارہ ٹائپ کرنے کے بجائے منتخب کر کے کاپی کریں۔

اسکرین ریڈرز کے لیے قابلِ مطالعہ

متن کی تہہ اسکرین ریڈرز کو اسکین شدہ صفحات بلند آواز میں پڑھنے دیتی ہے، جو قابلِ رسائی دستاویز کی طرف پہلا قدم ہے۔

جاننے کے قابل حدود

PDF OCR چھپا ہوا متن 39 زبانوں میں، ایک کام میں دو تک، پہچانتا ہے اور اسے سرور پر Tesseract اور زبان کا ڈیٹا چاہیے۔ جن صفحات میں پہلے سے متن ہو وہ ویسے ہی رہتے ہیں۔ باریک تحریر، ہاتھ کی لکھائی اور پیچیدہ لے آؤٹ میں غلطیوں کی توقع رکھیں، اور نام، نمبر اور تاریخیں جانچ لیں۔

PDF OCR: عام سوالات

مجھے کیسے پتا چلے کہ میری PDF کو OCR کی ضرورت ہے؟

کرسر سے کوئی لفظ منتخب کرنے کی کوشش کریں یا نظر آنے والا کوئی لفظ تلاش کریں۔ اگر کچھ نہ ملے، یا آپ صرف صفحے پر ایک مستطیل بنا سکیں، تو متن تصویر کا حصہ ہے اور OCR کام آئے گا۔

کیا OCR دستاویز کی شکل بدلتا ہے؟

نہیں۔ ہر صفحہ اسی تصویری معیار کے ساتھ جیسا تھا ویسا رہتا ہے، اور پہچانے گئے الفاظ اس کے اوپر پوشیدہ متن کے طور پر شامل ہوتے ہیں۔

کیا OCR ہاتھ کی لکھائی پڑھ سکتا ہے؟

Tesseract چھپے ہوئے متن کے لیے بنا ہے۔ صاف لکھے الگ الگ حروف کبھی کبھار پہچانے جاتے ہیں، مگر جڑی ہوئی لکھائی عموماً نہیں، اس لیے ہاتھ سے لکھے نوٹس کے لیے OCR پر بھروسہ نہ کریں۔

کیا مجھے صرف متن مل سکتا ہے؟

جی ہاں۔ نتیجے کے طور پر ٹیکسٹ فائل چنیں تو پہچانے گئے الفاظ صفحہ بہ صفحہ ‎.txt فائل میں آتے ہیں۔ جن صفحات میں پہلے سے متن تھا وہ اپنا متن جوں کا توں دیتے ہیں۔

OCR یہ کیوں کہتا ہے کہ کوئی زبان نصب نہیں؟

ہر زبان کو سرور پر Tesseract کا ڈیٹا چاہیے۔ اگر یہ موجود نہ ہو تو VelloDoc متن کی تہہ کے بغیر فائل لوٹانے کے بجائے آپ کو بتا دیتا ہے۔

مزید جانیں