سادہ متن دستاویز کی سب سے زیادہ دوبارہ استعمال ہونے والی شکل ہے: یہ ای میلز اور فارمز میں صاف چسپاں ہوتا ہے، تلاش کے ٹولز اور تجزیاتی اسکرپٹس میں کام آتا ہے، اور ہر چیز پر کھلتا ہے۔ PDF سے TXT ہر صفحے کی متن کی تہہ ایک UTF-8 ٹیکسٹ فائل میں نکالتا ہے، صفحات کو خالی سطروں سے الگ کر کے، اور فارمیٹنگ اور تصاویر پیچھے چھوڑ دیتا ہے۔
PDF سے TXT استعمال کرنے کا طریقہ
- PDF شامل کریں۔ اگر یہ اسکین ہے تو پہلے PDF OCR چلائیں۔
- متن نکالیں منتخب کریں۔
- TXT فائل ڈاؤن لوڈ کریں۔
- اسے کسی بھی ٹیکسٹ ایڈیٹر میں کھولیں۔
کیا نکالا جاتا ہے
VelloDoc ہر صفحے کی متن کی تہہ اسی ترتیب میں پڑھتا ہے جس میں وہ PDF میں محفوظ ہے اور اسے UTF-8 میں انکوڈ شدہ ٹیکسٹ فائل میں لکھتا ہے، اس لیے اعراب والے حروف اور غیر لاطینی رسم الخط محفوظ رہتے ہیں۔ صفحات ایک کے بعد ایک آتے ہیں، خالی سطر سے الگ۔ پیراگراف کے اندر سطروں کے وقفے عموماً صفحے کے وقفوں جیسے ہوتے ہیں، اس لیے لمبا پیراگراف کئی سطروں میں تقسیم ہو سکتا ہے جنہیں ضرورت ہو تو آپ دوبارہ جوڑ سکتے ہیں۔
جہاں نکالنے میں مشکل ہوتی ہے
متن کی ترتیب اس پر منحصر ہے کہ PDF کیسے بنی۔ کئی کالموں والے لے آؤٹ کالموں کو آپس میں ملا سکتے ہیں، ہیڈرز اور فوٹرز ہر صفحے پر دہرائے جاتے ہیں، اور ٹیبلز کے اندر متن سطر بہ سطر آتا ہے۔ غیر معمولی سافٹ ویئر سے بنی کچھ PDF فائلیں حروف کو درست نقشہ بندی کے بغیر محفوظ کرتی ہیں، جس سے صفحہ ٹھیک دکھنے کے باوجود بے ترتیب نتیجہ آتا ہے؛ PDF OCR چلا کر دوبارہ نکالنے سے یہ عموماً حل ہو جاتا ہے۔ OCR کے متن کی تہہ شامل کرنے تک اسکین سے کچھ نہیں نکلتا۔
آؤٹ پٹ فارمیٹ کا انتخاب
پیراگراف اور صفحات کے وقفوں کے ساتھ ترمیم کے لیے PDF سے Word زیادہ آسان ہے۔ دستاویزات کے آغاز کے لیے PDF سے Markdown صفحات کی سرخیاں شامل کرتا ہے۔ اگر اسپریڈشیٹ میں ٹیبلز چاہییں تو PDF سے Excel قطاروں کو خانوں میں تقسیم کرتا ہے۔ قابل تلاش PDF کی گائیڈ بتاتی ہے کہ کچھ PDF فائلوں میں نکالنے کے لیے متن کیوں نہیں ہوتا۔
PDF سے TXT کب استعمال ہوتا ہے
رپورٹس سے اقتباس
PDF کے مشکل متن انتخاب سے الجھے بغیر طویل رپورٹ سے درست الفاظ کاپی کریں۔
تجزیاتی ٹولز کے لیے متن
دستاویزات کو ان سرچ انڈیکسز، الفاظ شماری یا متنی تجزیاتی اسکرپٹس کے لیے تیار کریں جو سادہ متن مانگتے ہیں۔
معاون ٹیکنالوجی سے پڑھنا
دستاویز کا متن کسی ریڈر ایپ یا بڑے حروف والے ایڈیٹر میں کھولیں جو سادہ متن کو PDF سے بہتر سنبھالتا ہو۔
جاننے کے قابل حدود
PDF سے TXT صرف موجود متن نکالتا ہے، اس لیے اسکین کو پہلے OCR درکار ہے۔ کئی کالموں والے لے آؤٹ کی ترتیب بدل سکتی ہے، دہرائے گئے ہیڈرز اور فوٹرز شامل ہوتے ہیں، اور تمام فارمیٹنگ، ٹیبلز اور تصاویر نکل جاتی ہیں۔
PDF سے TXT: عام سوالات
میری ٹیکسٹ فائل خالی کیوں ہے؟
PDF میں متن کی تہہ نہیں، جو اسکین اور تصاویر میں عام ہے۔ PDF OCR چلائیں، پھر دوبارہ نکالیں۔
متن بے ترتیب کیوں ہے؟
کچھ PDF فائلیں حروف کو اس معلومات کے بغیر محفوظ کرتی ہیں کہ وہ کون سے حرف ہیں۔ PDF OCR صفحے کی تصویر سے متن دوبارہ بناتا ہے، جس سے عموماً یہ ٹھیک ہو جاتا ہے۔
کیا فارمیٹنگ برقرار رہتی ہے؟
نہیں۔ TXT فائل میں صرف سادہ حروف ہوتے ہیں، اس لیے بولڈ، فونٹس، ٹیبلز اور تصاویر پیچھے رہ جاتی ہیں۔
کون سی انکوڈنگ استعمال ہوتی ہے؟
فائل UTF-8 میں محفوظ ہوتی ہے، جسے ہر جدید ایڈیٹر پڑھتا ہے اور جو تمام زبانیں سپورٹ کرتی ہے۔