PDF کا سائز کہاں سے آتا ہے
PDF کے اندر متن بہت کم جگہ لیتا ہے: ٹائپ شدہ الفاظ کے سو صفحات ایک تصویر سے بھی کم جگہ لے سکتے ہیں۔ فائلوں کو بھاری تصاویر بناتی ہیں، خاص طور پر وہ تصاویر جو ضرورت سے زیادہ ریزولوشن یا رنگوں کی گہرائی میں محفوظ ہوں۔ اسکین شدہ دستاویز انتہائی مثال ہے، کیونکہ ہر صفحہ پورے صفحے کی تصویر ہوتا ہے، چاہے اس میں صرف سفید کاغذ پر سیاہ متن ہو۔ شامل فونٹس اور بہت سی ویکٹر ڈرائنگز کچھ وزن بڑھاتی ہیں، مگر شاذ ہی اتنا کہ فرق پڑے۔ اس لیے کسی بھی بڑی PDF کے بارے میں پہلا سوال یہ ہے کہ کیا اس میں تصاویر زیادہ ہیں۔ اگر ہاں، تو کمپریشن اور گرے اسکیل میں تبدیلی بہت مدد کریں گی؛ اگر زیادہ تر متن ہے تو بہت کم مدد کریں گی، اور تقسیم کرنا بہتر جواب ہو سکتا ہے۔ PDF کا سائز کم کرنے کی گائیڈ ریزولوشن، JPEG معیار اور فونٹس کی تفصیل میں جاتی ہے۔
کمپریشن ٹول کا انتخاب
PDF کمپریس کریں تین سطحیں دیتا ہے۔ Ghostscript والے سرور پر یہ تصاویر کو تقریباً 72، 150 یا 300 DPI تک کم کرتی ہیں؛ اس کے بغیر صرف وہ تصاویر دوبارہ کمپریس ہوتی ہیں جو ہر سطح کی ریزولوشن حد سے اوپر ہوں۔ متن اور ویکٹر گرافکس کبھی تصاویر میں نہیں بدلتے، اور اگر نتیجہ اصل سے چھوٹا نہ ہو تو اصل فائل واپس کر دی جاتی ہے۔ مقررہ سائز تک کمپریس کریں اس کے بجائے ایک سخت حد کی طرف کام کرتا ہے، تقریباً 150 DPI سے 55 DPI کی طرف بتدریج مضبوط سیٹنگز آزماتا ہے اور حد میں آنے والی پہلی کوشش پر رک جاتا ہے۔ اگر کوئی حد میں نہ آئے تو آپ کو سب سے چھوٹا ورژن ملتا ہے، اس لیے ہمیشہ آخری سائز جانچیں۔ رنگین اسکین کیے گئے بلیک اینڈ وائٹ کاغذات کے لیے PDF کو گرے اسکیل کریں بے فائدہ ڈیٹا ہٹاتا ہے، اور جب حد پڑھنے کے قابل صفحات کے لیے بہت ہی کم ہو تو دستاویز تقسیم کرنا ہی دیانت دارانہ حل ہے۔
اسکین شدہ دستاویزات متن کی تصاویر ہیں
اسکین دستاویز جیسا دکھائی دیتا ہے مگر تصویر کی طرح برتاؤ کرتا ہے: آپ اس میں تلاش نہیں کر سکتے، کوئی جملہ کاپی نہیں کر سکتے اور اسکرین ریڈر سے بلند آواز میں نہیں پڑھوا سکتے۔ PDF OCR ہر صفحے کی تصویر میں الفاظ پہچان کر ان کے پیچھے ایک پوشیدہ متن کی تہہ رکھ کر یہ بدل دیتا ہے۔ صفحات اپنی تصویر رکھتے ہیں، اور جن صفحات میں پہلے سے متن ہو وہ ویسے ہی رہتے ہیں، اس لیے ملی جلی فائل پوری کی پوری اس سے گزاری جا سکتی ہے۔ شناخت زبان کے ماڈل پر مبنی ہے، اس لیے دستاویز کی زبان منتخب کرنا کسی بھی دوسری سیٹنگ سے زیادہ اہم ہے۔ قابلِ تلاش PDF کی گائیڈ متن کی تہوں، آرکائیو اور رسائی کے لیے ان کی اہمیت، اور یہ جاننے کا طریقہ بتاتی ہے کہ کسی PDF میں پہلے سے تہہ موجود ہے یا نہیں۔
شناخت سے پہلے اسکین صاف کرنا
OCR کی درستی صاف ان پٹ پر منحصر ہے، اور دو ٹولز اسے تیار کرتے ہیں۔ خالی صفحات حذف کریں چمک اور سیاہی کی کوریج ناپ کر تقریباً خالی صفحات ڈھونڈتا ہے، متن والے صفحات ہمیشہ رکھتا ہے اور آپ کو شناخت کی سختی چننے دیتا ہے۔ PDF سیدھی کریں ہر صفحے کا جھکاؤ ناپ کر اسے سیدھا کرتا ہے، جس سے شناخت نمایاں طور پر بہتر ہوتی ہے، کیونکہ OCR متن کی سیدھی لکیروں کی توقع رکھتا ہے۔ سیدھا کرنا ہر صفحہ دوبارہ بنانے کے بجائے گھماتا ہے، اس لیے اسکین اپنی تفصیل رکھتا ہے، اور یہ OCR سے پہلے آتا ہے تاکہ شناخت سیدھی سطریں پڑھے۔ اسکین کے ڈھیر کے لیے قابلِ اعتماد ترتیب یہ ہے: خالی صفحات حذف کریں، سیدھا کریں، OCR چلائیں اور آخر میں کمپریس کریں۔ اسکین کے معیار کی گائیڈ تصویر لینے کے پہلو کا احاطہ کرتی ہے، جہاں زیادہ تر مسائل سے بچا جا سکتا ہے۔
نہ کھلنے والی فائلوں کی مرمت
جو PDF خرابی، خالی صفحات یا نقصان کی وارننگ دکھائے اس کا اکثر اندرونی انڈیکس ٹوٹا ہوتا ہے، مواد غائب نہیں ہوتا۔ PDF مرمت کریں فائل کو MuPDF سے کھولتا ہے، جو فائل کو اسکین کر کے یہ انڈیکس دوبارہ بناتا ہے، اور ایک نئی، مربوط نقل لکھتا ہے۔ جب MuPDF فائل بالکل نہ پڑھ سکے اور Ghostscript دستیاب ہو تو دوسری کوشش پوری دستاویز دوبارہ لکھتی ہے۔ مگر مرمت کی ایک واضح حد ہے: یہ موجود ڈیٹا ہی سے کام کرتی ہے۔ آدھے میں رک جانے والے ڈاؤن لوڈ کے باقی صفحات غائب ہوتے ہیں، اور کوئی ٹول انہیں دوبارہ نہیں بنا سکتا، اس لیے فائل دوبارہ ڈاؤن لوڈ کرنا عموماً کسی بھی مرمت سے تیز ہوتا ہے۔ مرمت شدہ فائلیں PDF/A میں تبدیلی کے ذریعے آرکائیو کرنے کا اچھا نقطۂ آغاز ہیں۔
ویب کے لیے PDF تیار کرنا
ویب سائٹ پر شائع ہونے والی دستاویزات کی اضافی ضروریات ہوتی ہیں۔ بڑی فائلوں کو جلدی کھلنا چاہیے، اور ویب کے لیے PDF بہتر بنائیں فائل کو لینیرائز کر کے اس میں مدد دیتا ہے تاکہ باقی حصہ آنے سے پہلے براؤزر پہلا صفحہ دکھا دیں، بشرطیکہ ویب سرور بائٹ رینج درخواستیں قبول کرے، جیسا کہ تقریباً سب کرتے ہیں۔ سائز پھر بھی اہم ہے، اس لیے پہلے کمپریس کریں۔ شائع شدہ PDF سرچ انجنوں اور اسکرین ریڈرز کے لیے بھی پڑھنے کے قابل ہونی چاہییں، یعنی اسکین کو OCR کی ضرورت ہے، اور ان کا عنوان کسی بچے ہوئے ٹیمپلیٹ کے نام کے بجائے مناسب ہونا چاہیے؛ یہ میٹا ڈیٹا دیکھیں اور ایڈٹ کریں سے مقرر کریں۔ یہ اقدامات مل کر دستاویز کو جلدی کھلنے والا، آسانی سے ملنے والا اور زیادہ قابلِ رسائی بناتے ہیں، اس کے مواد کو بدلے بغیر۔
نتیجہ جانچنا
بہتری میں ہمیشہ کچھ لین دین ہوتا ہے، اس لیے نتیجہ ویسے جانچیں جیسے وصول کنندہ دیکھے گا۔ کمپریشن کے بعد سب سے باریک متن اور کسی بھی دستخط کو 200 فیصد پر زوم کریں۔ OCR کے بعد کوئی ایسا لفظ تلاش کریں جو صفحے پر نظر آ رہا ہو۔ خالی صفحات ہٹانے کے بعد صفحات کی تعداد کی تصدیق کریں اور سرسری نظر ڈالیں کہ کچھ غائب تو نہیں۔ مطمئن ہونے تک اصل فائلیں رکھیں، کیونکہ ہر ٹول نئی نقل بناتا ہے اور سرور پر پروسیس شدہ فائل آپ کا ڈاؤن لوڈ مکمل ہوتے ہی حذف ہو جاتی ہے۔ بہتر بنانے والے کچھ ٹولز ایسے انجنوں پر منحصر ہیں جو ہر سرور پر نصب نہیں ہوتے، جیسے Ghostscript یا Tesseract؛ جب کوئی انجن موجود نہ ہو تو ٹول خاموشی سے کام چھوڑ کر فائل دینے کے بجائے صاف بتا دیتا ہے۔
عام ورک فلو
اپ لوڈ پورٹل کے لیے اسکین چھوٹا کریں
دو طرفہ اسکین کی خالی پشت ہٹائیں، رنگین کاغذات کو گرے اسکیل میں بدلیں، پھر پورٹل کی عین سائز حد تک کمپریس کریں۔
اسکین کے آرکائیو کو قابلِ تلاش بنائیں
ترچھے صفحات سیدھے کریں، درست زبان میں قابلِ تلاش متن کی تہہ شامل کریں اور نتیجہ کمپریس کریں تاکہ آرکائیو سنبھالنے کے قابل رہے۔
خراب رپورٹ بچا کر شائع کریں
نہ کھلنے والی PDF دوبارہ بنائیں، اس کی تصاویر کا وزن کم کریں اور اسے لینیرائز کریں تاکہ آپ کی ویب سائٹ سے جلدی کھلے۔
بڑی دستاویز ای میل سے بھیجیں
پہلے فائل کمپریس کریں، اور اگر پھر بھی اٹیچمنٹ کی حد سے بڑی ہو تو اسے ایسے حصوں میں تقسیم کریں جو الگ الگ حد میں آئیں۔
PDF بہتر بنانے کے بارے میں سوالات
میری PDF اتنی بڑی کیوں ہے؟
تقریباً ہمیشہ تصاویر کی وجہ سے، خاص طور پر اسکین شدہ صفحات یا ہائی ریزولوشن تصاویر۔ صرف متن والی PDF چھوٹی ہوتی ہیں، اس لیے بڑی فائل میں عموماً تصاویر زیادہ ہوتی ہیں۔
کیا کمپریشن میرا متن دھندلا کر دے گی؟
اصل متن واضح رہتا ہے کیونکہ صرف تصاویر دوبارہ کمپریس ہوتی ہیں۔ اسکین کا حصہ بننے والا متن تصویر ہے، اس لیے کم سیٹنگز پر دھندلا ہوتا ہے۔
OCR کمپریس کرنے سے پہلے چلاؤں یا بعد میں؟
پہلے OCR چلائیں، پھر کمپریس کریں، کیونکہ شناخت اسکین کے سب سے واضح نسخے پر بہترین کام کرتی ہے۔
کیا میں اسکین کی شکل بدلے بغیر اسے قابلِ تلاش بنا سکتا ہوں؟
جی ہاں۔ OCR ہر صفحہ جیسا تھا ویسا رکھتا ہے اور پہچانے گئے الفاظ اس کے اوپر پوشیدہ متن کے طور پر شامل کرتا ہے۔
بہتر بنانے والے کچھ ٹولز دستیاب کیوں نہیں؟
مقررہ سائز تک کمپریشن، OCR اور ویب کے لیے بہتری Ghostscript یا Tesseract پر منحصر ہیں۔ انجن کے بغیر سرور بتاتا ہے کہ کون سا غائب ہے۔
کیا بہتر بنانا میری اصل فائل بدلتا ہے؟
نہیں۔ ہر ٹول نئی نقل واپس کرتا ہے، اور سرور پر عارضی نقل آپ کا ڈاؤن لوڈ مکمل ہونے کے بعد حذف ہو جاتی ہے۔