De dónde viene el tamaño de un PDF
El texto ocupa muy poco dentro de un PDF: cien páginas de texto mecanografiado pueden ocupar menos que una sola fotografía. Lo que hace pesados los archivos son las imágenes, y en particular las imágenes guardadas con más resolución o profundidad de color de la que nadie necesita. Un documento escaneado es el caso extremo, porque cada página es una imagen de página completa, aunque solo muestre texto negro sobre papel blanco. Las fuentes incrustadas y los dibujos vectoriales en gran cantidad añaden algo de peso, pero rara vez lo suficiente como para importar. Así que la primera pregunta ante cualquier PDF demasiado grande es si está cargado de imágenes. Si lo está, la compresión y la conversión a escala de grises ayudarán mucho; si es sobre todo texto, ayudarán muy poco, y dividirlo puede ser mejor solución. La guía para reducir el tamaño de un PDF trata en detalle la resolución, la calidad JPEG y las fuentes.
Elegir una herramienta de compresión
Comprimir PDF ofrece tres niveles. En un servidor con Ghostscript reducen las imágenes a unos 72, 150 o 300 DPI; sin él, solo se recomprimen las imágenes que superan el umbral de resolución de cada nivel. El texto y los gráficos vectoriales nunca se convierten en imágenes, y si el resultado no fuera más pequeño que el original, se devuelve el original. Comprimir a un tamaño trabaja en cambio hacia un límite estricto: prueba ajustes cada vez más fuertes, desde unos 150 DPI hasta cerca de 55 DPI, y se detiene en el primer intento que cabe. Si ninguno cabe, recibes la versión más pequeña, así que comprueba siempre el tamaño final. Para documentos en blanco y negro escaneados en color, PDF en escala de grises elimina datos que no aportan nada, y cuando un límite es simplemente demasiado pequeño para páginas legibles, dividir el documento es la solución honesta.
Los documentos escaneados son fotos de texto
Un escaneo parece un documento, pero se comporta como una fotografía: no puedes buscar en él, copiar una frase ni hacer que un lector de pantalla lo lea en voz alta. OCR PDF lo cambia reconociendo las palabras de cada imagen de página y colocando una capa de texto invisible detrás. Las páginas conservan su propia imagen y las que ya contienen texto se dejan tal cual, así que un archivo mixto puede pasar entero. El reconocimiento usa un modelo de idioma, así que elegir el idioma del documento importa más que cualquier otro ajuste. La guía sobre PDF buscables explica las capas de texto, por qué importan para archivos y accesibilidad, y cómo saber si un PDF ya tiene una.
Limpiar los escaneos antes del reconocimiento
La precisión del OCR depende de una entrada limpia, y dos herramientas la preparan. Eliminar páginas en blanco encuentra las páginas casi vacías midiendo el brillo y la cobertura de tinta, conserva siempre las páginas que ya contienen texto y te deja elegir lo estricta que es la detección. Enderezar PDF mide la inclinación de cada página y la nivela, lo que mejora notablemente el reconocimiento, porque el OCR espera líneas de texto rectas. Enderezar gira cada página en lugar de redibujarla, así que el escaneo conserva su detalle, y va antes del OCR para que el reconocimiento lea líneas rectas. Una secuencia fiable para un montón de escaneos es: eliminar páginas en blanco, enderezar, ejecutar el OCR y comprimir al final. La guía sobre la calidad del escaneo trata la parte de la captura, donde se pueden prevenir la mayoría de los problemas.
Reparar archivos que no se abren
Un PDF que muestra un error, páginas en blanco o un aviso de daño suele tener roto su índice interno, no el contenido. Reparar PDF abre el archivo con MuPDF, que reconstruye ese índice recorriendo el archivo, y escribe una copia nueva y coherente. Cuando MuPDF no puede leer el archivo en absoluto y Ghostscript está disponible, un segundo intento reescribe todo el documento. Pero la reparación tiene un límite claro: trabaja con los datos que existen. Una descarga que se cortó a la mitad no tiene las páginas restantes y ninguna herramienta puede reconstruirlas, así que volver a descargar el archivo suele ser más rápido que cualquier reparación. Los archivos reparados son un buen punto de partida para archivarlos con la conversión a PDF/A.
Preparar PDF para la web
Los documentos publicados en un sitio web tienen requisitos adicionales. Los archivos grandes deben abrirse rápido, y Optimizar PDF para web ayuda linealizando el archivo para que los navegadores muestren la primera página antes de que llegue el resto, siempre que el servidor web admita solicitudes por rangos de bytes, como casi todos. El tamaño sigue importando, así que comprime primero. Los PDF publicados también deben poder leerlos los buscadores y los lectores de pantalla, lo que significa que los escaneos necesitan OCR, y deben llevar un título razonable en lugar del nombre de una plantilla olvidada; ajústalo con Ver y editar metadatos. Juntos, estos pasos hacen que un documento se abra más rápido, se encuentre con más facilidad y sea más accesible, sin cambiar lo que dice.
Revisar el resultado
Optimizar siempre implica compromisos, así que revisa el resultado como lo haría el destinatario. Tras comprimir, amplía al 200 por ciento el texto más pequeño y cualquier firma. Tras el OCR, busca una palabra que veas en una página. Tras eliminar páginas en blanco, confirma el número de páginas y repasa por si falta algo. Guarda los originales hasta quedar conforme, porque cada herramienta genera una copia nueva y el archivo procesado en el servidor se elimina en cuanto termina la descarga. Algunas herramientas de optimización dependen de motores que no todos los servidores tienen instalados, como Ghostscript o Tesseract; cuando falta uno, la herramienta lo dice claramente en lugar de devolver un archivo en el que se omitió el trabajo sin avisar.
Flujos de trabajo habituales
Reducir un escaneo para un portal de subida
Quita los reversos en blanco de un escaneo a doble cara, convierte a escala de grises los documentos en color y comprime hasta el límite exacto de tamaño del portal.
Hacer buscable un archivo de escaneos
Endereza las páginas torcidas, añade una capa de texto buscable en el idioma correcto y comprime el resultado para que el archivo siga siendo manejable.
Recuperar y publicar un informe dañado
Reconstruye un PDF que no se abre, reduce el peso de sus imágenes y linealízalo para que se abra rápido desde tu sitio web.
Enviar un documento grande por correo
Comprime primero el archivo y, si sigue superando el límite de adjuntos, divídelo en partes que quepan cada una.
Preguntas sobre cómo optimizar PDF
¿Por qué mi PDF es tan grande?
Casi siempre por las imágenes, sobre todo páginas escaneadas o fotos de alta resolución. Los PDF de solo texto son pequeños, así que un archivo grande suele estar cargado de imágenes.
¿La compresión hará que mi texto se vea borroso?
El texto real se mantiene nítido porque solo se recomprimen las imágenes. El texto que forma parte de un escaneo es una imagen, así que se suaviza con los ajustes más bajos.
¿Debo hacer el OCR antes o después de comprimir?
Haz primero el OCR y después comprime, porque el reconocimiento funciona mejor con la versión más nítida del escaneo.
¿Puedo hacer buscable un escaneo sin cambiar su aspecto?
Sí. El OCR conserva cada página tal como era y añade encima las palabras reconocidas como texto invisible.
¿Por qué algunas herramientas de optimización no están disponibles?
La compresión a un tamaño, el OCR y la optimización para web dependen de Ghostscript o Tesseract. Un servidor sin el motor indica cuál falta.
¿Optimizar cambia mi archivo original?
No. Cada herramienta devuelve una copia nueva, y la copia temporal del servidor se elimina cuando termina la descarga.