Ir al contenido
Allin

Extraer el texto de un PDF, y lo que la maquetación le hace

Publicado el 11/8/2026 · 15 min de lectura · Herramientas de archivos

Daniel Okonkwo

Daniel OkonkwoDesarrollador front-end y redactor de Tecnología en Allin

Rendimiento web · Formatos de archivo

Verificado con 3 fuentes

Ver perfil
En resumen

Un PDF no guarda líneas, ni párrafos, ni un orden de lectura. Guarda glifos en coordenadas de una página, así que toda extracción es una reconstrucción y son las reglas que aplica la herramienta las que deciden el resultado. Esta herramienta agrupa en líneas los glifos que comparten línea base y ofrece dos modos: «Conservar las líneas» reproduce la página tal como está maquetada, y «Unir en párrafos» vuelve a pegar las líneas cortadas, tomando el primer cuartil de las distancias entre líneas base como interlineado normal de la página y cualquier hueco superior a 1,35 veces ese valor como fin de párrafo. Medido sobre archivos reales: una página a dos columnas sale entrelazada en ambos modos — la línea izquierda y la derecha comparten línea base, se unen con un espacio y la prosa se vuelve ilegible. Una tabla conserva sus filas pero pierde sus columnas; las celdas quedan separadas por un solo espacio y una celda vacía desaparece sin más, de modo que una fila de cuatro columnas llega con tres valores y nada indica cuál falta. Las palabras partidas por un guion se vuelven a unir en modo párrafo («con-» más «cluded» da «concluded»), pero la regla es incondicional: un guion real de palabra compuesta al final de línea también se une, y «long-» más «term» da «longterm». Las ligaduras sí se tratan bien: fi y fl vuelven como pares de letras normales, no como el carácter único de ligadura. Los encabezados y pies repetidos se extraen en cada página: un decreto de 44 páginas produjo 44 copias de su encabezado, intercaladas en el texto. Un PDF escaneado no contiene texto alguno. La herramienta no devuelve nada y lo dice con claridad. No hace OCR, y no hay ningún paso de OCR escondido.

Un PDF guarda glifos en coordenadas: no líneas, no párrafos, no un orden de lectura. La extracción reconstruye el texto a partir de esas posiciones, y por eso dos columnas salen entrelazadas, una tabla pierde sus celdas y un escaneo no da nada. Medido ejecutando la herramienta.

Un PDF no tiene líneas: solo glifos en coordenadas

Este es el hecho del que se deriva todo lo demás, y casi ninguna guía lo dice con claridad. Una página PDF es una lista de instrucciones de dibujo. Una de ellas dice: coloca este glifo en este punto, con esta fuente, a este tamaño. En el archivo no hay ningún objeto que signifique «párrafo», ninguno que signifique «línea» y ninguno que registre qué bloque de texto debe leerse primero. El formato lo define la norma ISO 32000, y el orden de lectura sencillamente no forma parte de lo que lleva una descripción de página corriente.

Así que extraer es reconstruir, y ahí es donde cada herramienta difiere. Esta toma la serie de glifos que devuelve pdf.js, cada uno con su posición, y agrupa en una línea aquellos cuyas líneas base caen a menos de media altura de glifo entre sí. Dentro de una línea ordena de izquierda a derecha e inserta un espacio allí donde el hueco horizontal supera un quinto de la altura del glifo, porque un PDF que separa palabras moviendo el cursor no emite ningún carácter de espacio. Esa reconstrucción es buena. Y es también la razón de que los fallos de abajo tengan la forma que tienen: son todos casos en que la geometría de la página y la lógica del documento se contradicen.

Dos columnas: el fallo con el que te toparás primero

Se compuso una página a dos columnas con cuatro líneas en cada una y se extrajo. El resultado empieza así: «Revenue for the quarter rose by four Costs grew more slowly, at two per cent,». La primera mitad es la línea inicial de la columna izquierda; la segunda, la de la derecha. Comparten línea base, así que para la reconstrucción son una sola línea y se unen con un espacio.

Cambiar a «Unir en párrafos» lo empeora en lugar de arreglarlo. Las líneas entrelazadas quedan ahora pegadas en un único bloque de prosa donde cada frase está partida en dos por un fragmento de la otra columna. Peor aún: la reunión de palabras cortadas deja de funcionar. La columna izquierda terminaba una línea con «sub-», pero cuando la lógica de párrafo mira el búfer el guion ya no es el último carácter: el texto de la columna derecha se ha colado detrás. La salida dice «by the sub- reclassification of contractors into the scription business». La palabra «subscription» ha quedado partida en dos y las mitades están a once palabras de distancia.

No hay ajuste que arregle esto, porque arreglarlo significa detectar las columnas, y la detección de columnas es un problema genuinamente difícil que la herramienta no intenta. El apaño práctico es extraer página a página y cortar el resultado a mano, o aceptar que un artículo académico a dos columnas o una ley impresa necesitarán edición después de extraer, no antes.

Las tablas conservan sus filas y pierden sus columnas

Una tabla de cuatro columnas se extrajo limpiamente a nivel de fila: «Region Revenue Cost Margin», y luego «North 1,240 980 21%». Cada fila va en su propia línea y en el orden correcto. Lo que ha desaparecido es el límite de columna: las celdas quedan separadas por un solo espacio, igual que las palabras, así que nada en la salida distingue un fin de celda de un fin de palabra. Pega eso en una hoja de cálculo y obtienes una sola columna.

El problema más agudo es la celda vacía. Una tabla con una «Nota» en blanco en una fila y un «Proveedor» en blanco en otra produjo «Chair Nordia 89.00» y «Desk back-order 240.00»: cuatro columnas que llegan como tres valores, dos veces, sin nada que indique qué columna se saltó. Un lector que reconstruyera esa tabla a ojo pondría «back-order» en la columna Proveedor. Nada en el texto dice lo contrario. Y una celda cuyo contenido pasa a una segunda línea se convierte en su propia fila: la nota «discontinued, replacement pending» salió como «Lamp Vela discontinued, 15.00» seguida de una línea que solo dice «replacement pending».

En modo párrafo la tabla deja de ser una tabla. El conjunto volvió como una sola frase: «Region Revenue Cost Margin North 1,240 980 21% South 870 910 -5% East 2,310 1,760 24%». Si tu documento contiene una tabla que te importa, usa «Conservar las líneas», y cuenta con reconstruir las columnas tú mismo.

Guiones, ligaduras y el encabezado de cada página

La partición de palabras está resuelta, con una reserva. En modo párrafo, una línea que termina en guion pierde ese guion y se le pega directamente la siguiente, de modo que «con-» y «cluded» dan «concluded», y «re-» y «vised» dan «revised». Ambos casos se comprobaron en una página a una columna. Pero la regla es incondicional: se dispara con cualquier guion a final de línea, incluido el que pertenece a la palabra. En una página de prueba, «long-» a final de línea más «term» produjo «longterm», y «e-» más «mail» produjo «email». Ninguno es una errata del original: es la reparación disparándose de más.

Las ligaduras son la buena noticia, y vale la pena entenderlas porque rompen la búsqueda en las herramientas que las tratan mal. El fi de un tipógrafo suele ser un solo carácter en la fuente, y una fuente subconjunto lo devuelve a Unicode mediante una tabla que el PDF lleva consigo. Extrae de forma ingenua y obtienes U+FB01, idéntico en pantalla y sin coincidencias cuando buscas «file». El motor que hay debajo de esta herramienta normaliza por defecto: el mismo archivo de prueba devuelve «confirmed» y «fluently» como letras normales. Al volver a ejecutar el archivo idéntico con la normalización desactivada aparecieron los caracteres de ligadura, y así sabemos que es la normalización la que hace el trabajo.

Los encabezados y pies repetidos se extraen en todas y cada una de las páginas, y nada los quita. Un decreto consolidado español de 44 páginas entregó exactamente 44 copias de «LEGISLACIÓN CONSOLIDADA» y 44 líneas de número de página, dejadas en medio del texto corrido. En el archivo extraído, una frase se corta a media oración al pie de la página 5, le siguen un pie, un separador y dos líneas de encabezado, y continúa en la página 6. No es un defecto de la reconstrucción — el encabezado está realmente en la página — pero significa que cualquier documento largo exige una pasada de buscar y reemplazar para retirar el mobiliario antes de que el texto sirva.

Un PDF escaneado no contiene texto, y el OCR es otra operación

Esta es la decepción más frecuente, y merece una respuesta franca. Cuando una página se escanea o se fotografía, el PDF resultante contiene una imagen y nada más. No hay glifos, ni fuente, ni códigos de carácter: solo píxeles que a ti te parecen letras. La extracción no tiene nada que encontrar, y elegir otra disposición no cambia nada.

La herramienta lo dice, cosa que no todas hacen. Alimentada con una página que solo contiene una imagen, devolvió la cadena vacía y mostró una frase explicando que el archivo no tiene texto seleccionable y que casi con certeza es un escaneo sin capa de texto. No devuelve en silencio un cuadro de texto vacío, ni un cuadro que contenga solo separadores de página: el vacío se comprueba sobre el cuerpo de las páginas, no sobre la cadena ensamblada. Convertir un escaneo en texto exige reconocimiento óptico de caracteres, que lee los píxeles y adivina las letras. Esta herramienta no lo hace, y nada en ella lo hace discretamente por detrás.

Dos formas en que una página vuelve vacía, y qué se te dice

Primero: un intervalo que nombra páginas que el archivo no tiene. Escribe 99 en un documento de dos páginas y el analizador del intervalo descarta el número fuera de rango, con lo que no queda nada que extraer. Eso no es lo mismo que una página sin texto, y ya no recibe la misma respuesta: el mensaje indica cuántas páginas tiene realmente el documento y te pide corregir el intervalo o vaciarlo. Medido sobre un archivo de dos páginas al que se le pide la página 99: «Ninguna de las páginas que pediste existe en este documento: tiene 2 página(s).» Un intervalo que se pasa del final en lugar de empezar después de él simplemente se recorta: pedir 1-3 en ese mismo archivo extrae las dos páginas sin decir nada.

Segundo: un documento que mezcla páginas escritas con una hoja escaneada — una página firmada, un fax, un certificado fotografiado e insertado. Esa página no lleva capa de texto, así que vuelve vacía mientras el resto del documento se extrae sin problema. Es el caso que pasaba en silencio, porque el vacío se comprobaba sobre el documento entero y las páginas escritas bastaban para satisfacerlo: la página escaneada quedaba reducida a un separador sin nada debajo, y a nada en absoluto con los separadores desactivados. El vacío se mide ahora página a página. En un archivo de prueba de cuatro páginas cuya segunda era una imagen, la extracción devolvió las otras tres y, encima, una línea ámbar que decía «1 página(s) no llevan texto seleccionable y salen vacías: 2»; con las páginas 2 y 4 como imágenes, la misma línea nombró «2, 4». Es un aviso, no un rechazo: el texto que sí obtuviste sigue siendo tuyo. Lo que te indica es qué páginas necesitan reconocimiento óptico de caracteres y no un segundo intento.

Qué hace cada modo de disposición con un elemento de página — medido sobre la herramienta, agosto de 2026
Elemento de página«Conservar las líneas»«Unir en párrafos»
Dos columnasLínea izquierda y derecha unidas por un espacio, en cada líneaEl mismo entrelazado, luego pegado en un bloque continuo
Fila de tablaUna línea por fila, celdas separadas por un solo espacioLa tabla entera se convierte en una sola frase
Celda de tabla vacíaDesaparece: una fila de cuatro columnas llega como tres valoresDesaparece, y el límite de fila también
Palabra partida por un guionSigue partida: «con-» y luego «cluded»Se une correctamente: «concluded»
Guion de palabra compuesta a final de líneaSe conserva tal cualSe une por error: «long-» + «term» da «longterm»
Ligadura fi / flPares de letras normales, buscablesPares de letras normales, buscables
Encabezado y pie repetidosUna copia por página, dentro del textoUna copia por página, como párrafo aparte
Página escaneada (solo imagen)Nada: la página se nombra en un aviso encima del textoNada: el mismo aviso
PDF a textoExtrae el texto de un PDF y descárgalo como archivo .txt.Probar la herramienta

Preguntas frecuentes

¿Por qué mi PDF a dos columnas sale ilegible?
Porque la línea izquierda y la derecha están impresas a la misma altura, y la reconstrucción agrupa por altura. No tiene forma de saber que la página está dividida en dos zonas de lectura: un PDF no lo registra. Así que lee de lado a lado, une los dos fragmentos con un espacio y baja. Ambos modos lo hacen; el modo párrafo lo agrava después pegando las líneas entrelazadas. Si necesitas texto limpio de un documento a dos columnas, extrae página a página y separa las columnas a mano, o busca una versión del documento que nunca se maquetó en columnas.
¿Puede leer un PDF escaneado y hace OCR?
No, y no. Un PDF escaneado contiene una imagen de página y ningún objeto de texto, así que no hay nada que extraer; la herramienta no devuelve nada y te indica que el archivo es casi con certeza un escaneo sin capa de texto. El reconocimiento óptico de caracteres es otra operación: mira los píxeles y adivina qué letras representan, de ahí que pueda equivocarse y que necesite saber en qué idioma lee. Esta herramienta no lo hace, no lo ofrece y no lo intenta a escondidas. Una prueba rápida antes de subir nada: abre el archivo en cualquier lector e intenta seleccionar una frase. Si el resaltado no sigue las palabras, ninguna herramienta de extracción ayudará.
Dice que no hay texto, pero yo puedo seleccionarlo en mi lector. ¿Por qué?
Comprueba primero el intervalo de páginas. El campo acepta cualquier cosa y descarta en silencio los números que el documento no tiene, así que pedir la página 99 de un archivo de diez no deja nada que extraer — y el mensaje que recibes dice justo eso, indicando cuántas páginas tiene realmente el documento, en lugar de llamar escaneo a tu archivo. Vacía el campo y vuelve a ejecutarlo. La otra posibilidad es que las páginas seleccionadas sean precisamente las escaneadas: un documento puede mezclar páginas escritas con una hoja escaneada, y si solo pediste esa hoja, no hay nada en ella. Pide el documento entero. Se extrae toda página que lleve texto, y las que vuelven vacías se nombran en un aviso encima del resultado, de modo que ves cuáles necesitan reconocimiento óptico de caracteres.
¿Qué modo de disposición debo elegir?
Elige «Conservar las líneas» siempre que la disposición de la página tenga significado: tablas, formularios, facturas, cualquier cosa con columnas y cualquier documento que vayas a revisar línea por línea. Elige «Unir en párrafos» solo para prosa corrida a una columna que vayas a pegar en un documento, donde las líneas cortadas estorban en lugar de informar. El modo párrafo es el que repara las palabras partidas, así que produce una prosa realmente mejor — en el tipo de página adecuado. En el inadecuado destruye la estructura de forma irreversible, y no puedes recuperarla desde la salida: hay que volver a extraer.
¿Quita el encabezado y el pie que se repiten en cada página?
No. Cada elemento repetido sale una vez por página, y en un documento largo eso es mucho ruido: un decreto de 44 páginas produjo 44 copias de su línea de encabezado y 44 líneas de número de página, colocadas entre las frases que interrumpen. Quitarlas de forma fiable exigiría reconocer que una línea es mobiliario y no contenido, un juicio que la herramienta no hace. El remedio práctico es un buscar y reemplazar en un editor de texto tras la extracción: el encabezado es una cadena repetida idéntica, así que una sola sustitución los borra todos. Hazlo antes de contar palabras o de alimentar cualquier otra cosa, o el mobiliario repetido contará como contenido.

Artículos que podrían interesarte

Todas las guías
TutorialConvertir un PDF en imágenes cuando un sitio rechaza los PDFMarketplaces, portales de empleo y formularios de soporte suelen aceptar solo JPEG y PNG. Convertir es fácil; elegir la resolución es lo que decide si el destinatario podrá leer tu documento, y es lo que todas las herramientas te preguntan sin que nadie lo explique.TutorialExtraer unas páginas de un extracto sin instalar nadaUn casero quiere la página 3. Un contable quiere enero. Tienes que enviar esas páginas y no las otras once, y hay una trampa: el método obvio deja las páginas quitadas dentro del archivo que envías.TutorialConvertir notas en un PDF que merezca archivarseEl texto plano no tiene maquetación, así que cualquier conversor tiene que inventarte una. Aquí están exactamente las decisiones que toma este — página, márgenes, tipografía, saltos de línea —, lo que hace con un tabulador y con una línea larga, y lo que tienes que añadir tú antes de que una nota merezca guardarse.ExplicaciónTu PDF se ve derecho para ti y de lado para ellosGiraste el escaneo, lo guardaste, y el destinatario lo abrió igualmente de lado. Nada está roto: la rotación en un PDF es una instrucción y no un cambio en la página, y las instrucciones pueden ignorarse. Aquí está cuándo ocurre y cómo producir un archivo que no se pueda malinterpretar.TutorialCómo bajar un PDF de una limitación de 10 MBEl formulario rechaza tu archivo y no da ningún consejo. Lo que funciona depende por completo de dónde están realmente los megabytes, y para un documento escaneado la respuesta no es la compresión sino la resolución. Así sabrás en diez segundos en qué caso estás.TutorialDevolver un documento escaneado al orden en que se imprimióUn escáner a doble cara que tomó un lado cada vez, una pila metida al revés, una página que salió dos veces. Reordenar no es la misma operación que extraer páginas, y saber cuál haces te dice qué pasa con todo lo que no es una página.

Herramientas relacionadas

Todo lo descrito aquí se midió en agosto de 2026 ejecutando estas herramientas sobre archivos reales, no deduciendo lo que una herramienta PDF debería hacer. El comportamiento de los PDF no es uniforme: el formato lo define la norma ISO 32000, pero el orden de lectura, las convenciones de metadatos y las cajas de página son lugares donde dos herramientas aparentemente correctas discrepan, y un archivo escrito por un productor poco habitual puede comportarse de forma distinta a todos los probados aquí. Antes de aplicar cualquiera de estos procesos a un documento que no puedas reemplazar, trabaja sobre una copia y abre el resultado en un lector de tu confianza.

Fuentes

¿Has detectado un error en este artículo?