Convertir notas en un PDF que merezca archivarse
Publicado el 13/7/2026 · 20 min de lectura · Herramientas de archivos
Daniel Okonkwo — Desarrollador front-end y redactor de Tecnología en Allin
Rendimiento web · Formatos de archivo
Verificado con 5 fuentes
Un archivo .txt contiene caracteres y saltos de línea y nada más: ni página, ni margen, ni tipografía, ni idea de dónde debería acabar una página y empezar la siguiente. Convertirlo en PDF significa por tanto inventar una maquetación, y lo único honesto que puede hacer un conversor es decirte cuál inventó. Este pone tu texto en A4 a 595,28 por 841,89 puntos, que son exactamente 210 por 297 milímetros, con un margen de 56 puntos alrededor que deja una columna de texto de 483,28 puntos de ancho, unos 170 milímetros. Usa Helvetica al tamaño que elijas entre 8 y 28 puntos, 12 por defecto, con un interlineado de 1,42 veces el tamaño. A 12 puntos eso da 17,04 puntos por línea y 43 líneas en una página; a 8 puntos, 65 líneas; a 28 puntos, 19. Pliega cada una de tus líneas por los espacios para no cortar nada a mitad de palabra. Conviene conocer tres límites antes de pegar nada. Helvetica es proporcional, no de ancho fijo, así que en la misma línea caben 181 letras estrechas o solo 48 anchas, y cualquier cosa que hubieras dispuesto en columnas no cuadrará. Una única palabra más larga que la columna — una dirección web larga, una huella, un bloque codificado — no se parte nunca: se sale por el borde derecho de la página y se pierde sin más. Y el texto se escribe en una codificación de un byte, así que todo carácter por encima de U+00FF se convierte en un signo de interrogación: las letras acentuadas de los seis idiomas de este sitio sobreviven, pero el símbolo €, las comillas curvas, las rayas, los puntos suspensivos y toda escritura no latina, no. Un tabulador es peor que perdido: no se puede codificar en absoluto y hace fallar la conversión con un error genérico. Sustituye los tabuladores por espacios antes de pegar, y la herramienta hace el resto.
El texto plano no tiene maquetación, así que cualquier conversor tiene que inventarte una. Aquí están exactamente las decisiones que toma este — página, márgenes, tipografía, saltos de línea —, lo que hace con un tabulador y con una línea larga, y lo que tienes que añadir tú antes de que una nota merezca guardarse.
El texto plano no tiene maquetación, así que el conversor tiene que inventar una
Es fácil olvidar lo poco que contiene realmente un archivo .txt. Es una secuencia de caracteres, algunos de los cuales marcan el final de una línea, y ese es todo el contenido. No hay página dentro, porque no existe la noción de página. Ni tipografía, ni tamaño, ni margen, ni sangría, ni negrita, ni título. Cuando miras un archivo de texto parece tener una forma, pero esa forma pertenece a la ventana desde la que lo miras: estrecha la ventana y la forma cambia, porque es tu editor el que pliega las líneas, en vivo, sin guardar nada de eso.
Un PDF es el objeto de naturaleza inversa. Describe exactamente dónde se sitúa cada trozo de texto en una página de dimensiones fijas, y por eso se ve igual en todas partes y se imprime sin sorpresas. Pasar de uno a otro exige por tanto aportar toda la información que el archivo de texto no tiene. No hay una respuesta correcta sobre cuál debería ser, solo un conjunto de decisiones defendibles, y un conversor que oculta sus decisiones no está siendo modesto: te está impidiendo predecir lo que vas a obtener.
Así que aquí están, leídas en el código fuente en vez de adivinadas. La página es A4, 595,28 por 841,89 puntos; un punto es un setentaidosavo de pulgada, así que son 210 por 297 milímetros con dos decimales, exactamente la definición de la ISO 216. El margen es de 56 puntos por cada lado, unos 19,8 milímetros, dejando una columna de texto de 483,28 puntos, es decir 170,5 milímetros de ancho. El interlineado es 1,42 veces el cuerpo, o sea 17,04 puntos en el cuerpo 12 por defecto. La primera línea base queda 68 puntos por debajo del borde superior y la última unos 58 puntos por encima del inferior, lo bastante cerca de la simetría para que nadie lo note. Caben cuarenta y tres líneas en cuerpo 12, 65 en cuerpo 8, 47 en cuerpo 11, 37 en cuerpo 14 y 19 en el máximo de 28.
Helvetica es proporcional, y eso decide para qué sirve esta herramienta
En una tipografía de ancho fijo, cada carácter ocupa el mismo espacio horizontal, propiedad que hace que las columnas cuadren sin esfuerzo: pon un valor en la vigésima posición de cada línea y aparece en el mismo sitio en todas. Helvetica no es de esa familia. Medido en la columna de texto de la propia herramienta a 12 puntos, una i minúscula mide 2,66 puntos de ancho y caben 181 en una línea; una M mayúscula mide 10 puntos y solo caben 48. Es una razón de casi cuatro a uno entre el carácter más estrecho y el más ancho en la misma línea.
La consecuencia práctica es inequívoca. Todo aquello cuyo sentido depende de la posición horizontal — una tabla alineada con espacios, un registro con marcas de tiempo alineadas, un listado de código con bloques indentados, una factura con una columna de importes a la derecha — sale desdentado. Ni corrupto, ni ilegible, simplemente ya no alineado, y después de ver una página así no querrás archivarla. La prosa, en cambio, es exactamente aquello para lo que existe una tipografía proporcional: a 12 puntos una frase mixta promedia 5,58 puntos por carácter, así que caben unos 86 caracteres por línea y cerca de 3 700 por página, lo que se lee tan cómodamente como lo compondría cualquier procesador de textos.
La tipografía importa por una segunda razón, que solo aparece el día en que alguien abra el archivo dentro de veinte años. Helvetica es una de las catorce fuentes base que todo lector de PDF está obligado a proporcionar desde que se publicó el formato, así que se referencia por su nombre y sus contornos no se guardan en el archivo. Por eso un PDF de una página producido por esta herramienta pesa menos de un kilobyte: contiene tu texto, una descripción de página y un puntero a una tipografía que se presupone que el lector ya tiene. Se muestra en todas partes hoy y casi con seguridad se mostrará en todas partes mañana, pero es una dependencia de algo externo al archivo, y a las normas de archivo eso les importa. Vamos a ello.
Tres cosas que se rompen, y qué hacer con cada una
El tabulador es el caso afilado, así que va primero. El texto se escribe en el PDF con una codificación de un byte que no tiene casilla para un carácter de tabulación, y la conversión no lo omite ni lo convierte en espacios: se detiene. Lo que ves es el mensaje genérico de la herramienta diciendo que no pudo crear el PDF, sin indicación alguna del motivo, y lo mismo ocurre con un salto de página y con todo el rango de caracteres de control que un archivo de registro o una captura de terminal pueden contener sin que lo sepas. Es un defecto y se está notificando como tal. Hasta que se corrija, el rodeo cuesta cinco segundos: busca y reemplaza cada tabulador por dos, cuatro u ocho espacios en un editor de texto antes de pegar. Como la tipografía es proporcional, las columnas no iban a cuadrar de todos modos, así que la sustitución no hace perder nada.
La segunda es la línea demasiado larga para partirse. El mecanismo de plegado busca espacios; cuando no encuentra ninguno, se rinde y escribe la palabra entera en una sola línea, por ancha que se vuelva. Una dirección web de 180 caracteres a 12 puntos mide 1 177,7 puntos y termina en la posición horizontal 1 233,7 en una página que solo tiene 595,28, así que más de medio metro queda fuera del papel. No se recorta con puntos suspensivos, no se pasa a la línea siguiente y no se avisa: sencillamente se dibuja donde nadie puede verlo. Las URL largas, los resúmenes criptográficos, los bloques codificados y el código minificado son las víctimas habituales. Pártelos a mano por una barra o un guion antes de convertir, y comprueba el margen derecho del PDF terminado antes de archivarlo.
El tercero es el carácter que la codificación no puede sostener. Todo lo que llega hasta U+00FF pasa, lo que cubre las letras acentuadas de los seis idiomas en que está escrito este sitio: café, naïve, Peña, informação, Straße, città llegan intactos. Todo lo que está por encima de ese punto de código se sustituye por un signo de interrogación. En la práctica, las víctimas son las que se recogen al pegar desde un procesador de textos o un mensajero: comillas curvas, apóstrofos tipográficos, rayas y semirrayas, el carácter de puntos suspensivos y — detalle destacable en un sitio europeo — el símbolo €, que está en U+20AC y no sobrevive, mientras que el símbolo dólar y el símbolo libra, situados más abajo, sí. Las escrituras no latinas se pierden por completo. Escribe tus comillas y tus guiones en ASCII simple, deletrea cualquier moneda que no puedas arriesgarte a perder, y comprueba la primera página.
Lo que hay realmente dentro del PDF
Abre el resultado en un visor e intenta seleccionar una frase. Se selecciona, porque el texto de este PDF es texto: una secuencia de caracteres colocados en la página, no una imagen de caracteres. Esa sola propiedad es la diferencia entre un archivo que puedes buscar, copiar, dar a un lector de pantalla e indexar, y un escaneo, que es una imagen de documento y necesita reconocimiento óptico de caracteres antes de que un ordenador pueda hacer nada con él. Si conviertes porque una nota tiene que sobrevivir y seguir siendo localizable, esta es la propiedad que más importa, y es la que esta herramienta acierta.
Lo que el archivo no contiene merece igual atención. Su diccionario de metadatos guarda el nombre de la biblioteca que lo produjo y dos marcas de tiempo: el momento en que pulsaste el botón, en tiempo universal. No hay título, ni autor, ni asunto, ni palabras clave, ni etiqueta de idioma. Tampoco hay árbol de estructura, esa capa que le dice a un lector de pantalla qué texto es un encabezado y en qué orden debe leerse la página, así que el documento no está etiquetado. Y no hay ningún paquete de metadatos XMP. Cada una de esas ausencias es normal e irrelevante para una pequeña utilidad, y cada una importa si la palabra archivo se usa en su sentido estricto.
Ese sentido estricto tiene un nombre y un cuerpo de reglas. PDF/A, normalizado como ISO 19005, es el formato que los archivos y las bibliotecas nacionales aceptan de verdad, y la Biblioteca del Congreso resume dos de sus exigencias en una línea cada una: todas las fuentes deben estar incrustadas y ser legalmente incrustables para una representación universal e ilimitada, y el uso de XMP es obligatorio para los metadatos descriptivos e identificativos básicos. Todo el propósito, como lo formula la Biblioteca, es que PDF/A esté constreñido a evitar dependencias externas. La salida de esta herramienta falla en ambos puntos: apunta a Helvetica en lugar de llevarla, y no lleva XMP alguno. Es un PDF perfectamente bueno. No es un PDF/A, y si un tribunal, una oficina de registros o un régimen de cumplimiento te ha pedido uno, esta no es la vía.
Lo que tienes que añadir tú
Para todo lo que no sea archivo formal — una nota de reunión, un registro de decisión, una salida de terminal conservada como prueba, un texto que quieres congelar — el archivo cumple, siempre que pongas lo que no puede almacenar en el único sitio del que dispone: el texto. Empieza el documento con cuatro líneas. De qué se trata. Cuándo ocurrió, escrito como fecha completa con un año de cuatro cifras para que no pueda malinterpretarse en ningún sitio. Quién lo escribió. De dónde viene, ya sea un nombre de sistema, una dirección o una persona. Esas cuatro líneas no cuestan nada y son la diferencia entre un documento y un huérfano.
Después renombra la descarga. Llega como document.pdf, incondicionalmente, todas las veces, y no hay peor hábito para una carpeta que piensas consultar dentro de cinco años. Un nombre que se ordena y se lee solo — la fecha primero en orden año, mes, día, luego un asunto corto, luego el origen — hace el archivo navegable sin ningún metadato, lo cual viene bien dado que el archivo no lleva ninguno. Si produces varias notas, fusiónalas en un único PDF fechado en vez de acumular fragmentos; y si el resultado va a un buzón o a un ticket, pásalo antes por la compresión, aunque a menos de un kilobyte por página no suele haber nada que comprimir.
Por último, aprende a parar. Esta es la herramienta correcta para una nota, un registro, una transcripción, una licencia, un lote de salidas de terminal, una correspondencia que quieres congelar en una forma que nadie edite de pasada. Es la herramienta equivocada para todo lo que necesite encabezados, tablas, paginación, un logotipo, negritas o una segunda columna: no porque lo haga mal, sino porque no lo hace en absoluto, y forzar texto plano a una forma que no tiene produce algo peor que cualquiera de las dos. Para eso, redacta en un procesador de textos y exporta desde ahí. La virtud de este conversor es que hace exactamente una promesa y la cumple: tus caracteres, en una página, en el orden en que los escribiste, en un archivo que seguirá abriéndose dentro de veinte años.
| Decisión | Lo que usa | Lo que eso implica para ti |
|---|---|---|
| Tamaño de página | A4: 595,28 × 841,89 pt, exactamente 210 × 297 mm | No hay opción Carta; una impresora estadounidense lo escalará o lo recortará |
| Márgenes | 56 pt (19,8 mm) en todo el contorno; columna de texto de 483,28 pt (170,5 mm) | Espacio para una perforadora, no para una encuadernación |
| Tipografía | Helvetica, una de las 14 fuentes base, referenciada por su nombre y no incrustada | Menos de 1 KB por página, se abre en todas partes, pero no puede ser PDF/A |
| Cuerpo e interlineado | De 8 a 28 pt, 12 por defecto; interlineado a 1,42 × el cuerpo (17,04 pt en cuerpo 12) | 43 líneas por página en cuerpo 12, 65 en cuerpo 8, 19 en cuerpo 28 |
| Salto de línea | Pliega solo por los espacios; una palabra más larga no se parte nunca | Una URL de 180 caracteres se sale 638 pt del borde del papel y se pierde |
| Tabuladores y caracteres de control | No se pueden codificar; la conversión se detiene con un error genérico | Sustituye cada tabulador por espacios antes de pegar |
| Caracteres por encima de U+00FF | Sustituidos por un signo de interrogación | Los acentos sobreviven; el símbolo €, las comillas curvas, las rayas y las escrituras no latinas, no |
| Metadatos y nombre de archivo | Productor y dos marcas de tiempo; sin título, autor, idioma ni XMP; siempre document.pdf | Pon el título y la fecha en el propio texto, y renombra la descarga |
Preguntas frecuentes
- Dice que no pudo crear el PDF y no da ninguna razón. ¿Qué pasa?
- En casi todos los casos es un tabulador. El texto se escribe en el PDF con una codificación de un byte que no tiene posición para un tabulador, y en vez de sustituirlo u omitirlo, la conversión se detiene y la herramienta muestra su único mensaje de fallo genérico. Lo mismo ocurre con un salto de página y con el resto de caracteres de control, y por eso el fallo es tan común en archivos de registro, capturas de terminal y código pegado desde un editor que indenta con tabuladores. El rodeo consiste en abrir el texto en cualquier editor y sustituir cada tabulador por espacios antes de pegar: dos, cuatro u ocho, según cómo lo estuvieras leyendo. No se pierde nada al hacerlo, porque la tipografía es proporcional y las columnas no habrían cuadrado igualmente. Que el mensaje sea genérico en vez de indicar el carácter con el que se atragantó es una carencia real, y se ha notificado.
- ¿Dónde han ido mi símbolo € y mis comillas curvas?
- Los sustituyeron signos de interrogación en el camino hacia el PDF. Antes de dibujar cada línea la herramienta retira todo carácter por encima de U+00FF, y el símbolo € está en U+20AC, igual que las comillas curvas, los apóstrofos tipográficos, las rayas, las semirrayas y el carácter de puntos suspensivos, todos vecinos. Las letras acentuadas de Latin-1 están por debajo de esa frontera y pasan intactas: por eso café, naïve, Peña, informação, Straße y città sobreviven, y por eso el símbolo dólar y el símbolo libra también. La sustitución es más amplia de lo estrictamente necesario — la codificación que el PDF usa realmente sí tiene sitio para varios de los caracteres eliminados —, así que conviene corregirlo y se ha notificado. Mientras tanto: escribe comillas rectas y guiones, deletrea cualquier moneda que no puedas permitirte perder, y echa un vistazo a la primera página antes de archivar.
- ¿Por qué ya no me cuadran las columnas?
- Porque Helvetica es una tipografía proporcional y la alineación que tenías era una ilusión producida por la fuente de ancho fijo de tu editor. En una fuente de ancho fijo cada carácter ocupa el mismo espacio horizontal, así que contar caracteres equivale a medir distancia y las columnas hechas de espacios cuadran gratis. Helvetica da a cada carácter su anchura natural: en la columna de texto de esta herramienta a 12 puntos caben 181 letras i minúsculas en una línea, pero solo 48 letras M mayúsculas. Cada línea acaba por tanto con una longitud física distinta aun teniendo el mismo número de caracteres, y nada de lo que escribas lo arreglará, porque la herramienta no ofrece elección de tipografía. Si la alineación importa, esta no es la herramienta para ese documento: lleva el texto a un editor o un procesador de textos, componlo allí en una fuente de ancho fijo y exporta el PDF desde ahí. Si no importa, quita los espacios de relleno y deja que el texto sea prosa.
- ¿Cuántas páginas saldrán de mi archivo?
- Cuenta las líneas y divide. En el cuerpo 12 por defecto cada página contiene 43, así que un registro de 2 000 líneas sale a 47 páginas; en cuerpo 8 una página contiene 65 y el mismo registro sale a 31, un ahorro de un tercio. El cuerpo 11 da 47 líneas por página, el 14 da 37 y el máximo de 28 da 19. Ten en cuenta que se cuentan las líneas después del plegado, no las líneas de tu archivo: toda línea de origen más larga que unos 86 caracteres en cuerpo 12 ocupará dos o más, así que un archivo de párrafos largos produce más páginas de las que sugiere el recuento bruto. Si prefieres pensar en caracteres, una página llena en cuerpo 12 contiene unos 3 700 en prosa corriente. La herramienta muestra el número real de páginas junto al botón de descarga una vez construido el archivo, así que lo más barato es convertir una vez y mirar.
- ¿Es un PDF/A? ¿Puedo usarlo para archivo legal o regulatorio?
- No, y la razón es precisa, no una cuestión de grado. PDF/A, la familia ISO 19005, existe para que un documento pueda representarse dentro de décadas sin depender de nada externo al archivo. La Biblioteca del Congreso enuncia con claridad dos de sus exigencias: todas las fuentes deben estar incrustadas y ser legalmente incrustables para una representación universal e ilimitada, y el uso de XMP es obligatorio para los metadatos descriptivos e identificativos básicos. La salida de esta herramienta no satisface ninguna. Nombra a Helvetica en lugar de llevar sus contornos, y no escribe ningún paquete XMP. Además produce un documento sin etiquetar, sin árbol de estructura que indique a las tecnologías de apoyo el orden de lectura. Para una nota interna, un expediente personal o un adjunto de correo, nada de eso es un problema: el archivo es un PDF válido que se abrirá en cualquier lector durante muchísimo tiempo. Para una presentación judicial, un depósito en un archivo, una obligación de conservación regulada o un depósito en biblioteca nacional, pasa el resultado por una herramienta de conversión a PDF/A dedicada y valídalo después, ya que incluso el software que dice producir PDF/A produce con frecuencia archivos que no pasan la validación.
Artículos que podrían interesarte
Todas las guías →Herramientas relacionadas
El comportamiento descrito aquí para las herramientas de este sitio se leyó en su código fuente el 13 de agosto de 2026 y se midió contra las bibliotecas que incorporan. El comportamiento de una hoja de cálculo depende de la versión, de la compilación y de la configuración regional de la máquina que tienes delante: Microsoft ha cambiado varios de esos valores por defecto, así que comprueba los tuyos en vez de fiarte de un artículo, incluido este.
Fuentes
- Adobe — PDF 32000-1:2008 — the standard 14 base fonts, WinAnsiEncoding, and the point as one seventy-second of an inch
- Library of Congress — PDF/A family, ISO 19005 — all fonts must be embedded, XMP metadata is mandatory, and the format is constrained to avoid external dependencies
- Wikipedia — ISO 216 — the A-series definition that fixes A4 at 210 × 297 mm
- pdf-lib — PDFDocument API — the library this tool uses to lay out and write the PDF in the browser
- MDN Web Docs — FileReader.readAsText() — reads an uploaded .txt as UTF-8 unless told otherwise, which is why older Windows-encoded files arrive mangled
¿Has detectado un error en este artículo?