PDF a texto (TXT)
Saque el escrito que hay dentro de un PDF como archivo de texto
Sus archivos se quedan con usted. La conversión ocurre dentro del navegador; ningún archivo se sube a un servidor.
¿Le sirvió esta herramienta?
Gracias, su comentario llegó.
Cómo funciona
Elija sus archivos PDF en el recuadro (toque o haga clic), ajuste los dos interruptores y pulse Convertir a texto. El primero es la marca de página: si lo deja activo, antes de cada página nueva aparece una línea como «--- Página 2 ---», de modo que en un documento largo sigue viendo de qué página viene cada frase; si lo apaga, el escrito avanza sin corte. El segundo tiene que ver con los finales de línea: dentro de un PDF las líneas ya están cortadas al ancho del papel, y arrastrar esos cortes convierte su texto en una columna estrecha en cualquier otro programa. «Unir en párrafos» vuelve a juntar las líneas de continuación, mientras que «Dejar como en la página» es lo adecuado en poesía, listados en columnas y código, donde la alineación tiene significado. La línea de resultado indica cuántas páginas se leyeron y cuántas palabras salieron. Puede elegir varios PDF a la vez; cada uno llega como su propio .txt con su propio nombre. Si un documento pide contraseña, escríbala en el campo de abajo; en archivos corrientes ese campo se deja vacío.
Esta herramienta también se busca como convertir pdf a texto, pdf a txt, extraer texto de un pdf, sacar el texto de un pdf, pdf to text espanol, copiar texto de pdf.
¿Qué es Capa de texto?
La capa de texto es la parte de un PDF donde las letras están guardadas de verdad como letras: de cada carácter consta con qué tipografía y en qué punto de la página se coloca, y eso es lo que permite seleccionar, buscar y copiar el escrito. Todo PDF salido de un procesador de textos, una hoja de cálculo o un programa de contabilidad lleva esta capa. Una página que viene del escáner no la tiene; allí solo hay una foto, y lo que parece una letra es en realidad un conjunto de puntos oscuros. Esa capa es justamente lo que lee esta herramienta.
¿Qué es PDF escaneado?
Un PDF escaneado es un documento en papel fotografiado con un escáner o con la cámara del móvil y colocado página a página dentro de un PDF. Por fuera parece un archivo corriente, pero no contiene ni una sola letra seleccionable: si al arrastrar el ratón sobre el escrito no se selecciona nada, lo que tiene es un escaneo. La única vía para sacar texto de ahí es el reconocimiento óptico de caracteres, un programa que adivina letras a partir de las formas de la imagen, y su resultado siempre hay que revisarlo a ojo.
¿Qué es TXT (texto sin formato)?
El TXT es el formato de documento más desnudo que existe: contiene caracteres y saltos de línea y nada más — ni negrita, ni tipografía, ni color, ni tablas, ni imágenes. Esa desnudez es la razón de que se abra en todas partes; editores de texto, hojas de cálculo, herramientas de traducción y lectores de pantalla se entienden con el texto sin formato. La codificación del archivo decide qué caracteres se ven bien, y esta herramienta escribe UTF-8, así que tildes, eñes y demás signos llegan intactos a cualquier programa actual.
¿Cuál es la diferencia entre PDF y TXT?
Un PDF fija el aspecto de la página: tipografía, márgenes, columnas e imágenes quedan en el mismo sitio en todos los dispositivos, porque el archivo anota que tal letra debe imprimirse en tal punto y con tal tamaño. El TXT no guarda aspecto alguno, solo la sucesión de caracteres; el programa que lo abre elige por su cuenta la tipografía y el ancho de línea. Ir del PDF al TXT es, por tanto, un sentido que pierde información: los filetes de las tablas, las alineaciones, la maqueta y las imágenes se quedan atrás, y permanece el escrito que carga el significado. Conserve el PDF si el documento se va a entregar tal cual, y tome el TXT si piensa trabajar sobre las palabras.
¿Cómo se resuelven los espacios entre palabras y las columnas?
Dentro de un PDF no hay frases; hay letras colocadas una a una en puntos fijos de la página. Por eso una extracción en bruto suele dar rarezas como «JuanPérez» o «T otal». Esta herramienta mira las coordenadas: los trozos situados a la misma altura forman una línea, y cuando el hueco horizontal entre dos trozos supera la quinta parte de la altura de la letra, se inserta un espacio de palabra. El resultado sale más limpio que un copiar y pegar corriente.
La composición a dos columnas tiene un límite. Las líneas se leen de izquierda a derecha, así que las frases de dos columnas contiguas pueden entrelazarse. En un documento así conviene marcar «Dejar como en la página» y separar las columnas a ojo. Los encabezados, los pies y los números de página también forman parte de la página, de modo que entran en el resultado; si le estorban, bórrelos después en un editor de texto.
¿Para qué se usa esta conversión?
La idea es volver manejable el escrito de un documento que parece cerrado. Los trabajos habituales son estos:
- Buscar dentro de un informe largo o llevar una cita a sus notas
- Pasar un documento recibido por correo a un programa de traducción o al corrector ortográfico
- Ver el desglose en bruto de una factura o un extracto antes de llevarlo a la hoja de cálculo
- Entregar el escrito a un lector en voz alta — el texto sin formato lo lee cualquier herramienta
- Los documentos escaneados no sirven: las páginas son fotos y hace falta OCR primero
Preguntas frecuentes
¿Cómo se convierte un PDF a texto?
Elija el archivo en el recuadro, ajuste la marca de página y los finales de línea y pulse Convertir a texto. El escrito se extrae y se descarga un archivo .txt que abre cualquier programa de texto, incluido el Bloc de notas.
¿Por qué aparecen números de página y encabezados en mi texto?
El encabezado, el pie y el número de página son escritos puestos en la página como cualquier otro, y la herramienta recoge lo que hay en ella. Los documentos rara vez indican qué parte es cuerpo y cuál adorno. Lo más seguro es borrarlos en el archivo obtenido.
¿Por qué no se puede convertir un PDF escaneado?
Una página que viene de un escáner o de la cámara del móvil está dentro del PDF como una foto; las letras son puntos, no escritura. Esta herramienta no reconoce letras en una imagen y avisa de que falta la capa de texto.
¿Se conservan las tildes y la eñe?
Sí. Sea cual sea la codificación de la tipografía incrustada, la herramienta lee la tabla de caracteres de esa misma tipografía y devuelve las letras correctas, tildes y ñ incluidas. En tipografías muy antiguas o mal incrustadas puede perderse alguna letra suelta; repase el resultado una vez.
¿Se sube mi documento a un servidor?
No. Abrir el archivo, extraer el escrito y preparar el .txt ocurre dentro de su navegador; ni el documento ni su nombre van a ninguna parte. En contratos e informes médicos esa diferencia importa.