Convertir HTML a texto
Quite las etiquetas de un código HTML y quédese con el texto plano; los bloques script y style se descartan
Sus datos se quedan con usted. La conversión ocurre dentro del navegador; no se envía nada a ningún servidor.
¿Le sirvió esta herramienta?
Gracias, su comentario llegó.
Cómo funciona
Pegue el código HTML en el panel izquierdo: el texto sin etiquetas aparece en el panel derecho al instante, sin ningún botón de por medio. La herramienta retira las etiquetas de apertura y de cierre, borra los bloques script y style junto con su contenido — así ninguna línea de código ni ninguna regla de estilo se cuela en el resultado —, elimina los comentarios de HTML y decodifica entidades como &, o ñ hasta devolverlas a su carácter real. En la práctica, los 40 KB de código que copia del origen de una página de noticias quedan en unos pocos kilobytes legibles, con los títulos y los párrafos en líneas separadas y un guion delante de cada elemento de lista. La opción de enlaces existe para quien necesita reunir las fuentes citadas: con Texto + dirección, la URL se escribe entre paréntesis justo detrás del texto del enlace. La línea de resultado indica cuántas etiquetas se quitaron y de cuántos a cuántos caracteres bajó el texto; después puede copiar la salida o descargarla como archivo .txt.
Esta herramienta también se busca como html a texto, convertir html a texto, quitar etiquetas html, eliminar las etiquetas de un html, extraer texto de un html.
¿Qué es HTML?
HTML (HyperText Markup Language) es el lenguaje de marcado que sostiene el esqueleto de una página web: mediante etiquetas encerradas entre signos de menor y mayor declara qué parte del texto es un título, cuál un párrafo y cuál un enlace. El navegador lee ese marcado y lo convierte en una página visible; en cambio, cuando usted copia el código fuente, el marcado vuelve a aparecer mezclado con el texto. El trabajo de esta herramienta es separar esas dos cosas: el marcado se tira y se queda lo que estaba escrito para una persona.
¿Qué es Etiqueta?
Una etiqueta es la pieza de estructura del HTML y se escribe entre signos de menor y mayor: <p> abre un párrafo, </p> lo cierra y <a href="..."> arma un enlace. La mayoría funciona en pares y el contenido real queda entre los dos; unas pocas, como <br>, van solas. Al limpiar, la etiqueta y sus atributos se descartan y el texto que estaba en medio se conserva. Script y style son la excepción: lo que llevan dentro no es texto sino código, y por eso se borran junto con su contenido.
¿Qué es Entidad?
Una entidad es la forma codificada de escribir un carácter que en HTML tiene un significado propio o que resulta incómodo de teclear: & representa el ampersand, < el signo de menor y el espacio que no se parte. También existe la forma numérica, de la que dependen mucho las lenguas con tildes: ñ y ñ dan ñ, á da á. En un texto copiado del código fuente estas secuencias estorban la lectura; la herramienta decodifica todas las entidades con nombre definidas en HTML y todas las numéricas, y deja intacta la que no conoce.
Qué se pierde al limpiar y qué queda a la vista
Las etiquetas no llevan solo apariencia: también llevan estructura. Lo que alinea las celdas de una tabla, lo que reparte el texto en columnas y lo que coloca las imágenes está hecho de etiquetas. Al limpiar, esa estructura se pierde sin vuelta atrás: las filas de una tabla caen una debajo de otra y las imágenes se descartan por completo, incluido su texto alternativo. Es el comportamiento correcto cuando quiere lo que la página dice y no cómo se ve; si necesita conservar el diseño, no hace falta una limpieza sino una conversión a un formato que sepa cargarlo.
También hay sorpresas en el sentido contrario. Lo que el CSS esconde — un aviso con display:none, un texto escrito para lectores de pantalla, las entradas de un menú que nunca se abrió — sigue estando en el HTML aunque el navegador no lo muestre. Esta herramienta no interpreta CSS, así que esos fragmentos salen en el resultado. Lo que obtiene no es una copia de lo que veía en pantalla: es todo el texto que el HTML contiene de verdad.
¿Qué ajuste para cada trabajo?
Las dos opciones se eligen según adónde va el texto; los valores por omisión cubren el caso más frecuente.
- Guardar un artículo o una noticia en forma legible → Conservar los párrafos
- Pegar el texto en una celda de hoja de cálculo o en un campo de una línea → Una sola línea
- Reunir todas las direcciones citadas en un boletín → Texto + dirección
- Llevar un cuerpo de texto limpio al procesador de textos → Conservar los párrafos + Dejar solo el texto del enlace
Preguntas frecuentes
¿Cómo se quitan las etiquetas HTML de un texto?
Basta con pegar el código en el panel izquierdo: el texto ya limpio de etiquetas, de bloques script y style y de comentarios se forma al momento en el panel derecho. Luego puede copiarlo o descargarlo como archivo .txt.
¿El HTML que pego se sube a algún servidor?
No. La limpieza ocurre por completo dentro de su navegador; ni el código ni el texto que lleva dentro se envían a ninguna parte. Por eso puede pegar sin reparos el cuerpo de un correo con datos de un cliente.
¿Por qué se arreglan secuencias como & o ñ?
Son entidades de HTML: la forma en que se escriben dentro del código ciertos caracteres. La herramienta decodifica todas las entidades con nombre definidas en HTML, incluidas las de tildes y eñe (ñ, á, é), y todas las numéricas: & vuelve a ser el ampersand, ñ vuelve a ser ñ y á vuelve a ser á. Una entidad que no reconoce se deja tal cual, para no perder datos.
¿Los datos de una tabla salen en columnas?
No. La alineación de las columnas la sostienen las etiquetas, así que desaparece con ellas y cada celda baja a su propia línea. Para trasladar una tabla como tabla hace falta una conversión de formato, no una limpieza de etiquetas; si lo único que necesita es el texto, esta es la herramienta correcta.