Convertisseur HTML en texte

Les e-mails en texte brut, l’analyse de texte et les pipelines de comptage de mots ont tous besoin que le HTML soit transformé en une chaîne lisible par un humain, sans artefacts de balisage. Collez le HTML et cet outil supprime chaque balise, décode les entités (&&), réduit les espaces créés par l’indentation et produit un bloc propre de prose lisible prêt pour l’analyse ou pour la partie text/plain d’un e-mail multipart.

Comment convertir HTML en texte

  1. 1

    Collez le HTML

    De n'importe quelle taille, un extrait, un corps d'e-mail riche ou une page entière.

  2. 2

    Convertir

    Un clic : chaque balise et attribut est supprimé et les entités sont décodées.

  3. 3

    Vérifier les sauts de ligne

    Les paragraphes, les éléments de liste et les lignes de tableau deviennent des lignes séparées, le texte garde ainsi sa structure.

  4. 4

    Copiez le texte

    La sortie est un texte Unicode brut, sûr à utiliser pour un compteur de mots, un modèle d'e-mail ou un modèle de sentiment.

Comment la conversion gère les balises délicates

Transformer le HTML en texte est plus que string.replace(/<[^>]+>/, "") : une expression régulière naïve laisse les codes d’entité et les espaces d’indentation en place, et ne sait pas que </p> devrait commencer une nouvelle ligne.

Balises de niveau bloc vs en ligne

Les balises de niveau bloc (<br>, et les balises de fermeture </p>, </div>, </h1> à </h6>, </li>, </tr>) produisent chacune un saut de ligne. Les balises en ligne (<a>, <span>, <strong>) ne laissent pas d’espaces, donc les mots ne se fusionnent pas.

Comportements spécifiques des balises

Balise Traitement
<br> Un saut de ligne
</p>, </div>, </h1> à </h6> Un saut de ligne par balise de fermeture
</li>, </tr> Un saut de ligne ; pas de puces ni de séparateurs de cellules de tableau
<a href="url">texte</a> texte ; l’attribut href est supprimé
<img alt="texte"> Rien, la balise n’a pas de texte visible
<script>, <style> Les balises sont supprimées, le texte entre elles est conservé

Décodage des entités

  • Les entités nommées (&amp;, &copy;, &eacute;) se décodent en leur caractère Unicode.
  • Les entités numériques (&#169;, &#x00A9;) se décodent également.
  • Les entités inconnues sont préservées littéralement, afin que les outils d’analyse puissent les voir.

Normalisation des espaces

  • Les espaces et tabulations avant un saut de ligne sont supprimés.
  • Trois lignes vides ou plus se réduisent à une seule ligne vide.
  • Les espaces entre les mots sont conservés tels quels ; le convertisseur ne réorganise pas le texte.

Utilisations

  • Générer la partie text/plain d’un e-mail multipart.
  • Nettoyer les articles extraits avant de les passer à un modèle de langue.
  • Alimenter un index de recherche en texte brut.
  • Calculer un comptage de mots honnête qui ignore le balisage.

Questions fréquentes

Le formatage visuel (gras, couleur, police) est perdu, c’est le but. La structure survit sous forme de sauts de ligne : les paragraphes, les éléments de liste et les lignes de tableau deviennent des lignes séparées, le texte reste donc lisible.

Le texte visible du lien est conservé, mais l’URL est supprimée avec les attributs de la balise. Si vous avez besoin des URLs, utilisez plutôt un convertisseur HTML vers Markdown dédié.

Le convertisseur supprime les balises elles-mêmes, mais conserve le texte qu’elles contiennent ; le contenu des blocs <script> et <style> reste donc dans la sortie. Retirez-le du HTML source d’abord si vous n’en voulez pas.

Oui. La sortie est en UTF-8 et préserve chaque caractère non-ASCII de l’entrée. Les entités comme &copy; et &eacute; se décodent en leurs équivalents Unicode.

Outils similaires

Outil disponible dans d’autres langues