Ce que retire cet outil
Un texte hérite de la mise en forme de l’endroit où il a été écrit. Une page web entoure les mots de balises HTML. Un README ou un message de discussion utilise les astérisques et les dièses du Markdown. Les forums utilisent le BBCode entre crochets. Un copier-coller depuis Word, Google Docs ou un e-mail peut apporter des espaces insécables, des caractères sans chasse et des lignes vides en trop.
Un mot sur ce qui se passe au collage. La zone de saisie de cette page est une zone de texte brut, comme n’importe quel champ de texte. Quand vous collez un texte riche depuis Word ou une page web, votre navigateur supprime déjà le gras, l’italique, les polices, les tailles, les couleurs et le style des liens avant que le texte n’arrive. Ce qu’il ne peut pas supprimer, c’est la mise en forme écrite sous forme de caractères : des balises copiées comme du code, des symboles Markdown, du BBCode, des entités comme & et des caractères d’espacement cachés. C’est cette partie que l’outil pour supprimer la mise en forme nettoie.
Mode d’emploi
- Collez dans Texte mis en forme. Un exemple avec du HTML et du Markdown est chargé pour que vous voyiez l’outil fonctionner.
- La zone Texte brut affiche le résultat nettoyé pendant la frappe.
- Choisissez ce qu’il faut retirer. Ces options sont activées par défaut :
- Retirer les balises HTML
- Retirer le Markdown
- Retirer le BBCode
- Polices stylées en lettres normales
- Ranger les espaces et les lignes vides
- Activez Redresser les guillemets courbes et les tirets si vous voulez aussi des guillemets et des traits d’union de clavier. Les guillemets français « » ne sont pas concernés.
- Appuyez sur Copier ou Télécharger. La note indique combien de caractères de mise en forme ont été retirés.
Exemples
Tous les résultats ci-dessous ont été produits par cet outil avec ses réglages par défaut. Un ¶ marque un saut de ligne.
| Texte mis en forme | Texte brut |
|---|---|
<p>Objectif atteint & nouveau <a href="https://example.com">site</a> en ligne. Bravo à toute l'équipe !</p> |
Objectif atteint & nouveau site en ligne. Bravo à toute l’équipe ! |
## Prochaines étapes ¶ ¶ - **Corriger** le _pied de page_ ¶ - Lire le [guide de style](https://example.com/guide) |
Prochaines étapes ¶ ¶ Corriger le pied de page ¶ Lire le guide de style |
« François » & Élodie |
« François » & Élodie |
[b]Sale[/b] ends [url=https://example.com]Friday[/url] |
Sale ends Friday |
Use **bold** and *italic* and plus un mot entre backticks |
Use bold and italic and code. |
Tom & Jerry <3 |
Tom & Jerry <3 |
> Quoted line ¶ # Heading |
Quoted line ¶ Heading |
| snake_case_name and 2 * 3 * 4 restent tels quels | snake_case_name and 2 * 3 * 4 restent tels quels |
<p>Les soldes commencent <strong>lundi</strong> & finissent <a href="https://example.com">vendredi</a>.</p> |
Les soldes commencent lundi & finissent vendredi. |
[b]Promo[/b] jusqu'à [url=https://example.com]dimanche[/url] |
Promo jusqu’à dimanche |
Comment ça marche
L’outil enchaîne plusieurs passes de nettoyage dans un ordre fixe.
- Le Markdown passe en premier. Les blocs de code, les lignes horizontales, les lignes de séparation des tableaux et les définitions de liens sont retirés. Les titres, citations et puces perdent leurs marques. Les images gardent leur texte alternatif et les liens leur libellé. Le gras, l’italique, le barré et le code en ligne perdent leurs symboles, mais seulement quand ces symboles entourent le texte de l’extérieur.
- Le HTML vient ensuite. Les commentaires, scripts et styles sont retirés en entier. Les éléments de bloc deviennent des sauts de ligne pour que les paragraphes restent séparés, les cellules de tableau deviennent des tabulations, et toutes les autres balises sont retirées. Les codes de caractères nommés et numériques sont décodés, y compris ceux de toutes les lettres accentuées du Latin-1 comme
é,àouç, et les guillemets«et». Seule exception courante en français :œ(œ) n’est pas dans cette liste et reste tel quel. Sa forme numérique,œ, est bien décodée. - Les balises BBCode entre crochets, comme [b], [url=…] et [quote], sont retirées et leur texte reste.
- Les polices stylées issues des générateurs de polices sont ramenées à des lettres normales, et les marques de barré sont retirées.
- Le rangement retire les caractères invisibles, transforme les espaces inhabituelles en espaces normales, retire les espaces en début et fin de ligne et limite les lignes vides à une seule d’affilée. Attention en français : les espaces insécables placées avant « : ; ! ? » deviennent elles aussi des espaces normales.
Conseils et limites
- Les listes perdent leurs puces. C’est le principe, mais si vous voulez garder la forme d’une liste, ajoutez vos propres tirets après coup ou utilisez l’outil pour supprimer les sauts de ligne afin de transformer la liste en une ligne séparée par des virgules.
- Un signe inférieur suivi d’une lettre, avec un signe supérieur plus loin, ressemble à une balise HTML et est retiré. Si vous nettoyez des maths ou du code, désactivez Retirer les balises HTML.
- L’indentation est retirée quand le rangement est activé. Désactivez Ranger les espaces et les lignes vides pour la garder.
- Les liens gardent leurs mots, pas leurs adresses. Si vous avez besoin des URL, copiez-les avant le nettoyage.
- Les lettres Unicode stylées sont aussi converties ici. Pour un contrôle plus fin des guillemets, des emoji, des accents et des caractères cachés, utilisez le convertisseur en texte brut.
Autres méthodes
Word : sélectionnez le texte et appuyez sur Ctrl+Espace pour effacer la mise en forme des caractères, ou utilisez le Collage spécial en choisissant le texte sans mise en forme. Aucune de ces méthodes ne retire des balises ou du Markdown tapés comme des caractères.
Google Docs : appuyez sur Ctrl+Maj+V pour coller sans mise en forme, ou utilisez le menu Format, puis l’option qui efface la mise en forme (Ctrl+\). Là encore, les symboles tapés comme du texte restent.
Mac : Cmd+Maj+Option+V colle en reprenant le style du texte environnant dans beaucoup d’applications.
Code : dans un navigateur, new DOMParser().parseFromString(html, 'text/html').body.textContent donne le texte d’une chaîne HTML. En Python, la méthode get_text() de BeautifulSoup fait la même chose. Le Markdown demande en général un analyseur ou un ensemble d’expressions régulières comme celles de cet outil.
Si le texte nettoyé garde des doubles espaces ou des lignes vides parasites, l’outil pour supprimer les espaces vous donne un contrôle plus fin.