Ce que montre un compteur de fréquence des mots
Un compteur de fréquence des mots vous indique combien de fois chaque mot apparaît dans un texte. Le résultat est une liste classée : le mot le plus utilisé en premier, puis le suivant, jusqu’aux mots qui n’apparaissent qu’une fois.
Cette liste sert à plus de choses qu’on ne l’imagine. Les rédacteurs l’utilisent pour repérer les mots sur lesquels ils s’appuient trop. Les étudiants s’en servent pour étudier le vocabulaire d’un discours ou d’un roman. Ceux qui écrivent pour les moteurs de recherche vérifient combien de fois une expression clé apparaît. Les chercheurs l’utilisent pour un premier regard sur des réponses à un questionnaire ou des notes d’entretien.
Mode d’emploi
- Collez votre texte dans Votre texte. L’outil s’ouvre avec un court paragraphe en anglais sur le café pour que vous voyiez son fonctionnement.
- Sous Compter, choisissez Mots seuls, Expressions de deux mots ou Expressions de trois mots.
- Choisissez vos Options :
- Ignorer les mots courants (activé par défaut) écarte des mots anglais comme « the », « and » et « of ».
- Ignorer la casse (activé par défaut) compte « Café » et « café » comme le même mot.
- Inclure les nombres (désactivé par défaut) compte les nombres comme 2024 comme des mots.
- Réglez Mot le plus court à compter (lettres) si vous voulez ignorer les mots courts. Une valeur de 4 écarte tout ce qui a trois lettres ou moins, ce qui est un bon moyen d’écarter « le », « la », « de », « les » et « des » dans un texte français.
- Lisez le tableau. # est le rang, Nombre le nombre d’occurrences et Part le pourcentage.
- Appuyez sur Copier pour copier la liste en trois colonnes séparées par des tabulations, ou sur CSV pour télécharger un fichier pour Excel ou Google Sheets.
Au-dessus du tableau, Comptés est le nombre total de mots ou d’expressions pris en compte, Différents le nombre d’éléments uniques et Premier élément le plus fréquent.
Exemples
Ces résultats viennent du paragraphe d’exemple avec lequel l’outil s’ouvre.
| Réglages | Comptés | Différents | Premiers résultats |
|---|---|---|---|
| Mots seuls, mots courants ignorés | 36 | 30 | coffee 6 (16,7 %), roast 2 (5,6 %), bean 1 (2,8 %) |
| Mots seuls, mots courants inclus | 60 | 43 | coffee 6 (10,0 %), the 6 (10,0 %), of 3 (5,0 %) |
| Expressions de deux mots, mots courants ignorés | 18 | 17 | roast coffee 2 (11,1 %), beans inside 1 (5,6 %) |
| Expressions de deux mots, mots courants inclus | 55 | 52 | of the 3 (5,5 %), roast coffee 2 (3,6 %) |
La première ligne montre pourquoi le filtre des mots courants est activé par défaut. Sans lui, « the » est à égalité avec « coffee » en tête, et la liste en dit moins sur le sujet réel du paragraphe.
Et avec un texte français ?
Voici les résultats réels pour un paragraphe français sur le climat (« Le climat change et les villes doivent s’adapter. La chaleur augmente dans les villes… »), mots courants ignorés :
| Réglages | Comptés | Différents | Premiers résultats |
|---|---|---|---|
| Mots seuls | 40 | 25 | les 5 (12,5 %), de 3 (7,5 %), et 3 (7,5 %), la 3 (7,5 %), carbone 2 (5,0 %), chaleur 2 (5,0 %) |
| Expressions de deux mots | 36 | 33 | dans les 2 (5,6 %), la chaleur 2 (5,6 %), les villes 2 (5,6 %) |
Comme la liste des mots courants est anglaise, les articles et prépositions français occupent le haut du classement. Pour vous concentrer sur les mots de sens, réglez Mot le plus court à compter sur 4 : « les », « de », « et » et « la » disparaissent, et « carbone » et « chaleur » remontent en tête.
Comment fonctionne le comptage
Le texte est découpé en mots. Un mot est une suite de lettres et de chiffres, qui peut contenir une apostrophe ou un trait d’union : « aujourd’hui » et « peut-être » comptent chacun pour un mot. Les apostrophes typographiques sont traitées comme les apostrophes droites. La ponctuation autour des mots est ignorée.
Cette règle a une conséquence en français : les élisions restent attachées au mot. « l’eau », « l’énergie » ou « s’adapter » sont comptés comme des mots à part, distincts de « eau », « énergie » ou « adapter ».
Pour les expressions, l’outil découpe d’abord le texte aux fins de phrase : points, points d’interrogation, points d’exclamation, deux-points, points-virgules, parenthèses et sauts de ligne. Il fait ensuite glisser une fenêtre de deux ou trois mots le long de chaque morceau. Avec Ignorer les mots courants activé, une expression est écartée si elle commence ou finit par un mot courant anglais : vous obtenez « roast coffee » mais pas « of the » ni « the coffee ». Les mots courants au milieu sont gardés, donc des expressions comme « cup of tea » apparaissent toujours dans la liste à trois mots.
Le pourcentage de part est calculé par rapport au total Comptés, pas à tous les mots du texte. Quand vous ignorez les mots courants, ils sont retirés à la fois de la liste et du total.
Conseils et limites
- Les différentes formes comptent séparément. « grain » et « grains » sont deux entrées, tout comme « court », « courent » et « courir ». L’outil ne regroupe pas les formes d’un mot, car le faire de façon fiable demande un dictionnaire pour chaque langue. En français, où les accords et les conjugaisons multiplient les formes, gardez-le en tête.
- Repérez les excès. Dans un article court, tout mot ordinaire qui revient bien plus souvent que les autres mérite un second regard. Le détecteur de répétitions surligne chaque mot répété dans votre texte, pour voir où il apparaît.
- Densité de mots-clés. Pour la rédaction web, choisissez Expressions de deux mots ou Expressions de trois mots pour voir combien de fois une expression clé apparaît. Il n’y a pas de pourcentage idéal. Écrivez pour le lecteur et utilisez l’expression là où elle vient naturellement.
- Voyez-le en image. Le générateur de nuage de mots utilise les mêmes comptes et dessine en plus grand les mots les plus fréquents.
- Comptez aussi les phrases. Pour la longueur des phrases, le temps de lecture et le nombre de paragraphes, utilisez le compteur de phrases.
- Autres langues. Le comptage fonctionne avec toute langue qui sépare les mots par des espaces, lettres accentuées comprises. Le chinois et le japonais, écrits sans espaces, sont découpés en mots par votre navigateur (Intl.Segmenter). La liste des mots courants est uniquement anglaise.
Autres façons de compter la fréquence des mots
Microsoft Word. Word n’a pas de liste de fréquences. Vous pouvez compter un mot à la fois avec Rechercher (Ctrl+F), qui affiche le nombre de résultats dans le volet de navigation.
Excel et Google Sheets. Collez un mot par ligne dans la colonne A. Dans Google Sheets, =QUERY(A:A, "select A, count(A) where A <> '' group by A order by count(A) desc") donne un tableau classé. Dans Excel, un tableau croisé dynamique avec le mot à la fois en ligne et en valeur (réglée sur Nombre) fait la même chose.
Code. En Python, collections.Counter(text.lower().split()).most_common(20) liste les 20 premiers mots, mais garde la ponctuation collée aux mots. En JavaScript, découpez le texte avec une expression régulière et ajoutez chaque mot à une Map, puis triez les entrées par nombre.