Qué muestra un contador de frecuencia de palabras
Un contador de frecuencia de palabras te dice cuántas veces aparece cada palabra en un texto. El resultado es una lista ordenada: primero la palabra más usada, luego la siguiente, y así hasta las palabras que aparecen una sola vez.
Esa lista es útil de más maneras de las que parece. Quien escribe la usa para detectar las muletillas en las que se apoya demasiado. Los estudiantes la usan para estudiar el vocabulario de un discurso o una novela. Quien escribe para buscadores la usa para comprobar cuántas veces aparece una frase clave. Los investigadores la usan como primera mirada a las respuestas de una encuesta o a las notas de una entrevista.
Cómo usarlo
- Pega el texto en Tu texto. La herramienta se abre con un párrafo corto sobre el café, en inglés, para que veas cómo funciona.
- En Contar, elige Palabras sueltas, Frases de dos palabras o Frases de tres palabras.
- Elige tus Opciones:
- Ignorar palabras comunes (activada de forma predeterminada) deja fuera palabras inglesas como “the”, “and” y “of”.
- Ignorar mayúsculas y minúsculas (activada de forma predeterminada) cuenta “Coffee” y “coffee” como la misma palabra.
- Incluir números (desactivada de forma predeterminada) cuenta números como 2024 como si fueran palabras.
- Ajusta Longitud mínima de palabra (letras) si quieres saltarte las palabras cortas. Con un valor de 4 se descartan todas las de tres letras o menos, que en español elimina buena parte de los artículos y las preposiciones.
- Lee la tabla. # es la posición, Veces es cuántas veces aparece el elemento y Porcentaje es su proporción.
- Pulsa Copiar para copiar la lista como tres columnas separadas por tabuladores, o CSV para descargar un archivo para Excel o Google Sheets.
Encima de la tabla, Contadas es el número total de palabras o frases incluidas, Distintas es cuántos elementos únicos hay y Más frecuente es el elemento que más se repite.
Ejemplos
Estos resultados salen del párrafo de ejemplo con el que se abre la herramienta.
| Opciones | Contadas | Distintas | Primeros resultados |
|---|---|---|---|
| Palabras sueltas, ignorando palabras comunes | 36 | 30 | coffee 6 (16.7%), roast 2 (5.6%), bean 1 (2.8%) |
| Palabras sueltas, con palabras comunes | 60 | 43 | coffee 6 (10.0%), the 6 (10.0%), of 3 (5.0%) |
| Frases de dos palabras, ignorando palabras comunes | 18 | 17 | roast coffee 2 (11.1%), beans inside 1 (5.6%) |
| Frases de dos palabras, con palabras comunes | 55 | 52 | of the 3 (5.5%), roast coffee 2 (3.6%) |
La primera fila muestra por qué el filtro de palabras comunes está activado de forma predeterminada. Sin él, “the” empata con “coffee” en lo más alto, y la lista dice menos sobre el tema real del párrafo.
Con un texto en español el filtro casi no actúa. Con “El niño y la niña comen pan. La niña come pan con el niño. ¿Qué come el niño? ¡Pan! No me digas que no.” y la configuración predeterminada, se cuentan 21 palabras, 12 distintas, y los primeros resultados son el 3 (14.3%), niño 3 (14.3%) y pan 3 (14.3%). El artículo “el” sigue en lo más alto. Solo desaparecieron “no” (dos veces) y “me”, porque se escriben igual que dos palabras de la lista inglesa: sin el filtro se cuentan 24. En frases de dos palabras, lo primero es “el niño” 3 (18.8%) y “la niña” 2 (12.5%).
Cómo se cuentan las palabras
El texto se divide en palabras. Una palabra es una serie de letras y cifras, y puede incluir un apóstrofo o un guion, así que “it’s” y “well-known” cuentan como una palabra cada una. Los apóstrofos tipográficos se tratan igual que los rectos. Se ignora la puntuación que rodea a las palabras, incluidos los signos ¿ y ¡. Las letras con tilde, la ü y la ñ forman parte de la palabra, pero la tilde cuenta: “qué” y “que”, o “él” y “el”, se cuentan por separado.
Para las frases, la herramienta divide primero el texto en los cortes de oración: puntos, signos de cierre de interrogación y de exclamación, dos puntos, punto y coma, paréntesis y saltos de línea. Después desliza una ventana de dos o tres palabras por cada trozo. Con Ignorar palabras comunes activado, se descarta una frase si empieza o termina con una palabra común, así que obtienes “roast coffee” pero no “of the” ni “the coffee”. Las palabras comunes del medio se mantienen, de modo que frases como “cup of tea” siguen apareciendo en la lista de tres palabras.
El porcentaje se calcula sobre el total de Contadas, no sobre todas las palabras del texto. Cuando ignoras las palabras comunes, se quitan tanto de la lista como del total.
Consejos y límites
- Las distintas formas cuentan por separado. “bean” y “beans” son dos entradas, y lo mismo pasa con “corre”, “corren” y “corriendo”. La herramienta no agrupa las formas de una palabra, porque hacerlo bien requiere un diccionario para cada idioma.
- Busca palabras repetidas en exceso. En un artículo corto, cualquier palabra corriente que aparezca mucho más que las demás merece una segunda lectura. El buscador de palabras repetidas resalta cada palabra repetida en tu texto, para que veas dónde aparece.
- Densidad de palabras clave. Si escribes para buscadores, elige Frases de dos palabras o Frases de tres palabras para saber cuántas veces aparece una frase clave. No existe un porcentaje ideal. Escribe para quien lee y usa la frase donde encaje de forma natural.
- Míralo como una imagen. El generador de nubes de palabras usa los mismos recuentos y dibuja más grandes las palabras más frecuentes.
- Cuenta también las oraciones. Para la longitud de las oraciones, el tiempo de lectura y el número de párrafos, usa el contador de oraciones.
- Otros idiomas. El recuento funciona con cualquier idioma que separe las palabras con espacios, incluidas las letras con tilde. La lista de palabras comunes es solo en inglés, así que en español conviene desactivarla o, mejor, subir la Longitud mínima de palabra a 4 para quitar de, la, el, que, los y las.
Otras formas de contar la frecuencia de palabras
Microsoft Word. Word no tiene una lista de frecuencias. Puedes contar una palabra cada vez con Buscar (Ctrl+F en Word en inglés, Ctrl+B en Word en español), que muestra el número de resultados en el panel de navegación.
Excel y Google Sheets. Pega una palabra por fila en la columna A. En Google Sheets, =QUERY(A:A, "select A, count(A) where A <> '' group by A order by count(A) desc") devuelve una tabla ordenada. En Excel, una tabla dinámica con la palabra como fila y como valor (configurado como Cuenta) hace lo mismo.
Código. En Python, collections.Counter(text.lower().split()).most_common(20) muestra las 20 palabras más frecuentes, aunque deja la puntuación pegada a las palabras. En JavaScript, divide el texto con una expresión regular, añade cada palabra a un Map y después ordena las entradas por recuento.