Contador de frecuencia de palabras

Pega un texto o sube un .txt y obtén una tabla de palabras con conteos, porcentaje y primera posición, más gráfico y exportación CSV.

El texto y los archivos se tokenizan en esta página; nada se sube, se guarda ni se envía por la red en ningún momento.

La lista de stopwords es solo para inglés — desactívala para otros idiomas.

Cómo funciona

Cada vez que escribes, cambias un control o cargas un archivo, la herramienta re-tokeniza el texto con una expresión regular consciente de Unicode, aplica tus filtros (longitud mínima, manejo de mayúsculas, lista de stopwords), cuenta los tokens supervivientes en un mapa y registra la primera posición de cada palabra en el flujo. Los resultados alimentan cuatro sitios a la vez: las tarjetas de resumen, el gráfico de barras del top-15 en canvas, la tabla ordenada (limitada a las primeras 50 filas por legibilidad) y las exportaciones CSV/portapapeles, que siempre reflejan los filtros actuales.

La expresión regular del tokenizador
Las palabras se buscan con /\p{L}+'?\p{L}*/gu: una o más letras Unicode de cualquier escritura, opcionalmente con un apóstrofo interior para que las contracciones inglesas ("don't", "l'été") sobrevivan como un solo token. Como la clase solo admite letras, dígitos, guiones, subrayados y signos actúan como separadores — "2026", "e-mail" y "$1,000" no aportan nada entero. La bandera u hace el patrón seguro con pares sustitutos de emoji y code points CJK raros.
Por qué importa filtrar stopwords
La ley de Zipf garantiza que la cima de cualquier lista cruda en inglés la ocupan the, of, and, to — palabras que describen gramática, no tema. Para los usos típicos de este contador (comprobar si un artículo cubre sus palabras clave prometidas, auditar textos, detectar relleno) interesa el perfil de palabras de contenido, por eso la lista de ~200 stopwords viene activada. Desactívala para ver la distribución cruda, que además es la forma honesta de comparar textos de longitudes distintas.
Cómo leer la tabla
La columna % es la cuota de la palabra sobre todos los tokens que pasaron los filtros actuales (los porcentajes suman 100 solo si muestras cada palabra única). Un 3% es realmente alto para una palabra de contenido — la prosa en inglés rara vez da más de 1–2% a un sustantivo temático. La columna de primera posición es el índice de la palabra en el flujo de tokens, útil para ver qué términos presenta un texto pronto, una señal real en análisis de intención de búsqueda.

Preguntas frecuentes

¿Cuenta frases o pares de palabras?

No — el analizador es estrictamente de una palabra. Cada secuencia de letras (con un apóstrofo interno opcional, así "don't" queda entero) es un token, y nunca se ensamblan frases de varias palabras. Una vista de bigramas o n-gramas necesita otras estadísticas, así que esta página se limita a lo que un contador simple puede hacer con exactitud.

¿Los números cuentan como palabras?

No. El tokenizador conserva solo letras (de cualquier alfabeto) más un apóstrofo opcional incrustado, así que "42", "$5.50" y "2026" se descartan por completo — de otro modo inundarían de basura los textos financieros o llenos de fechas. Si necesitas contar tokens numéricos, esta no es la herramienta adecuada.

¿Por qué mi lista son solo "the" y "and"?

Porque en cualquier texto en inglés las palabras más frecuentes son funcionales — the, and, of, to. Eso es justo lo que quita el filtro de stopwords (activo por defecto): una lista integrada de unas 200 palabras funcionales del inglés. Apagado ves la distribución cruda real; encendido ves las palabras que cargan el tema. La lista es solo de inglés, así que desactívalo para otros idiomas.

¿Puedo analizar textos en otros idiomas?

Sí. El tokenizador es consciente de Unicode (\p{L} cubre acentos latinos, griego, cirílico, árabe, hebreo, y las escrituras CJK se dividen grupo a grupo porque no llevan espacios). Lo único propio del inglés es la lista de stopwords — para otros idiomas, apaga el filtro y juzga tú mismo las palabras más frecuentes.

¿Se sube algo a un servidor?

No. El texto pegado y los archivos .txt se leen y tokenizan por completo con JavaScript en esta página — el archivo nunca sale de tu disco y no hay petición de red de ningún tipo. La descarga CSV y la copia al portapapeles también se generan localmente.