Contador de frequência de palavras

Cole um texto ou envie um .txt e receba uma tabela com contagens, percentual e primeira posição, além de gráfico e exportação CSV.

Textos e arquivos são tokenizados nesta página; nada é enviado, guardado ou transmitido pela rede em nenhum momento.

A lista de stopwords é só para inglês — desligue-a para outros idiomas.

Como funciona

Sempre que você digita, muda um controle ou carrega um arquivo, a ferramenta re-tokeniza o texto com uma expressão regular consciente de Unicode, aplica seus filtros (comprimento mínimo, tratamento de maiúsculas, lista de stopwords), conta os tokens sobreviventes num mapa e registra a primeira posição de cada palavra no fluxo. Os resultados alimentam quatro lugares de uma vez: os cartões de resumo, o gráfico de barras do top-15 em canvas, a tabela ranqueada (limitada às primeiras 50 linhas por legibilidade) e as exportações CSV/área de transferência, que sempre refletem os filtros atuais.

A expressão regular do tokenizador
As palavras são encontradas com /\p{L}+'?\p{L}*/gu: uma ou mais letras Unicode de qualquer escritura, opcionalmente com um apóstrofo interno para que contrações do inglês ("don't", "l'été") sobrevivam como um único token. Como a classe só aceita letras, dígitos, hífens, sublinhados e pontuação funcionam como separadores — "2026", "e-mail" e "$1,000" não contribuem com nada inteiro. A flag u torna o padrão seguro para pares substitutos de emoji e code points CJK raros.
Por que filtrar stopwords importa
A lei de Zipf garante que o topo de qualquer lista crua em inglês pertence a the, of, and, to — palavras que descrevem gramática, não tema. Para os usos comuns deste contador (ver se um artigo cobre as palavras-chave prometidas, auditar textos, detectar enchimento), você quer o perfil de palavras de conteúdo, por isso a lista de ~200 stopwords vem ligada. Desligue-a para ver a distribuição crua, que também é o jeito honesto de comparar textos de tamanhos diferentes.
Como ler a tabela
A coluna % é a fatia da palavra sobre todos os tokens que passaram pelos filtros atuais (os percentuais somam 100 só se você mostrar todas as palavras únicas). 3% é realmente alto para uma palavra de conteúdo — a prosa em inglês raramente dá mais de 1–2% a um substantivo de tema. A coluna de primeira posição é o índice da palavra no fluxo de tokens, útil para ver quais termos um texto apresenta cedo, sinal real em análise de intenção de busca.

Perguntas frequentes

Ele conta frases ou pares de palavras?

Não — o analisador é estritamente de palavra única. Cada sequência de letras (com um apóstrofo interno opcional, então "don't" fica inteiro) é um token, e frases de várias palavras nunca são montadas. Uma visão de bigramas ou n-gramas exige outras estatísticas, então esta página fica no que um contador simples faz com exatidão.

Números contam como palavras?

Não. O tokenizador mantém apenas letras (qualquer alfabeto) mais um apóstrofo embutido opcional, então "42", "$5.50" e "2026" são ignorados por completo — caso contrário inundariam de lixo textos financeiros ou cheios de datas. Se você precisa contar tokens numéricos, esta é a ferramenta errada para o serviço.

Por que minha lista só tem "the" e "and"?

Porque em qualquer texto em inglês as palavras mais frequentes são funcionais — the, and, of, to. É exatamente isso que o filtro de stopwords (ligado por padrão) remove: uma lista embutida de cerca de 200 palavras funcionais do inglês. Com ele desligado você vê a distribuição crua real; ligado, vê as palavras que carregam o assunto. A lista é só de inglês — desligue para outros idiomas.

Posso analisar textos em outros idiomas?

Sim. O tokenizador é consciente de Unicode (\p{L} cobre acentos latinos, grego, cirílico, árabe, hebraico, e escritas CJK são divididas grupo a grupo por não terem espaços). O único próprio do inglês é a lista de stopwords — para outros idiomas, desligue o filtro e julgue você mesmo as palavras do topo.

Algo é enviado para um servidor?

Não. Textos colados e arquivos .txt enviados são lidos e tokenizados inteiramente por JavaScript nesta página — o arquivo nunca sai do seu disco e não há requisição de rede de tipo algum. O download CSV e a cópia para a área de transferência também são gerados localmente.