Penghitung Frekuensi Kata

Tempel teks atau unggah berkas .txt dan dapatkan tabel kata dengan jumlah, persentase, dan posisi, plus grafik dan ekspor CSV.

Teks dan berkas di-tokenisasi di halaman ini; tidak ada yang diunggah, disimpan, atau dikirim lewat jaringan sama sekali.

Daftar stopword hanya untuk bahasa Inggris — nonaktifkan untuk bahasa lain.

Cara kerja

Setiap kali Anda mengetik, mengubah kontrol, atau memuat berkas, alat ini meng-tokenisasi ulang teks dengan ekspresi reguler yang melek Unicode, menerapkan saringan Anda (panjang minimum, penanganan huruf besar, daftar stopword), menghitung token yang lolos dalam sebuah peta, dan mencatat posisi kemunculan pertama tiap kata dalam aliran. Hasilnya mengalir ke empat tempat sekaligus: kartu statistik ringkasan, grafik batang 15 teratas pada canvas, tabel peringkat (dibatasi 50 baris pertama agar terbaca), dan ekspor CSV/papan klip yang selalu mencerminkan saringan saat ini.

Regex tokenizer
Kata ditemukan dengan /\p{L}+'?\p{L}*/gu: satu atau lebih huruf Unicode dari skrip apa pun, boleh dengan satu apostrof di dalam agar singkatan Inggris ("don't", "l'été") bertahan sebagai satu token. Karena kelasnya hanya huruf, angka, tanda sambung, garis bawah, dan tanda baca berperan sebagai pemisah — "2026", "e-mail", dan "$1,000" tidak menyumbang apa pun utuh. Bendera u membuat pola aman terhadap pasangan surrogate untuk emoji dan code point CJK langka.
Mengapa penyaringan stopword penting
Hukum Zipf menjamin puncak daftar mentah apa pun dalam bahasa Inggris ditempati the, of, and, to — kata yang menata grammar, bukan topik. Untuk pekerjaan lazim penghitung ini (memeriksa apakah artikel benar membahas kata kunci yang dijanjikan, mengaudit teks, mencari basa-basi), Anda ingin profil kata isi, sehingga daftar stopword ~200 kata aktif secara bawaan. Matikan untuk melihat distribusi mentah, yang juga cara jujur membandingkan dua teks berbeda panjang.
Membaca tabelnya
Kolom % adalah bagian kata atas semua token yang lolos saringan saat ini (persentasenya berjumlah 100 hanya jika Anda menampilkan setiap kata unik). Bagian 3% sudah tinggi untuk kata isi — prosa Inggris jarang memberi lebih dari 1–2% pada satu kata benda topik. Kolom posisi pertama adalah indeks kata dalam aliran token, berguna melihat istilah mana yang diperkenalkan lebih awal, sinyal nyata dalam analisis niat pencarian.

Pertanyaan yang sering diajukan

Apakah menghitung frasa atau pasangan kata?

Tidak — penganalisisnya ketat satu kata. Setiap deretan huruf (dengan satu apostrof internal opsional, jadi "don't" utuh) adalah satu token, dan frasa multi-kata tidak pernah dirakit. Tinjauan bigram atau n-gram butuh statistik berbeda, jadi halaman ini berpegang pada satu hal yang bisa dihitung tepat oleh penghitung sederhana.

Apakah angka dihitung sebagai kata?

Tidak. Tokenizer hanya menyimpan huruf (alfabet apa pun) plus apostrof sisipan yang opsional, jadi "42", "$5.50", dan "2026" dilewati seluruhnya — kalau tidak, teks keuangan atau penuh tanggal akan dipenuhi baris sampah. Jika Anda perlu token numerik dihitung, ini alat yang salah untuk pekerjaan itu.

Mengapa daftar teratas saya hanya "the" dan "and"?

Karena dalam teks bahasa Inggris apa pun kata tersering adalah kata fungsional — the, and, of, to. Tepatnya itulah yang disaring filter stopword (aktif secara bawaan): daftar bawaan sekitar 200 kata fungsional Inggris. Saat dimatikan Anda melihat distribusi mentah apa adanya; saat aktif, kata-kata pembawa topik. Daftarnya khusus Inggris — matikan untuk bahasa lain.

Bisakah saya menganalisis teks non-Inggris?

Bisa. Tokenizer-nya melek Unicode (\p{L} mencakup aksen Latin, Yunani, Sirilik, Arab, Ibrani, dan skrip CJK dipecah per kelompok karena tidak berspasi). Yang khusus Inggris hanyalah daftar stopword — untuk bahasa lain, matikan penyaringnya dan nilai sendiri kata-kata teratasnya.

Apakah ada yang diunggah ke server?

Tidak. Teks tempel dan berkas .txt dibaca serta di-tokenisasi sepenuhnya oleh JavaScript di halaman ini — berkas tidak pernah meninggalkan disk Anda dan tidak ada permintaan jaringan apa pun. Unduhan CSV dan salin ke papan klip juga dihasilkan secara lokal.