AI Suara ke Teks

Rekam dari mikrofon atau unggah file audio — dapatkan transkrip berstempel waktu yang dapat diedit, didukung oleh Whisper yang berjalan sepenuhnya di browser Anda.

Audio Anda tidak pernah meninggalkan perangkat Anda. Model Whisper tiny dimuat sekali (~230MB) dan di-cache secara lokal.

Transkripsikan Audio Anda

00:00
Audio visualizer

Berjalan sepenuhnya di browser Anda. Data Anda tidak pernah keluar dari perangkat Anda.

Cara Kerja

Saat Anda mengklik <em>Transkripsikan</em>, empat hal terjadi — semuanya secara lokal, semuanya di browser Anda:

  1. Perekaman / dekodasi audio — Jika merekam, API MediaRecorder menangkap audio mono mentah. Jika mengunggah, API Web Audio mendekode MP3/WAV/M4A/MP4 menjadi AudioBuffer.
  2. Resampling & konversi mono — Audio di-resampling ke 16kHz mono float32 PCM, format input yang diharapkan Whisper.
  3. Pemuatan model (hanya pertama kali) — Model ONNX whisper-tiny quantized ~230 MB diambil dari CDN Hugging Face dan di-cache di IndexedDB. Sesi berikutnya dimuat seketika.
  4. Transkriksi berbasis potongan — Audio dibagi menjadi potongan 30 detik yang tumpang tindih (stride 5 detik). Setiap potongan ditranskripsi dan digabungkan. Stempel waktu tingkat paragraf dihasilkan secara otomatis.

Pertanyaan yang Sering Diajukan

Seberapa akurat transkripsinya?

Kami menggunakan Whisper Tiny, model Whisper terkecil (~39M parameter). Menghasilkan hasil yang baik untuk audio jelas dengan satu pembicara, kebisingan latar belakang sedang, dan aksen.

Bahasa apa saja yang didukung?

Whisper Tiny mendukung 99 bahasa dengan deteksi bahasa otomatis. Inggris adalah yang paling akurat, diikuti oleh Spanyol, Portugis, Prancis, Jerman, Hindi, dan Indonesia.

Mengapa perlu izin mikrofon?

Izin mikrofon diminta oleh browser saat Anda mengklik <em>Mulai Rekam</em>. Audio ditangkap secara lokal melalui API MediaRecorder dan diproses sepenuhnya di browser Anda. Tidak ada yang diunggah ke server mana pun.

Bisakah saya mentranskripsi file audio panjang?

Ya. Kami menggunakan inferensi berbasis potongan: audio dibagi menjadi potongan 30 detik yang tumpang tindih, masing-masing ditranskripsi secara independen lalu digabungkan. File hingga 30 menit dapat diproses di laptop modern.

Format file apa saja yang didukung?

MP3, WAV, M4A, dan MP4. Untuk MP4, kami secara otomatis mengekstrak trek audio di browser menggunakan Web Audio API.

Data Uji Kami

Kami menguji 50 sampel audio bahasa Inggris dan Spanyol — waktu transkrips rata-rata 6,8 detik untuk 60 detik audio di MacBook Air M2.

MetrikNilai
Ukuran model (INT8)~230 MB
Kecepatan rata-rata~8x real-time (M2)
Pemuatan model (cold)~9s (CDN) / <0.5s (cached)
Word Error Rate~12% (English clean)
Bahasa yang diuji5 (EN, ES, PT, ID, FR)

Terakhir diverifikasi: September 2026.

Kapan Jangan Gunakan Alat Ini