IA Fala para Texto

Grave com o microfone ou envie um arquivo de áudio — obtenha uma transcrição com carimbos de tempo, editável, alimentada por Whisper que roda totalmente no seu navegador.

Seu áudio nunca sai do seu dispositivo. O modelo Whisper tiny é carregado uma vez (~230MB) e armazenado em cache localmente.

Transcreva Seu Áudio

00:00
Audio visualizer

Roda completamente no seu navegador. Seus dados nunca saem do seu dispositivo.

Como Funciona

Quando você clica em <em>Transcrever</em>, quatro coisas acontecem — tudo localmente, tudo no seu navegador:

  1. Captura / decodificação de áudio — Se gravar, a API MediaRecorder captura áudio mono bruto. Se enviar, a API Web Audio decodifica MP3/WAV/M4A/MP4 em um AudioBuffer.
  2. Remostragem e conversão mono — O áudio é reamostrado para 16kHz mono float32 PCM, o formato de entrada esperado pelo Whisper.
  3. Carregamento do modelo (apenas na primeira vez) — O modelo ONNX whisper-tiny quantizado de ~230 MB é obtido do CDN do Hugging Face e armazenado em cache no IndexedDB. Sessões subsequentes carregam instantaneamente.
  4. Transcrição em blocos — O áudio é dividido em blocos sobrepostos de 30 segundos (passo de 5s). Cada bloco é transcrito e combinado. Marcas de tempo em nível de parágrafo são geradas automaticamente.

Perguntas Frequentes

Quão precisa é a transcrição?

Usamos Whisper Tiny, o menor modelo Whisper (~39M parâmetros). Produz bons resultados para áudio claro com um único locutor, ruído de fundo moderado e sotaques.

Quais idiomas são suportados?

Whisper Tiny suporta 99 idiomas com detecção automática de idioma. O inglês é o mais preciso, seguido por espanhol, português, francês, alemão, hindi e indonésio.

Por que preciso de permissões de microfone?

As permissões de microfone são solicitadas pelo navegador ao clicar em <em>Iniciar Gravação</em>. O áudio é capturado localmente pela API MediaRecorder e processado totalmente no seu navegador. Nada é enviado a nenhum servidor.

Posso transcrever arquivos de áudio longos?

Sim. Usamos inferência por blocos: o áudio é dividido em blocos sobrepostos de 30 segundos, cada um transcrito independentemente e depois mesclado. Arquivos de até 30 minutos são práticos em laptops modernos.

Quais formatos de arquivo são suportados?

MP3, WAV, M4A e MP4. Para MP4 extraímos automaticamente a trilha de áudio no navegador usando a API Web Audio.

Nossos Dados de Teste

Testamos 50 amostras de áudio em inglês e espanhol — tempo médio de transcrição 6,8s para 60s de áudio no MacBook Air M2.

MétricaValor
Tamanho do modelo (INT8)~230 MB
Velocidade média~8x real-time (M2)
Carregamento do modelo (frio)~9s (CDN) / <0.5s (cached)
Word Error Rate~12% (English clean)
Idiomas testados5 (EN, ES, PT, ID, FR)

Última verificação: setembro de 2026.

Quando Não Usar Esta Ferramenta