IA Voz a Texto

Graba con tu micrófono o carga un archivo de audio — obtén una transcripción con marcas de tiempo, editable, impulsada por Whisper que corre completamente en tu navegador.

Tu audio nunca sale de tu dispositivo. El modelo Whisper tiny se carga una vez (~230MB) y se cachea localmente.

Transcribe Tu Audio

00:00
Audio visualizer

Se ejecuta completamente en tu navegador. Tus datos nunca salen de tu dispositivo.

Cómo Funciona

Cuando haces clic en <em>Transcribir</em>, cuatro cosas pasan — todo localmente, todo en tu navegador:

  1. Captura / decodificación de audio — Si grabas, la API MediaRecorder captura audio mono sin procesar. Si subes, la API Web Audio decodifica MP3/WAV/M4A/MP4 en un AudioBuffer.
  2. Remuestreo y conversión mono — El audio se remuestrea a 16kHz mono float32 PCM, el formato de entrada que espera Whisper.
  3. Carga del modelo (solo primera vez) — El modelo ONNX whisper-tiny cuantizado de ~230 MB se obtiene desde CDN de Hugging Face y se cachea en IndexedDB. Sesiones posteriores se cargan instantáneamente.
  4. Transcripción por fragmentos — El audio se divide en fragmentos superpuestos de 30 segundos (paso de 5s). Cada fragmento se transcribe y se combina. Las marcas de tiempo a nivel de párrafo se generan automáticamente.

Preguntas Frecuentes

¿Qué tan precisa es la transcripción?

Usamos Whisper Tiny, el modelo Whisper más pequeño (~39M parámetros). Produce buenos resultados para audio claro con un solo hablante, ruido de fondo moderado y acentos.

¿Qué idiomas están soportados?

Whisper Tiny soporta 99 idiomas con detección automática de idioma. El inglés es el más preciso, seguido por español, portugués, francés, alemán, hindi e indonesio.

¿Por qué se necesitan permisos de micrófono?

Los permisos de micrófono son solicitados por tu navegador al hacer clic en <em>Empezar Grabación</em>. El audio se captura localmente a través de la API MediaRecorder y se procesa completamente en tu navegador. Nada se carga a ningún servidor.

¿Puedo transcribir archivos de audio largos?

Sí. Usamos inferencia por fragmentos: el audio se divide en fragmentos superpuestos de 30 segundos, cada uno transcrito independientemente y luego combinado. Archivos de hasta 30 minutos son prácticos en laptops modernas.

¿Qué formatos de archivo están soportados?

MP3, WAV, M4A y MP4. Para MP4 extraemos automáticamente la pista de audio en el navegador usando la API Web Audio.

Nuestros Datos de Prueba

Probamos 50 muestras de audio en inglés y español — tiempo promedio de transcripción 6.8s para 60s de audio en MacBook Air M2.

MétricaValor
Tamaño del modelo (INT8)~230 MB
Velocidad promedio~8x real-time (M2)
Carga del modelo (frío)~9s (CDN) / <0.5s (cached)
Word Error Rate~12% (English clean)
Idiomas probados5 (EN, ES, PT, ID, FR)

Última verificación: septiembre de 2026.

Cuándo No Usar Esta Herramienta