Grabaste una reunión de una hora y ahora necesitas el texto para buscar dentro, citarlo o archivarlo. Subir esa grabación a un servicio en la nube para transcribirla significa mandar una conversación potencialmente confidencial a un tercero. Transcribir con IA directamente en el navegador evita ese problema por completo: el audio nunca sale de tu dispositivo.
Qué modelo es Whisper y por qué corre en el navegador
Whisper es el modelo de reconocimiento de voz de OpenAI, entrenado con cientos de miles de horas de audio en decenas de idiomas. La versión que usa esta herramienta está exportada a ONNX y corre con transformers.js, lo que permite ejecutar la inferencia con WebGPU (si tu navegador lo soporta) o WebAssembly como alternativa — sin servidor, sin API key, sin límite de minutos.
Los tres niveles de modelo
- Rápido (~75 MB, Whisper tiny): el más ligero, ideal para audios cortos o cuando priorizas velocidad sobre precisión.
- Preciso (~150 MB, Whisper base): el equilibrio recomendado por defecto para la mayoría de grabaciones.
- Máxima calidad (~1 GB, large-v3-turbo): el modelo grande cuantizado a 8 bits, la opción de OpenAI para la mejor relación precisión/tamaño en 2026. Vale la pena para acentos marcados, audio con ruido de fondo o cuando la precisión importa más que el tiempo de espera.
El modelo se descarga una vez y queda en caché del navegador — la segunda transcripción con el mismo nivel es instantánea en cuanto a carga del modelo.
Por qué se detecta la voz antes de transcribir (VAD)
Antes de pasar el audio al modelo, la herramienta detecta automáticamente los tramos donde realmente hay voz y descarta el silencio. Esto no es solo una optimización de velocidad: Whisper tiende a "alucinar" texto repetido en tramos largos de silencio o ruido de fondo constante, generando bucles de la misma frase una y otra vez. Filtrar el silencio antes evita ese problema en grabaciones largas con pausas.
Por qué elegir el idioma en vez de dejarlo en automático
El detector de idioma automático de Whisper acierta menos en clips cortos, especialmente con los modelos más ligeros (tiny y base). Si sabes en qué idioma está grabado el audio, seleccionarlo manualmente mejora notablemente la precisión de la transcripción respecto a dejarlo en "auto-detectar". El selector por defecto usa el idioma de tu propia sesión, y el modo automático queda disponible para quien lo necesite.
Los límites reales de la transcripción con IA
Como cualquier modelo de reconocimiento de voz, Whisper puede equivocarse con acentos muy marcados, varias personas hablando a la vez o mucho ruido de fondo. No es infalible — revisa siempre el resultado antes de darlo por bueno, sobre todo en nombres propios o cifras. Si el resultado no cuadra, dos ajustes suelen ayudar: probar el modelo de máxima calidad, o forzar el idioma en vez de dejarlo en automático.
Preguntas frecuentes
¿Hay límite de minutos de audio? No, el límite real es la memoria y potencia de tu dispositivo, no un tope artificial de la herramienta.
¿Se sube el audio a algún servidor? No. La decodificación, la detección de voz y la transcripción ocurren íntegramente en tu navegador.
¿Funciona con acentos regionales fuertes? Con variaciones — Whisper es robusto para acentos comunes pero puede fallar más con acentos muy marcados o poco representados en su entrenamiento. El modelo de máxima calidad ayuda en estos casos.
¿Puedo transcribir vídeo? Sí, la herramienta acepta archivos MP4 y M4A además de los formatos de audio habituales, extrayendo la pista de audio automáticamente.
Transcribe cualquier audio a texto gratis con audio a texto, corriendo Whisper localmente en tu navegador, sin límite de minutos y sin subir nada.