Grabas una entrevista de una hora y, al revisarla, te das cuenta de que hay tramos enteros de silencio: pausas para pensar, interrupciones, momentos donde nadie habla. Recortar todo eso a mano, escuchando de principio a fin, es la parte más tediosa de editar audio hablado. Eliminar silencios automáticamente resuelve esto, pero el reto técnico está en no cargarse las pausas normales de una conversación real.
El problema de "cortar todo lo que esté callado"
Un algoritmo ingenuo de detección de silencio simplemente busca tramos por debajo de cierto volumen y los borra. El problema es que el habla humana está llena de pausas cortas — entre frases, al respirar, al pensar la siguiente palabra — que son parte natural de cómo hablamos. Si el algoritmo borra cualquier silencio, por corto que sea, el resultado suena atropellado y artificial, como si alguien hablara sin respirar.
Los dos parámetros que resuelven esto
Umbral de silencio (en dB): el volumen por debajo del cual se considera que hay silencio. Un valor cercano a 0 dB detecta silencio con mayor facilidad (es más estricto sobre qué cuenta como "sonido"); un valor más negativo (más bajo) requiere que el tramo esté realmente en silencio para eliminarlo. -35 dB es un punto de partida razonable para grabaciones de voz normales; en entornos con más ruido de fondo puede hacer falta ajustar.
Duración mínima (en segundos): solo se elimina el silencio que dure al menos este tiempo. Este parámetro es el que evita destrozar las pausas naturales del habla: si lo pones en 0.5 segundos, una pausa breve entre palabras (que dura menos) se conserva intacta, y solo desaparecen los huecos más largos — los que de verdad alargan la grabación sin aportar nada.
Cómo ajustar según el tipo de grabación
- Entrevista o podcast con pausas largas entre preguntas y respuestas: umbral moderado (-35 dB) y duración mínima de 0.5-1 segundo, para eliminar los huecos evidentes sin tocar el ritmo natural de la conversación.
- Dictado o nota de voz con mucho "eh" y silencio mientras piensas: duración mínima más baja (0.3-0.4s) para ser más agresivo.
- Grabación con ruido de fondo constante (ventilador, tráfico): sube el umbral (acércalo a 0 dB) porque el "silencio" real nunca baja del todo, o el algoritmo no detectará nada.
Preguntas frecuentes
¿Se recortan las pausas normales al hablar? No si ajustas bien la duración mínima — ese es justo el parámetro pensado para dejar intactas las pausas cortas y naturales del habla.
¿Por qué no detecta ningún silencio en mi grabación? Probablemente el umbral está demasiado bajo (muy negativo) para el nivel de ruido de fondo de tu grabación. Sube el valor (acércalo a 0 dB) para que detecte más tramos como silencio.
¿Cuánto se reduce la duración total? Depende de cuánto silencio real tenga la grabación original; la herramienta muestra la duración antes y después para que compares directamente.
¿Se procesa en mi navegador? Sí, con FFmpeg compilado a WebAssembly, sin subir el archivo a ningún servidor.
Acorta tus grabaciones eliminando silencios automáticamente con eliminar silencios, con umbral y duración mínima ajustables, 100% en tu navegador.