Un minuto de vídeo Full HD sin comprimir ocupa unos 9 GB. En YouTube ese mismo minuto son 20-40 MB. La relación 300:1 entre ambos números es el trabajo silencioso de los códecs de vídeo — y entender sus principios explica por qué un archivo "se ve mal", por qué tu export tarda tanto, y qué configuración elegir para publicar en la web.
La idea base: el 95% de cada frame es repetición
El vídeo es una secuencia de imágenes a 24-60 fps. Comprimir cada frame como foto independiente (como haría JPEG) desperdicia el dato más valioso: entre frames consecutivos casi nada cambia. Los códecs modernos explotan dos redundancias:
- Espacial (dentro del frame): igual que JPEG/WebP.
- Temporal (entre frames): "este bloque es igual que el de la frame anterior, desplazado 3 píxeles".
I-frames, P-frames y B-frames
El flujo típico alterna tres tipos de frames:
- I-frame (intra): comprimido solo consigo mismo, como una foto. Es el punto de partida obligatorio.
- P-frame (predicted): guarda solo diferencias respecto al frame anterior — bloques que se movieron, cambiaron o aparecieron. Pesa una fracción del I.
- B-frame (bidirectional): predice desde frames anterior Y posterior. Máxima compresión, máxima complejidad.
La estructura habitual (GOP - Group of Pictures): I B B P B B P ... I. El I-frame aparece cada pocos segundos porque los P acumulan error y porque necesitas puntos de acceso: al saltar a mitad de vídeo, el player debe empezar desde un I-frame. Por eso el seeking en vídeos con GOPs largos "rebota" hacia atrás.
Consecuencia práctica para streaming: más I-frames = mejor seeking + peor compresión. Las plataformas equilibran según contenido.
Cómo funciona la predicción (el corazón del códec)
Para cada bloque de pixels en un P-frame:
- Motion estimation: buscar en la frame de referencia el bloque más parecido — puede estar desplazado (el movimiento se codifica como vector).
- Motion compensation: restar el bloque encontrado del real; queda un residuo pequeño.
- Codificar el vector + el residuo (que sí pasa por DCT/cuantización tipo imagen).
Cada generación de códecs mejora esta maquinaria con más tamaños de bloque (hasta 128×128 en AV1 frente a 16×16 de H.264), más modos de predicción intra (direcciones angulares finas), filtros de bucle que reconstruyen mejor las referencias, y herramientas específicas (film grain synthesis en AV1: no comprimir el grano, regenerarlo sintéticamente).
Los cuatro códecs que importan
| H.264/AVC | H.265/HEVC | VP9 | AV1 | |
|---|---|---|---|---|
| Año | 2003 | 2013 | 2013 | 2018 |
| Eficiencia relativa | base | ~+40% | ~+35% | ~+50% |
| Licencias | Patent pool | Caras y opacas | Libre | Libre (royalty-free) |
| Soporte hardware | Universal | Amplio (Apple fuerte) | Amplio (Google) | Creciendo rápido |
H.264 sigue siendo la apuesta segura universal: cualquier dispositivo de la última década lo decodifica por hardware. Para compatibilidad máxima, sigue siendo el fallback obligatorio.
H.265: notablemente más eficiente pero históricamente envenenado por licencias múltiples y costosas. Domina en ecosistema Apple (grabación iPhone, HDR).
VP9: la respuesta libre de Google, base de YouTube durante años. Excelente relación eficiencia/soporte en navegadores.
AV1: el estándar moderno abierto respaldado por consorcio gigante (Google, Netflix, Amazon, Apple...). Comprime ~50% mejor que H.264 — Netflix emite catálogo en AV1 ahorrando petabytes. Su coste histórico era la codificación lentísima; SVT-AV1 lo ha acelerado hasta producción diaria. Soporte hardware ya cubre la mayoría de dispositivos nuevos (móviles desde 2022-2023, GPUs recientes).
Qué usar en 2026
Publicación web con alcance máximo: H.264 baseline/high como base + AV1 o VP9 como fuente preferente vía <source> múltiple — el navegador elige el primero que soporte:
<video controls width="1280" height="720">
<source src="video.av1.webm" type='video/webm; codecs="av01"' />
<source src="video.vp9.webm" type='video/webm; codecs="vp9"' />
<source src="video.h264.mp4" type="video/mp4" />
</video>
Parámetros razonables para web: CRF/CQ entre 28-34 en AV1 (escala invertida: menor = mejor calidad), bitrate objetivo para H.264 según resolución (720p ≈ 4-6 Mbps, 1080p ≈ 8-12 Mbps), audio Opus 96-128k en WebM o AAC 128k en MP4.
Recortar, convertir o cambiar velocidad antes de subir reduce drásticamente el tiempo de proceso en la plataforma destino — nuestro editor de vídeo online hace esas operaciones localmente con ffmpeg/WASM, sin subir el original a ninguna parte.
Por qué tu export tarda tanto
Codificar bien es búsqueda exhaustiva: probar muchos candidatos de movimiento, muchas particiones de bloque, muchas decisiones de cuantización por frame. La velocidad de encode escala con la complejidad de estas búsquedas — presets rápidos podan la búsqueda (fichero mayor), presets lentos la profundizan. Un export AV1 preset 4 puede tardar 5-10× el realtime; preset 8, menos de 1×. Elige según si el fichero se codifica una vez (usa tiempo) o millones de veces (usa bytes).
Preguntas frecuentes
¿Puedo recuperar calidad de un vídeo ya comprimido? No: los detalles descartados por cuantización no existen. Re-codificar siempre degrada (generational loss); parte siempre del material fuente de mayor calidad disponible.
¿Qué bitrate necesita mi vídeo? Depende de resolución, fps y complejidad de contenido (deporte ≠ conferencia). Mejor enfoque quality-based (CRF/CQ) que bitrate fijo: defines calidad percibida y el códec gasta lo necesario.
¿HDR y 10-bit? AV1 y HEVC los soportan nativamente; H.264 con limitaciones. Para HDR web real hoy: AV1 o HEVC con perfiles Dolby Vision/HDR10.
Prepara tus vídeos para la web con nuestro editor de vídeo, gratis y directamente en tu navegador.