Radar · 24/07/2026 · ocurrido el 22/07/2026 · investigación

SANA-Video 2.0: vídeo 720p en GPU única, la generación de vídeo se vuelve local

NVlabs ha publicado SANA-Video 2.0, un modelo de difusión de vídeo disponible en dos escalas (5B y 14B parámetros) que genera vídeo hasta 720p en una única GPU. El modelo utiliza una arquitectura híbrida que combina atención lineal y softmax en proporciones calibradas (3:1), manteniendo la calidad de los transformers de vídeo tradicionales pero con un costo computacional que escala linealmente. Sobre el papel, el modelo 5B produce vídeo 720p de 5 segundos en 13 segundos en una H100, siendo 120 veces más rápido que Wan 2.2-A14B en el mismo hardware (paper publicado el 23 de julio de 2026 en Hugging Face).

Por qué te importa

Si generas contenido de vídeo con IA, el costo ha sido hasta ahora el cuello de botella. Los modelos de vídeo de calidad se ejecutan en la nube, con facturas que suben rápidamente con cada segundo de metraje. Un modelo que produce 720p en una GPU única cambia la ecuación: en lugar de pagar una API por cada clip, puedes mantener el proceso en local, iterar sin mirar el contador, y controlar qué entra y qué sale.

El código está en GitHub (NVlabs/Sana), así que cualquiera con una GPU suficientemente potente puede probarlo directamente.

Si quieres intentarlo

El repositorio está en github.com/NVlabs/Sana. Antes de invertir tiempo, comprueba cuánta memoria de vídeo requiere el modelo 5B y compárala con tu tarjeta: los números de rendimiento se miden en H100, una GPU de data center, no en una tarjeta consumer.

En detalle

El problema de los modelos de vídeo es la longitud de la secuencia. Un vídeo es una larga cadena de fotogramas, y cada fotograma está hecho de miles de tokens. El mecanismo estándar (la atención softmax) compara cada token con todos los demás, por lo que el costo crece cuadráticamente: duplicas la longitud del vídeo y el costo se cuadruplica. Es por eso que generar 10 segundos de vídeo cuesta mucho más que generar 10 veces 1 segundo.

La atención lineal resuelve el problema del costo, pero pierde algo en expresividad: no puede captar ciertas interacciones finas entre tokens distantes. SANA-Video 2.0 utiliza un compromiso: para la mayoría de los niveles usa atención lineal (costo lineal), pero inserta periódicamente pilares softmax (uno cada tres capas lineales) que restauran la capacidad de captar interacciones completas. La proporción 3:1 se eligió después de pruebas en proxies de resolución reducida, no por intuición.

El segundo truco técnico son los Block Attention Residuals: en lugar de recalcular las representaciones ricas en cada pilar softmax, el modelo las canaliza también en las capas lineales posteriores, reutilizando el trabajo ya realizado. Esto aumenta el rango efectivo de las capas profundas en un 12%, según los autores.

Todo esto se entrena desde cero, no es una simplificación de un modelo existente. La diferencia importa: linealizar un modelo ya entrenado es más económico pero degrada la calidad. Entrenar la arquitectura híbrida desde cero cuesta más en training pero produce un modelo que sabe trabajar con su estructura desde el principio.

Los números de velocidad se miden en H100, una GPU de data center que cuesta lo que un coche. El salto a GPU consumer (las RTX series 40 o 50 que un profesional podría tener en su escritorio) no es inmediato ni garantizado. Las optimizaciones de stack completo (kernel fusion, caching, atención dispersa) están calibradas para hardware específico. Antes de considerarlo viable en tu máquina, necesitas ver números reales en una RTX 4090 o 5090.

La comparación con Wan 2.2-A14B (120 veces más lento en el mismo H100) es sugerente pero parcial: Wan es un modelo más grande y la comparación es sobre el modelo 5B de SANA. El modelo 14B de SANA tendría números diferentes.

El código es abierto en GitHub, pero los pesos completos e instrucciones de configuración deben verificarse en el repositorio. La historia es prometedora para quienes generan contenido de vídeo y quieren salir de la lógica de pago por clip en la nube, pero el paso de H100 en laboratorio a GPU consumer aún tiene algunos peldaños que bajar.

Escribe para buscar en curso, playbooks, skills, papers…