ShotPlan: los tokens de planificación llevan el montaje dentro del modelo de video
Los investigadores de Tele-AI han publicado ShotPlan, un framework que añade planificación explícita de cortes a los modelos de generación de video. El problema es real: los generadores de video actuales producen clips individuales coherentes, pero si les pides una secuencia de múltiples planos con una narración que fluya, pierden el hilo.
El mecanismo es simple en su concepto. Un único planning token, replicado para cada transición requerida y posicionado en coordenadas temporales fraccionarias mediante FRoPE, le dice al modelo preentrenado dónde cortar. Sin cambios en la arquitectura, sin máscaras de atención. Los cortes secos se producen a menos de un fotograma del índice solicitado, y el mismo sistema gestiona transiciones suaves y movimientos de cámara localizados.
Por qué te importa. Si generas video con IA para trabajo, conoces el salto mortal: de «un clip bonito de 5 segundos» a «tres planos que cuentan un video de producto». Ahí las herramientas actuales se rompen. Tienes que generar cada clip por separado, montarlos a mano, y esperar que los personajes y el estilo se mantengan entre una toma y otra. ShotPlan da un paso hacia la generación multi-plano controlada, que es el formato que realmente necesitas para spots, contenido social, videos educativos.
Los modelos entrenados, el dataset y más de 30 demostraciones están disponibles públicamente en Hugging Face y en el sitio del proyecto. El modelo base es Wan2.2-T2V-A14B, un video diffusion model con 14 mil millones de parámetros.
Si quieres probarlo, los pesos están en Hugging Face (Pensioner/ShotPlan-Wan2.2-T2V-A14B-HighNoise) junto con el dataset de entrenamiento. Necesitas una GPU capaz de soportar un modelo video diffusion de ese tamaño.
En detalle
Los modelos de generación de video basados en diffusion producen un número fijo de fotogramas a partir de un prompt de texto. Funcionan bien para una única toma: una persona caminando, un paisaje en movimiento. Pero el cine, incluso el elemental que necesitas para un video de producto, está hecho de cortes. Primero un plano general, luego un detalle, luego un movimiento de cámara. Si intentas describir todo en un único prompt, el modelo mezcla los planos o los ignora.
Lo que había antes. Quien quería producir secuencias multi-plano con IA recurría a dos estrategias, ambas insatisfactorias. La primera: generar clips separados y montarlos en postproducción, con el problema de que personajes y escenarios no son coherentes de un clip a otro. La segunda: usar prompts larguísimos esperando que el modelo respete un guión, con resultados impredecibles. Algunos enfoques académicos habían intentado condicionar el modelo con máscaras de atención o arquitecturas modificadas, pero requerían entrenamiento desde cero o cambios profundos al modelo base.
Qué cambia. ShotPlan introduce un planning token que funciona como un marcador temporal. El token se inserta en la secuencia de entrada y se asocia a una coordenada temporal precisa a través de FRoPE (Fractional Temporal Rotary Position Embedding). En la práctica, le dice al modelo: «en el fotograma 47, cambia de plano». El modelo aprende a respetar estos marcadores durante el entrenamiento, sin cambiar su arquitectura base.
El resultado, según los autores, es que los cortes secos ocurren a menos de un fotograma de distancia del índice solicitado. El mismo mecanismo permite disolvencias y movimientos de cámara limitados a una porción temporal del clip. Esto significa que puedes especificar un guión de planos en el prompt y el modelo lo respeta en los fotogramas correctos.
Los números. Los autores afirman que ShotPlan supera los métodos existentes en coherencia entre planos y flexibilidad en la gestión de inquadrature. Los detalles cuantitativos completos están en el paper en arXiv (2607.17675, 19 de julio de 2026). El modelo base es Wan2.2-T2V-A14B, 14 mil millones de parámetros.
Limitaciones. El paper es reciente y los 30+ demos disponibles están curados por los propios autores: falta evaluación independiente en casos de uso reales. El sistema se prueba en un único modelo base, y la generalización a otras arquitecturas video diffusion está por demostrarse. La inferencia requiere hardware significativo, lo que limita el acceso a quien tiene GPUs de clase datacenter. Para quien produce video con IA hoy, ShotPlan es una señal de hacia dónde va la investigación, y una herramienta en desarrollo para el workflow de mañana temprano.