Radar · 21/07/2026 · survenu le 19/07/2026 · recherche

ShotPlan : les planning tokens apportent le montage dans le modèle vidéo

Les chercheurs de Tele-AI ont publié ShotPlan, un framework qui ajoute une planification explicite des coupes aux modèles de génération vidéo. Le problème est concret : les générateurs vidéo actuels produisent des clips cohérents isolés, mais si tu leur demandes une séquence de plusieurs plans avec une narration qui s’enchaîne, ils perdent le fil.

Le mécanisme est simple dans son concept. Un seul planning token, répliqué pour chaque transition requise et positionné à des coordonnées temporelles fractionnaires via FRoPE, indique au modèle pré-entraîné où couper. Aucune modification architecturale, aucun masque d’attention. Les coupes sèches arrivent à moins d’une frame de l’indice demandé, et le même système gère les transitions douces et les mouvements de caméra localisés.

Pourquoi c’est pertinent pour toi. Si tu génères des vidéos avec l’IA pour travailler, tu connais le grand saut : de « un beau clip de 5 secondes » à « trois plans qui racontent un product video ». C’est là que les outils actuels s’effondrent. Tu dois générer chaque clip séparément, les monter à la main, et espérer que les personnages et le style tiennent d’une prise à l’autre. ShotPlan fait un pas vers la génération multi-plan contrôlée, c’est le format dont tu as réellement besoin pour les spots, les contenus réseaux sociaux, les vidéos pédagogiques.

Les modèles entraînés, le dataset et plus de 30 démos sont publics sur Hugging Face et sur le site du projet. Le modèle de base est Wan2.2-T2V-A14B, un video diffusion model de 14 milliards de paramètres.

Si tu veux l’essayer, les poids sont sur Hugging Face (Pensioner/ShotPlan-Wan2.2-T2V-A14B-HighNoise) avec le dataset d’entraînement. Tu auras besoin d’une GPU capable de supporter un modèle video diffusion de cette taille.

En détail

Les modèles de génération vidéo basés sur diffusion produisent un nombre fixe de frames à partir d’un prompt textuel. Ils fonctionnent bien pour une seule prise : une personne qui marche, un paysage qui se déplace. Mais le cinéma, même élémentaire comme celui d’un product video, est fait de coupes. D’abord un plan large, puis un détail, puis un panoramique. Si tu essaies de décrire tout dans un seul prompt, le modèle mélange les plans ou les ignore.

Ce qu’il y avait avant. Ceux qui voulaient produire des séquences multi-plan avec l’IA recouraient à deux stratégies, toutes deux insatisfaisantes. La première : générer des clips séparés et les monter en post-production, avec le problème que les personnages et les environnements ne sont pas cohérents d’un clip à l’autre. La deuxième : utiliser des prompts très longs en espérant que le modèle respecte un scénario, avec des résultats imprévisibles. Certaines approches académiques avaient essayé de conditionner le modèle avec des masques d’attention ou des architectures modifiées, mais elles nécessitaient un entraînement de zéro ou des modifications substantielles au modèle de base.

Ce qui change. ShotPlan introduit un planning token qui fonctionne comme un marqueur temporel. Le token est inséré dans la séquence d’entrée et associé à une coordonnée temporelle précise via FRoPE (Fractional Temporal Rotary Position Embedding). En pratique, il dit au modèle : « à la frame 47, change de plan ». Le modèle apprend à respecter ces marqueurs pendant l’entraînement, sans modifier son architecture de base.

Le résultat, selon les auteurs, c’est que les coupes sèches se produisent à moins d’une frame de distance de l’indice demandé. Le même mécanisme supporte les transitions douces et les mouvements de caméra limités à une portion temporelle du clip. Cela signifie que tu peux spécifier un scénario de plans dans le prompt et le modèle le respecte aux bonnes frames.

Les chiffres. Les auteurs affirment que ShotPlan surpasse les méthodes existantes pour la cohérence inter-plans et la flexibilité de gestion des plans. Les détails quantitatifs complets sont dans le paper sur arXiv (2607.17675, 19 juillet 2026). Le modèle de base est Wan2.2-T2V-A14B, 14 milliards de paramètres.

Limitations. Le paper est récent et les 30+ démos disponibles sont curées par les auteurs eux-mêmes : il manque une évaluation indépendante sur des cas réels. Le système est testé sur un seul modèle de base, et la généralisation à d’autres architectures video diffusion reste à prouver. L’inférence nécessite du hardware significatif, ce qui restreint le champ à ceux qui ont accès aux GPU de classe datacenter. Pour ceux qui produisent des vidéos avec l’IA aujourd’hui, ShotPlan est un signal de la direction de la recherche, et un outil en développement pour le workflow de demain matin.

Tapez pour chercher dans cours, playbooks, skills, papers…