Radar · 28/07/2026 · survenu le 26/07/2026 · recherche

WorldDiT et Sol-Attn : les diffusion transformers apprennent à piloter les robots et à économiser l'attention

Deux articles publiés le même jour sur Hugging Face Daily Papers convergent sur un point : les diffusion transformers peuvent devenir plus efficaces sur deux fronts différents, la génération vidéo et le contrôle robotique.

WorldDiT (Bagel Labs) fusionne dans une architecture unique la génération des actions du robot et la modélisation visuelle du monde. Le point pertinent est qu’il le fait sans s’appuyer sur un grand modèle vision-language pré-entraîné comme épine dorsale pour l’action, ce qui est l’approche coûteuse dominante dans les policy robotiques actuelles. Sur les quatre benchmarks LIBERO, WorldDiT se situe sur la frontière de Pareto entre nombre de paramètres et taux de succès, avec moins d’un milliard de paramètres.

Sol-Attn (NVIDIA Labs) accélère l’inférence des modèles de génération vidéo en rendant l’attention dynamique et éparse, sans nécessiter de réentraînement du modèle. Les chiffres rapportés dans la page du papier : 2 à 5 fois plus rapide end-to-end sur des modèles comme Wan 2.1-14B et HunyuanVideo-13B par rapport à l’attention dense de FlashAttention-3.

Pour ceux qui utilisent ou construisent avec l’IA, ces deux directions sont importantes car elles réduisent le coût de deux des tâches les plus coûteuses aujourd’hui : générer des vidéos et piloter des robots. WorldDiT réduit la dépendance aux VLM grands et coûteux. Sol-Attn s’applique sans modifier les poids du modèle, donc peut être intégré dans les pipelines existants.

Comme nous l’expliquions le 22 juillet, les modèles qui apprennent la physique à partir de vidéos deviennent la base pour entraîner des agents robotiques sans simulateurs coûteux. WorldDiT est un pas concret dans cette direction.

En détail

Les diffusion transformers ont remplacé les réseaux U-Net dans la génération de vidéos et d’images. L’avantage est la scalabilité : ils croissent mieux avec plus de données et plus de paramètres. Le prix est l’attention, le mécanisme qui fait comparer chaque élément d’entrée avec tous les autres éléments. Dans les vidéos, où chaque frame génère des milliers de tokens, l’attention devient le goulot d’étranglement dominant pendant l’inférence.

Sol-Attn aborde ce goulot d’étranglement avec une idée : au lieu de calculer l’attention sur tous les blocs de tokens, il la calcule uniquement sur les blocs qui comptent, et le fait à la volée, sans passe de routage préalable. La méthode est training-free : elle s’applique à un modèle déjà entraîné sans modifier ses poids. Les chiffres rapportés dans la page du papier : 2,02 fois plus rapide end-to-end sur Wan 2.1-14B, 2,12 fois sur HunyuanVideo-13B, jusqu’à 2,4 fois sur LTX 2.3, par rapport à FlashAttention-3 dense. Intégré dans le moteur Sol-Engine (avec kernel fusion et caching), les multiplicateurs montent à 3,48x et 5,08x respectivement. Le kernel pour le chip B200 est encore en phase d’optimisation. Le code est disponible dans le repo SANA de NVlabs.

La limitation est explicite : les méthodes existantes de sparse attention peinent à être efficaces et précises simultanément, car la sélection des blocs est rigide et coûteuse. Sol-Attn résout cela en réutilisant les scores proxy pour approximer les blocs non sélectionnés en une seule passe de softmax en ligne. Que cela tienne sur des vidéos longues ou avec des mouvements complexes reste à vérifier dans des cas d’usage concrets.

WorldDiT travaille sur un autre versant. Les policy robotiques actuelles poursuivent de meilleures performances en utilisant de grands VLM pré-entraînés comme épine dorsale pour générer les actions. C’est coûteux et crée une dépendance à des modèles non conçus pour le contrôle physique. WorldDiT couple la génération des actions avec la modélisation du monde visuel dans un seul diffusion transformer : pendant l’entraînement, le modèle génère des chunks d’actions continues et prédit les frames futurs de la caméra sous forme de patches RGB normalisés. Sur les quatre benchmarks de simulation LIBERO, il se situe sur la frontière de Pareto entre paramètres totaux et taux de succès parmi les méthodes qui rapportent les quatre suites, avec moins d’un milliard de paramètres.

La limitation ici est claire : LIBERO est une simulation, pas le monde physique. Le saut du simulateur au vrai robot reste ouvert. Mais un modèle sub-billion qui se situe sur la frontière de Pareto démontre qu’il faut moins d’infrastructure qu’on ne le pensait pour obtenir un contrôle robotique raisonnable.

Les deux articles convergent sur une idée fondamentale : les diffusion transformers fonctionnent mieux quand ils arrêtent de traiter tout de la même manière. WorldDiT sépare la génération de l’action de la nécessité d’un VLM énorme. Sol-Attn sépare l’attention de la nécessité de tout regarder. Dans les deux cas, le gain est l’efficacité, sans renoncer à la qualité.

Tapez pour chercher dans cours, playbooks, skills, papers…