Radar · 28/07/2026 · ocurrido el 26/07/2026 · investigación

WorldDiT y Sol-Attn: los diffusion transformers aprenden a mover robots y a ahorrar atención

Dos papers publicados el mismo día en Hugging Face Daily Papers convergen en un punto: los diffusion transformers pueden volverse más eficientes en dos frentes distintos, la generación de vídeo y el control robótico.

WorldDiT (Bagel Labs) integra en una única arquitectura la generación de acciones del robot y el modelado visual del mundo. Lo relevante es que lo hace sin depender de un gran modelo vision-language preentrenado como columna vertebral para la acción, que es el enfoque costoso dominante en las políticas robóticas actuales. En los cuatro benchmarks LIBERO, WorldDiT se sitúa en la frontera de Pareto entre número de parámetros y tasa de éxito, con menos de mil millones de parámetros.

Sol-Attn (NVIDIA Labs) acelera la inferencia en modelos de generación de vídeo haciendo la atención dinámica y dispersa, sin necesidad de reentrenamiento. Los números reportados en la página del paper: de 2 a 5 veces más rápido end-to-end en modelos como Wan 2.1-14B y HunyuanVideo-13B respecto a la atención densa de FlashAttention-3.

Para quienes usan o construyen con IA estas dos direcciones importan porque reducen el costo de dos de las tareas más caras hoy: generar vídeo y controlar robots. WorldDiT reduce la dependencia de VLM grandes y costosos. Sol-Attn se aplica sin tocar los pesos del modelo, así que puede insertarse en pipelines existentes.

Como contábamos el 22 de julio, los modelos que aprenden física desde vídeos se están convirtiendo en la base para entrenar agentes robóticos sin simuladores costosos. WorldDiT es un paso concreto en esa dirección.

En detalle

Los diffusion transformers han reemplazado las redes U-Net en la generación de vídeo e imágenes. La ventaja es la escalabilidad: crecen mejor con más datos y más parámetros. El precio es la atención, el mecanismo que compara cada pieza de input con todas las demás. En vídeos, donde cada frame genera miles de tokens, la atención se convierte en el cuello de botella dominante durante la inferencia.

Sol-Attn aborda este cuello de botella con una idea: en lugar de calcular la atención sobre todos los bloques de tokens, la calcula solo sobre los bloques que importan, y lo hace al vuelo, sin un pase de routing previo. El método es training-free: se aplica a un modelo ya entrenado sin modificar sus pesos. Los números reportados en la página del paper: 2,02 veces más rápido end-to-end en Wan 2.1-14B, 2,12 veces en HunyuanVideo-13B, hasta 2,4 veces en LTX 2.3, respecto a FlashAttention-3 densa. Integrado en el motor Sol-Engine (con kernel fusion y caching), los multiplicadores suben a 3,48x y 5,08x respectivamente. El kernel para el chip B200 todavía está siendo optimizado. El código está disponible en el repo SANA de NVlabs.

La limitación es explícita: los métodos existentes de sparse attention luchan por ser eficientes y precisos simultáneamente, porque la selección de bloques es rígida y costosa. Sol-Attn lo resuelve reutilizando los scores proxy para aproximar los bloques no seleccionados en un único pase de softmax online. Si esto se mantiene con vídeos largos o con movimientos complejos requiere verificación en casos de uso concretos.

WorldDiT trabaja en otro frente. Las políticas robóticas actuales persiguen mejores resultados usando grandes VLM preentrenados como columna vertebral para generar acciones. Es costoso y crea dependencia de modelos no diseñados para el control físico. WorldDiT acopla la generación de acciones con el modelado visual del mundo en un solo diffusion transformer: durante el entrenamiento, el modelo genera chunks de acciones continuas y predice los frames futuros de la cámara como patches RGB normalizados. En los cuatro benchmarks de simulación LIBERO, se sitúa en la frontera de Pareto entre parámetros totales y tasa de éxito entre métodos que reportan los cuatro suites, con menos de mil millones de parámetros.

La limitación aquí es clara: LIBERO es simulación, no el mundo físico. El salto del simulador al robot real sigue abierto. Pero un modelo sub-billion que está en la frontera de Pareto demuestra que necesita menos infraestructura de la que se pensaba para lograr un control robótico razonable.

Los dos papers convergen en una idea de fondo: los diffusion transformers funcionan mejor cuando dejan de tratar todo de la misma manera. WorldDiT separa la generación de acción de la necesidad de un VLM enorme. Sol-Attn separa la atención de la necesidad de mirar todo. En ambos casos la ganancia es eficiencia, sin sacrificar calidad.

Escribe para buscar en curso, playbooks, skills, papers…