Molt de NVIDIA: el framework nativo de PyTorch que hace el entrenamiento de agentes legible
NVIDIA ha publicado Molt, un framework de entrenamiento para reinforcement learning agéntico escrito en PyTorch nativo. El objetivo es mantener bajo el costo de cada iteración de investigación.
Hoy, modificar un algoritmo de entrenamiento agéntico en un framework mainstream significa atravesar capas distintas: trainer, backend distribuido, y glue del rollout. Trabajo infraestructural que recae sobre el investigador en cada experimento. Molt comprime esas capas en una codebase compacta, lo suficientemente limpia para que un investigador la mantenga en mente, y lo suficientemente legible para que un asistente de coding AI la lea completa y razone sobre ella.
Para quienes experimentan con agentes y los entrenan, esto significa menos tiempo lidiando con la plomería y más tiempo probando ideas. El paper reporta que, con igual protocolo asincrónico, Molt es estadísticamente comparable a un stack basado en Megatron: la ligereza no cuesta prestaciones.
La línea que hace el entrenamiento de agentes accesible fuera de los laboratorios propietarios está creciendo: como contábamos el 25 de julio con OpenForgeRL, que cerraba la brecha entre harness propietarios y entrenamiento abierto, Molt ahora impulsa la legibilidad del código.
El código es open source con recipes y contenedores en GitHub.
Si quieres probarlo: el repositorio con recipes y contenedores está en github.com/NVIDIA-NeMo/labs-molt.
En detalle
El reinforcement learning agéntico es investigación hecha de experimentación continua: nuevos estimadores, nuevas fases de pipeline, nuevos esquemas de rollout. En frameworks mainstream, cada modificación debe propagarse a través de tres capas con lógicas distintas. El trainer orquesta el entrenamiento. El backend distribuido gestiona la comunicación entre GPUs. El glue del rollout recopila las experiencias del agente en el entorno. Cuanto más acopladas están las capas, mayor es el costo de cada experimento, y ese costo recae sobre el investigador cada vez.
Qué cambia con Molt. El principio rector es simple: la codebase debe ser lo suficientemente pequeña para caber en la mente, y lo suficientemente limpia para que un asistente de coding AI pueda leerla por completo y modificarla end-to-end. Es una decisión de arquitectura que privilegia la modificabilidad. El agente se trata como un programa ordinario, y un único loop asincrónico gestiona el entrenamiento de políticas multimodales y mixture-of-experts. Un detalle relevante: el sistema nunca entrena sobre tokens que el modelo no ha generado, manteniendo coherencia entre tokens, versiones de la política y semántica del modelo. Esto evita una clase de bugs sutiles que en frameworks tradicionales emergen cuando el rollout y el entrenamiento se dessincronizan.
La comparación con Megatron. Bajo un protocolo asincrónico matched, Molt resulta estadísticamente comparable a un stack basado en Megatron. El paper sostiene una afirmación precisa: la compacidad no cuesta prestaciones. Para un investigador, la diferencia está en el ciclo de modificación: cambiar un estimador o agregar una fase de pipeline significa tocar una codebase que se entiende, no tres capas acopladas donde cada modificación tiene efectos en cascada.
Los límites. La comparación es autorreferenciada: NVIDIA construye la herramienta y mide las prestaciones. “Estadísticamente comparable” significa que los resultados caen dentro de intervalos de confianza superpuestos, no que Molt domine. La reivindicación de compacidad es cualitativa: el paper no propone una métrica formal de legibilidad, se basa en que la codebase sea “compacta y limpia” según los autores. El diseño está pensado para investigadores que hacen RL agéntico con acceso a múltiples GPUs: si tu caso de uso es entrenar un agente en una tarea específica con recursos modestos, Molt podría estar sobredimensionado. Las recipes y contenedores publicados ayudan a empezar, pero la curva de entrada sigue siendo la de quien ya sabe qué es un rollout asincrónico.
El código está abierto en GitHub con recipes y contenedores. Para quienes siguen la línea del entrenamiento agéntico open-source, es otro paso hacia la modificabilidad: frameworks diseñados para ser leídos y cambiados, no solo ejecutados.