OpenForgeRL: entrenar agentes con harness nativo en stack open-source
Un paper de HuggingFace presenta OpenForgeRL, un framework open-source para entrenar agentes que utilizan harness complejos como Claude Code o Codex. Hasta ahora el problema era práctico: los stacks de training abiertos (SFT y RL) no pueden gestionar la inferencia stateful y multi-proceso que un harness real requiere. Era posible evaluar un agente en un harness, pero no entrenarlo dentro de él.
OpenForgeRL lo resuelve con dos componentes. Un proxy ligero intercepta las llamadas del modelo durante el uso del harness y las registra como datos de training para un codebase RL estándar (veRL). Un orquestador Kubernetes ejecuta cada rollout en un container remoto separado. Training e inferencia se desacoplan: el modelo aprende en el entorno real donde se despliega.
Como contábamos el 20 de julio, la orquestación importa más que el modelo en agentes en producción. OpenForgeRL lleva ese principio al training: el harness se convierte en el lugar donde el agente aprende, no solo donde trabaja.
Los resultados son medibles. OpenForgeGUI alcanza 37.7 en OSWorld-Verified y 72.3 en WebVoyager, superando baselines open de tamaño similar e igualando modelos varias veces más grandes. El paper es honesto sobre las limitaciones: la recuperación de errores sigue siendo débil incluso después de RL, y algunos harness son sustancialmente más difíciles de aprender que otros.
Si quieres probarlo: el código es público, pero necesitas un cluster Kubernetes y familiaridad con stacks RL como veRL. Es investigación reproducible, no un trabajo de una tarde.
En detalle
La idea de “harness” merece aclaración. Cuando usas Claude Code o Codex, el modelo no trabaja solo: una arquitectura de software alrededor de él gestiona el contexto, invoca herramientas, decide cuándo parar e intentar de nuevo. Esa arquitectura es el harness. Es lo que marca la diferencia entre un modelo que responde una pregunta y un agente que completa una tarea multi-paso.
El problema del training es que esta arquitectura es stateful: mantiene estado entre una llamada y otra, se ejecuta en procesos separados, accede a filesystem y red. Los stacks de reinforcement learning open-source como veRL asumen que un episodio de training es una secuencia lineal de llamadas al modelo. Un harness real rompe esa suposición: cada paso puede generar subprocesos, escribir archivos, hacer llamadas de red, y el resultado de una acción depende de todo lo que pasó antes de manera no trivial.
La solución de OpenForgeRL es elegante en su simplicidad. En lugar de modificar el stack RL para entender el harness, coloca un proxy en el medio. El proxy actúa como intermediario para las llamadas del modelo: el harness cree que habla con el modelo real, el proxy registra todo y luego reproduce la trayectoria para el training. En el frente de orquestación, cada episodio de training se ejecuta en un container Kubernetes aislado, así el entorno es limpio y reproducible.
Los números deben leerse en su contexto. En ClawEval, OpenForgeClaw alcanza 31.7 pass^3 y 55.9 pass@3 con cientos o miles de tareas. En benchmarks de GUI, OpenForgeGUI obtiene 37.7 en OSWorld-Verified y 72.3 en WebVoyager. En el caso de GUI, los resultados igualan o superan modelos varias veces más grandes, lo que sugiere que el training en el harness real importa más que la escala del modelo.
El paper reporta dos hallazgos relevantes para quien construye agentes. Primero: el RL mejora la confiabilidad del agente, en particular la auto-verificación, la cobertura de herramientas y la ejecución de planes multi-paso. Segundo: la recuperación de errores sigue siendo débil. Un agente entrenado con RL aprende a usar mejor las herramientas cuando todo funciona bien, pero no aprende a recuperarse cuando algo se rompe en el medio. Es una limitación estructural, no un bug que arreglar con más datos.
El tercer hallazgo trata sobre los harness mismos: algunos son sustancialmente más difíciles de aprender para el modelo, independientemente de la calidad del training (ZeroClaw, OpenClaw y Codex dan resultados muy diferentes a igualdad de modelo). Esto confirma un punto que se vuelve sólido en la investigación: la elección del harness cambia el rendimiento del agente tanto como la elección del modelo.
Qué no concluir: OpenForgeRL no significa que entrenar agentes se haya vuelto fácil. Se necesita un cluster, se necesita familiaridad con RL, y las tareas deben diseñarse bien. El paper usa cientos o miles de tareas, pero cada una debe ser verificable. Para quien quiere construir agentes con stacks abiertos, el valor está en que la brecha entre infraestructura propietaria y abierta se estrecha en el frente del training, no solo en la inferencia, donde modelos open-weight como Laguna S ya estaban recuperando terreno.