Un agente RL entrena modelos con RL por 1300 dólares
Un proyecto open source en GitHub ha entrenado un agente IA (basado en Qwen3.6-35B con LoRA) para escribir configuraciones de entrenamiento completas para modelos más pequeños, usando reinforcement learning en ambos bucles. El agente recibe una descripción de la tarea (“enseña a un modelo a resolver consultas multi-hop sobre personajes”), escribe el entorno, la función de recompensa, el dataset e hiperparámetros, e inicia el trabajo en GPU Runpod. La recompensa del agente depende de qué tan bien el modelo entrenado se desempeña en una evaluación oculta.
El costo total del entrenamiento del agente fue de aproximadamente 1300 dólares. El proyecto lo abrió todo: los pesos del agente (adaptador LoRA en Hugging Face), el código de orquestación GPU, las familias de tareas, el código de recompensas y los reportes detallados de cada intento, incluyendo los fracasos. El agente pasó de una recompensa ~0.0 a un pico de ~0.63 en 54 pasos, y mostró capacidades de transferencia en tareas nunca vistas durante el entrenamiento.
Por qué te importa: hace apenas unos meses, este tipo de meta-aprendizaje era territorio de laboratorios de investigación. Ahora el costo está al alcance de quien quiera experimentar en serio, y la infraestructura para agentes que entrenan modelos se está democratizando. El proyecto demuestra que puedes construir un ciclo completo de entrenamiento agéntico con recursos accesibles, y que la transparencia en el proceso (incluidos los fracasos) marca la diferencia para quien aprende.
En detalle
Cómo funciona
Dos bucles RL separados, dos stacks de entrenamiento distintos. En el bucle externo, el agente entrenador (Qwen3.6-35B con LoRA) se entrena con Tinker y el cookbook de importance-sampling GRPO. Un episodio consiste en recibir una especificación de tarea, trabajar en un workspace mediante herramientas de edición de archivos y enviar un trabajo completo. La recompensa del episodio es la puntuación del modelo entrenado en una evaluación oculta.
En el bucle interno, el modelo pequeño (Qwen3-0.6B o 1.7B) se entrena en la tarea con prime-rl (GRPO) en GPU Runpod, usando la configuración escrita por el agente: entorno de verificación, rúbrica de evaluación y config TOML.
Qué aprendió
La recompensa subió en dos escalones distintos. El agente aprendió a elegir el mejor modelo base para la tarea y mostró capacidades de transferencia en una familia de tareas completamente excluida del entrenamiento. No todas las ejecuciones fueron bien: el repositorio incluye retrospectivas de intentos fallidos, un nivel de transparencia inusual.
La infraestructura
La orquestación GPU gestiona la asignación de máquinas Runpod, el envío de trabajos y el retorno de resultados. Los scripts de entrenamiento interno (prime-rl) y los materiales de evaluación están todos en el repositorio. El proyecto también incluye un sistema de análisis para entender qué aprendió a hacer bien el agente y dónde todavía falla.
Costos y reproducibilidad
Aproximadamente 1300 dólares para todo el entrenamiento del agente. Todo lo necesario para replicar el experimento es público: código, configuraciones, pesos del agente entrenado (en Hugging Face), e incluso las notas personales del autor sobre los pilotos fallidos. Una señal fuerte de que la infraestructura para agentes de entrenamiento se está moviendo del laboratorio de investigación al espacio accesible para quien tiene un presupuesto modesto y ganas de experimentar.
Implicaciones
Meta-aprendizaje con RL a costos accesibles demuestra que el ciclo “IA entrena IA” ya no es territorio exclusivo de los grandes laboratorios. La transparencia del proyecto (fracasos documentados, retrospectivas honestas) ofrece un ejemplo de cómo compartir experimentos complejos para que otros realmente aprendan, no solo repliquen el éxito.