Experience Distillation: fijar en los pesos lo que aprende el agente de sus interacciones
Un paper publicado en HuggingFace Daily Papers propone Experience Distillation: una técnica para fijar en los pesos del modelo lo que un agente aprende de su historial de interacciones, sin necesidad de ejecutar ciclos adicionales en el entorno.
El problema es bien conocido para quien construye agentes que funcionan en tareas repetitivas. El agente mejora si lo dejas con los intentos anteriores en el contexto, pero las ventajas desaparecen tan pronto como vacías la ventana. El fine-tuning tradicional sobre los datos recolectados recupera solo el 3,8% de esa ganancia (paper en HuggingFace, 22 de julio de 2026), porque el modelo aprende a imitar las acciones sin entender la lógica detrás.
Experience Distillation retiene al menos el 64,8% de la ventaja del in-context learning en 749 tareas de ingeniería de software y seis juegos textuales, y alcanza el desempeño de los baseline de reinforcement learning con 9,6 veces menos interacciones con el entorno. El tema es el mismo que tocamos hablando de OpenForgeRL: cómo hacer eficiente el aprendizaje de agentes sin gastos prohibitivos de muestreo. Aquí el muestreo ya está hecho, y lo que resta es la destilación del material recolectado.
Para quien tiene agentes en producción que acumulan trazas de interacción, la dirección es tener agentes que realmente mejoren con el tiempo, no solo sesión por sesión.
En detalle
El in-context learning es el mecanismo más simple para hacer aprender un agente: le pones en el prompt el historial de lo que intentó, qué funcionó y qué no, y el modelo usa ese historial para comportarse mejor. Funciona, y funciona bien, porque el modelo ve la experiencia completa y puede razonar sobre ella. El problema es que la ventana de contexto es un banco de trabajo, no un archivo. Cuando el historial crece, llena la ventana, y si lo quitas el modelo vuelve al punto de partida.
La solución obvia es el fine-tuning: recolectas las interacciones y entrenas el modelo con esos datos. El paper lo intenta y el resultado es decepcionante. En las tareas de ingeniería de software y en los juegos textuales, el fine-tuning supervisado recupera solo el 3,8% de lo que el in-context learning había ganado. El modelo aprende a reproducir las acciones pero pierde la conexión entre la observación del entorno y la decisión que las motivaba.
Experience Distillation toma un camino diferente. En lugar de entrenar el modelo a reproducir acciones, usa context distillation, una técnica ya conocida que transfiere información del contexto a los pesos del modelo. Aquí se aplica a historiales completos de interacción, no a instrucciones individuales o ejemplos. El punto clave es que no requiere ninguna interacción adicional con el entorno. Se recolecta la experiencia una vez, se destila, y se obtiene un modelo que ha interiorizado parte de lo que había aprendido en contexto.
Los números, medidos en 749 tareas de ingeniería de software curadas y seis juegos textuales, dicen que la destilación retiene al menos el 64,8% de la ganancia del in-context learning en ambos dominios. Comparado con los baseline clásicos de reinforcement learning, el in-context learning seguido por destilación iguala su desempeño con al menos 9,6 veces menos muestras del entorno.
Qué significa para quien construye. Si tienes un agente que funciona en tareas repetitivas (depuración, búsqueda, análisis de datos), cada sesión produce trazas de interacción que normalmente se pierden. Este paper sugiere que esas trazas, si se destiilan correctamente, pueden convertirse en mejora permanente del modelo. No reemplazan el reinforcement learning desde cero, pero reducen drásticamente el número de interacciones ambientales necesarias para alcanzar el mismo resultado.
Las limitaciones. El paper mide dos dominios específicos y no es seguro que el 64,8% se generalice a tareas diferentes. La ganancia es “al menos” 64,8%, pero no se especifica cuánto varía entre tareas simples y complejas. La destilación requiere acceso a los pesos del modelo, así que no es aplicable para quien usa modelos vía API sin posibilidad de fine-tuning. Y la comparación con los baseline de RL usa métricas de desempeño, no de robustez: un modelo destilado podría ser más frágil frente a inputs fuera de distribución que uno entrenado con RL desde el principio.