LLM-as-a-Coach: el feedback textual reemplaza la puntuación en el post-training
Un paper de Microsoft Research propone “Experiential Learning” (EL), un método de post-training que separa el reinforcement learning del coaching textual. En lugar de reducir la evaluación de un modelo-juez a un único número, el feedback textual se preserva y se internaliza en el modelo como conocimiento experiencial.
El post-training en tareas abiertas (escritura, respuestas a preguntas sin respuesta verificable, ayuda en tareas creativas) hoy comprime la evaluación en una recompensa escalar. Dos respuestas de calidades diferentes pueden recibir la misma puntuación, y el modelo aprende a perseguir el número en lugar de mejorar realmente. EL aborda este límite: el juez deja de dar una nota y escribe una evaluación que el modelo puede leer, comprender e interiorizar. Los resultados del paper muestran mejor generalización fuera del conjunto de training y menos reward hacking.
Como contábamos el 14 de julio, la tendencia en post-training es hacia la modularidad: separar las tareas (exploración, alineamiento, y ahora coaching) hace que cada fase sea más controlable y reutilizable. Este paper lleva la misma idea un paso más allá, en el frente de la señal de feedback.
En detalle
El problema que el paper aborda es tan antiguo como el RLHF: cuando entrenas un modelo con reinforcement learning en tareas abiertas, necesitas una señal numérica para decirle al algoritmo si una respuesta es buena o no. Para obtenerla, usas un modelo (el “juez”) que evalúa las respuestas según una rúbrica, una lista de criterios. El juez lee la respuesta, evalúa cada criterio, y luego todo se comprime en un número. Si la respuesta tiene una estructura excelente pero una argumentación débil, el número final quizá sea 0.7. Si otra respuesta tiene una estructura mediocre pero una argumentación fuerte, quizá también sea 0.7. El modelo que aprende de ese número no puede distinguir entre los dos perfiles.
EL (Experiential Learning) cambia el canal. El juez escribe una evaluación textual detallada, como lo haría un revisor humano con un bolígrafo rojo. Esta evaluación se “destila” en conocimiento experiencial: condiciona un modelo profesor que genera mejores respuestas, y el modelo principal internaliza este conocimiento en sus pesos a través de un proceso llamado “on-policy context distillation”.
La diferencia con el RL clásico es el ancho de banda de la señal. Un número es un canal estrecho: solo te dice “mejor” o “peor”. El texto te dice qué es mejor, por qué, y qué debería cambiar. El paper muestra que este canal más amplio produce supervisión más densa y preserva las preferencias finas entre respuestas de alta calidad.
Los resultados, medidos en dos familias de modelos con feedback del propio modelo o de un modelo propietario, muestran tres cosas. Primero: EL supera al RL basado en rúbrica en tareas abiertas held-out e inéditas. Segundo: generaliza mejor fuera de la distribución de training. Tercero: mitiga el reward hacking, el fenómeno en el que el modelo aprende a engañar al juez para obtener una puntuación alta sin mejorar realmente.
Para quienes experimentan con post-training, la lección práctica es que el formato del feedback importa tanto como su calidad. Un feedback textual estructurado cuesta más tokens y más cómputo, pero produce modelos que entienden qué los hace mejores en lugar de perseguir una métrica proxy. Es la misma dirección del framework de post-training modular de julio: separar las fases hace que cada pieza sea más controlable.
Las limitaciones. El paper es de Microsoft Research y tiene 7 upvotes en Hugging Face al momento de la publicación: es un resultado fresco, con revisión comunitaria aún escasa. Los detalles completos sobre arquitectura e hiperparámetros estarán en el paper completo y en el código, que los autores anuncian en aka.ms/el-code pero aún no está verificado como accesible. Las evaluaciones se refieren a tareas abiertas (no verificables): el método se aplica donde la recompensa no puede calcularse de manera determinista, y no reemplaza el RL en tareas con respuesta exacta (matemáticas, coding). Como en todo paper de post-training, la reproducibilidad depende del acceso a recursos de cómputo para training, que no están al alcance de todos.