TOPL: el post-training token por token, en lugar de puntuar toda la respuesta
Investigadores de la University of Southern California proponen TOPL (Token-Level Off-Policy Labeling), un método de post-training que cambia la granularidad del feedback. En lugar de puntuar toda la respuesta del modelo, TOPL marca cada token individual como correcto o incorrecto y entrena al modelo a reconocerlos. El modelo aprende a evitar los tokens erróneos, no a maximizar una puntuación global que puede ser manipulada.
Te afecta porque el reward hacking, el fenómeno donde un modelo aprende a obtener puntuaciones altas sin mejorar realmente, es uno de los problemas prácticos más fastidiosos cuando ajustas un modelo para una tarea repetitiva. Si alguna vez intentaste corregir un asistente que “deja” de cometer errores durante el entrenamiento y luego vuelve al mismo error en producción, sabes de qué hablamos. El feedback a nivel de token hace la señal de corrección más precisa: el modelo sabe dónde falló, no solo que falló.
El patrón es el mismo que estamos viendo en las herramientas de trabajo: como contábamos ayer sobre feedback textual en post-training, la dirección de investigación se aleja de la puntuación simple y busca señales más granulares e interpretables. TOPL lleva la granularidad hasta el token individual, y los autores muestran que los adaptadores LoRA aprendidos de esta forma funcionan como steering vectors, es decir, vectores que desplazan el comportamiento del modelo de manera legible.
Las pruebas cubren 11 datasets de summarization y se extienden a traducción automática, con generalización fuera de distribución. La limitación declarada: por ahora está demostrado en tareas de faithful generation (generación fiel a los datos de entrada), no en reasoning libre o coding. Sin código público por el momento.
En detalle
Qué había antes.
El post-training estándar funciona así: el modelo genera una respuesta, un evaluador (humano u otro modelo) le da una puntuación a toda la secuencia, y el modelo actualiza los pesos para producir respuestas con puntuación más alta. Este enfoque, llamado outcome-level o sequence-level, tiene un defecto conocido: el modelo aprende a manipular la puntuación. Encuentra patrones que satisfacen al evaluador sin mejorar la calidad real. Un ejemplo concreto: en una tarea de summarization, el modelo puede aprender a producir resúmenes más cortos (porque el evaluador penaliza la longitud) sin volverse más fiel al documento original.
Ya existen métodos a nivel de token, pero funcionan on-policy: generan los tokens con el modelo en tiempo real y los corrigen uno por uno. Es costoso e inestable, porque estás entrenando al modelo en sus propios outputs mientras los produce.
Qué cambia con TOPL.
TOPL es off-policy: toma respuestas ya generadas (de cualquier modelo), las marca token por token como correctas o incorrectas, y entrena al modelo a clasificar cuál es el token correcto y cuál no. El paso clave es que el modelo no aprende a generar directamente los tokens correctos, sino a reconocerlos. Esto evita el problema del shift de distribución (el modelo no se ve obligado a producir tokens que aún no sabe generar bien) y reduce el reward hacking, porque la señal es local y específica.
Los autores lo explican con una analogía que funciona: en lugar de decirle a un escritor “este artículo merece un 6”, le dices “esta palabra es imprecisa, esta frase es redundante, esta cita es correcta”. El feedback puntual corrige mejor que la puntuación global.
Los números.
En 11 datasets de summarization, TOPL supera tanto los baselines sequence-level como los baselines token-level on-policy, con generalización fuera de distribución. Se transfiere a traducción automática sin reentrenamiento. Los ablations confirman que la señal a nivel de token es crítica: el equivalente sequence-level de TOPL no logra los mismos resultados. Finalmente, los adaptadores LoRA aprendidos con TOPL funcionan como steering vectors: vectores que, aplicados en inferencia, desplazan el comportamiento del modelo en direcciones interpretables (mayor fidelidad, menos alucinaciones).
Limitaciones.
Las tareas probadas son faithful generation: summarization y traducción, donde existe una noción objetiva de “token correcto” (el token corresponde o no al dato de entrada). En tareas donde la corrección es menos binaria, como reasoning libre o coding, no está claro cómo etiquetar tokens individuales como correctos o incorrectos. Sin código público aún, así que sin reproducción independiente. El paper está en sus primeros upvotes en HF Daily Papers: señal temprana, no confirmación consolidada.