Radar · 28/07/2026 · ocurrido el 26/07/2026

Planificación multi-turno: el paper de Qwen sobre cómo se forma y se afina la planificación agéntica

Un paper del equipo Qwen (CASIA) construye un entorno controlado para estudiar una pregunta que había quedado abierta: cómo un foundation model aprende planificación multi-turno en horizontes largos. La respuesta pasa por tres fases, desde la adquisición durante el pre-training hasta la integración mediante multi-teacher on-policy distillation.

Los resultados clave importan a quien entrena agentes. Durante el pre-training, construir un modelo del mundo explícito mediante chain-of-thought ayuda la generalización, mientras que las habilidades atómicas por sí solas no bastan para componer planes complejos. Las trayectorias subóptimas dañan mucho: los errores se amplifican en cada turno. En el post-training, on-policy distillation (OPD) tiene una región eficaz más amplia que GRPO cuando los datos son escasos y el horizonte se alarga, porque proporciona direcciones de actualización más consistentes. La multi-teacher OPD (MOPD) integra capacidades de múltiples entornos convergiendo hacia patrones compartidos, pero si los patrones están en conflicto la interferencia es severa.

Para quien hace self-play en agentes, el mensaje operativo es directo. La calidad de las trayectorias importa más que la cantidad: un agente que aprende de sus propios rollos en horizontes largos necesita caminos correctos, porque un error temprano no se disuelve, se multiplica. Y cuando destilas de múltiples maestros, la compatibilidad de sus estilos de planificación decide si las competencias se suman o se anulan.

Es el mismo hilo de Experience Distillation del que hablábamos el 26 de julio: el agente aprende de sus propios rollos, no solo de demostraciones externas.

En detalle

El punto de partida del paper es una paradoja de la investigación agéntica. Los foundation model se entrenan en miles de millones de páginas web, pero nadie sabe decir con precisión qué en esos datos les enseña a planificar en múltiples turnos. El modelo funciona, pero quedan desconocidos los ingredientes del training que produjeron la capacidad observada. El equipo CASIA construyó un entorno multi-turno controlado, donde cada variable es manipulable, y lo usó para estudiar la planificación en tres fases distintas.

Fase 1: adquisición en el pre-training. Aquí se aíslan los ingredientes del pre-training que hacen que un modelo sea capaz de planificar, antes de cualquier affinación. El resultado principal es que construir un modelo del mundo explícito, mediante chain-of-thought que modelea las transiciones de estado, produce mejor generalización en horizontes largos. Las habilidades atómicas, tomadas singularmente, no se componen bien en planes complejos: hace falta algo de datos sobre horizontes largos ya desde el pre-training. Y las trayectorias subóptimas son particularmente dañinas, porque en un plan de diez pasos un error en el tercer paso contamina todo lo que viene después. Quien hace reinforcement learning lo sabe intuitivamente, pero el paper lo cuantifica en un setting controlado.

Fase 2: ajuste en el post-training. El paper compara dos técnicas: GRPO (Group Relative Policy Optimization, un método de reinforcement learning que evalúa grupos de respuestas relativas) y OPD (On-Policy Distillation, donde el modelo aprende de sus propias trayectorias generadas on-policy, no de demostraciones estáticas). Usando mutual information, los autores distinguen dos componentes de la planificación: los patrones generales (cómo estructurar un plan) y el conocimiento específico de la tarea (qué pasos dar en un dominio particular). Para los patrones generales, identifican tres regiones en las que el post-training es innecesario (el modelo ya lo sabe), eficaz, o sin apoyo suficiente. OPD tiene una región eficaz más amplia que GRPO en settings de baja calidad y horizonte largo, porque proporciona direcciones de actualización más consistentes. Para el conocimiento específico, destilar procedimientos nunca vistos de un maestro con conocimientos diversos puede dañar el modelo del mundo preexistente del estudiante sin estabilizar el nuevo conocimiento.

Fase 3: integración con MOPD. Multi-teacher on-policy distillation significa tomar múltiples maestros, cada uno experto en un entorno diferente, e integrar el modelo hacia patrones de planificación compartidos. Patrones compatibles permiten generalización cross-ambiental. Patrones parcialmente compartidos soportan continual learning. Patrones completamente en conflicto causan interferencia severa: si dos maestros planifican de formas incompatibles, el estudiante no aprende ambas, empeora.

Los límites. El estudio ocurre en entorno controlado, que es tanto el punto fuerte (aislamiento de variables) como el límite principal. La transferabilidad al mundo real, con datos ruidosos y entornos no simulables, queda por demostrar. Los autores no reportan en el abstract números de benchmark comparables con modelos de producción. Código y dataset se publican en GitHub y Hugging Face para quien quiera replicar.

Para quien construye agentes en producción, la implicación práctica más directa concierne la fase de post-training. Si estás afinando un agente en tareas multi-turno, la calidad de las trayectorias de training se convierte en la variable dominante. Un único paso equivocado en una secuencia larga vale más que diez pasos equivocados en secuencias cortas, porque el error se propaga. Y si estás destilando de múltiples modelos maestros, verifica primero que sus estilos de planificación sean compatibles.

Escribe para buscar en curso, playbooks, skills, papers…