Chain-of-Thought: por qué «razona paso a paso» funciona de verdad
Si alguna vez has añadido «muéstrame los pasos» a una petición y has obtenido una respuesta mejor, has usado sin saberlo el resultado de este paper. La pregunta que responde es sencilla: ¿pedirle al modelo que escriba su razonamiento antes de la respuesta lo hace mejor? En 2022 un grupo de Google (Jason Wei y colegas) midió que sí, pero solo a partir de modelos bastante grandes. El nombre que le dieron a la técnica, chain-of-thought, entró en el vocabulario de cualquiera que escriba prompts.
Por qué te importa
Es la explicación de un gesto que probablemente ya haces. Cuando un asistente te da un total equivocado, una clasificación apresurada o una estimación sacada de la nada, la defensa más sencilla es obligarlo a trabajar a la vista: enumera los pasos, muestra el cálculo, y luego concluye. Este paper dice por qué ese gesto ayuda y, sobre todo, cuándo no sirve para nada. Conocer el límite te evita malgastar palabras con modelos pequeños, donde el truco no muerde, y confiar demasiado en los pasos que lees: parecen una demostración, pero no siempre lo son.
Qué dice el paper
La idea es mínima. En el prompt, en lugar de mostrarle al modelo solo ejemplos de pregunta y respuesta, le muestras ejemplos en los que entre la pregunta y la respuesta está el razonamiento escrito por extenso: «Roger tiene 5 pelotas, compra 2 paquetes de 3, así que 5 más 6 son 11». Bastan unos pocos ejemplos de este tipo (en el paper usan ocho) para que el modelo imite el estilo y, ante una pregunta nueva, escriba también él los pasos antes de responder.
El resultado que hizo ruido es sobre GSM8K, una colección de problemas de matemáticas de primaria, de esos de varios pasos donde equivocarse en una parte lo arruina todo. Con solo añadir los ejemplos razonados, el modelo más grande de la época (PaLM, 540 mil millones de parámetros) llega al primer puesto absoluto en ese banco de pruebas, superando incluso a un GPT-3 entrenado a propósito y acompañado de un verificador externo. En los modelos más grandes, en el problema más difícil del lote, la puntuación más que se duplica frente al prompting normal. La mejora también se ve en razonamiento aritmético, de sentido común y simbólico, y crece cuantos más pasos tiene el problema: en las preguntas de un solo paso la diferencia es pequeña, en las de varios pasos es grande.
El punto más importante del paper no es el número, es la condición. El chain-of-thought es emergente con la escala: por debajo de cierto tamaño de modelo no ayuda, y a veces empeora las cosas, porque el modelo pequeño escribe un razonamiento inconexo y luego se apoya en él. Por encima del umbral (en el paper, en torno a los cien mil millones de parámetros para los modelos de entonces) el beneficio aparece y crece. No es una receta que valga siempre: es una capacidad que se enciende cuando el modelo es lo bastante grande.
Cuánto fiarse
El paper es sólido en lo que mide y honesto en sus límites. Tres cosas conviene tener en cuenta antes de generalizar.
La primera: los números son de 2022, sobre modelos de esa generación. Los modelos de hoy a menudo razonan por pasos solos, sin que se lo pidas, y algunos tienen un modo de razonamiento dedicado. La ganancia marginal del «razona paso a paso» en un modelo moderno puede ser, por tanto, mucho más pequeña que la que se reporta aquí: la técnica sigue siendo válida como principio, pero no esperes los mismos saltos.
La segunda: el razonamiento escrito no es una garantía. El modelo produce una cadena de pasos plausible, y a veces llega a la respuesta correcta con pasos equivocados, o a la respuesta equivocada con pasos que parecen correctos. Leer los pasos te ayuda a controlar, pero no son una demostración: son un texto que el modelo ha generado como todo lo demás. Trátalos como una pista que verificar, no como una prueba.
La tercera es una precisión de autoría, útil para no equivocar la técnica. Este paper introduce el chain-of-thought con ejemplos: le muestras tú algunos razonamientos hechos bien, y él los imita. La fórmula que todos conocen, «piensa paso a paso» añadido a una pregunta sin ejemplos, viene de un trabajo posterior de la misma línea (Kojima y colegas, también 2022): funciona, pero es algo un poco distinto y en general menos potente que los ejemplos razonados. Cuando una tarea importa de verdad, mostrar dos o tres pasos hechos bien casi siempre gana a la mera invitación a pensarlo.
Qué hacer con ello
La regla práctica que sale del paper es corta. Cuando la tarea tiene varios pasos (un cálculo, una estimación, una clasificación con criterios, una deducción a partir de hechos dispersos) pídele al modelo que escriba los pasos antes de la conclusión, y si puedes, muéstrale un ejemplo del razonamiento que esperas. Obtendrás respuestas mejores y, algo igual de útil, verificables: si el total está mal, ves en qué paso se torció.
Qué no concluir. Que el modelo «razona» como una persona: está continuando un texto en un estilo que le has mostrado, y que el texto se parezca a un razonamiento no significa que dentro ocurra un razonamiento. Y no concluyas que más pasos son siempre mejor: en una pregunta trivial, obligar al modelo a desplegar un razonamiento añade palabras, coste y ocasiones de equivocarse, sin mejorar la respuesta. El chain-of-thought es una palanca para los problemas difíciles, no un condimento para poner en todo.
Dónde profundizar
El capítulo «Dar instrucciones que funcionan» del itinerario pro convierte este resultado en una manera de escribir las peticiones, y «Confiar en la medida justa» aborda la trampa de los pasos que convencen pero no demuestran.