GradCuit: el reasoning latente al test time supera el chain-of-thought sin generar tokens
Un paper en arXiv (3 de agosto de 2026) presenta GradCuit, un método que mejora el razonamiento de los modelos frontier optimizando sus estados internos en el momento de la inferencia, sin reentrena los pesos ni generar más tokens. En tres benchmarks de reasoning y cinco modelos instruction-tuned, alcanza el 64,5% de precisión media: 6,6 puntos por encima del chain-of-thought clásico y 2,4 sobre el método competidor más fuerte (LatentSeek).
Por qué te interesa. La palanca más usada hoy para obtener mejores respuestas de un modelo es hacerlo razonar más tiempo, es decir, generar más tokens de pasos intermedios. Más tokens, más costo. GradCuit trabaja en un espacio diferente: optimiza vectores numéricos dentro del modelo antes de que comience a producir texto. El costo está en tiempo de cómputo, no en tokens. Para quien construye agentes sobre modelos open-weight localmente, es una dirección de calidad que no infla la factura de API.
El método también es más estable que sus predecesores. La varianza de precisión al variar el learning rate baja de 1,53 a 0,82, un problema real de técnicas similares que se vuelven poco confiables al cambiar un parámetro.
Requiere acceso a los pesos del modelo, algo que las APIs comerciales no proporcionan. Por ahora es investigación con código público, no una herramienta lista para producción.
En detalle
El chain-of-thought, del que hablamos en el paper que dio nombre al truco más usado del prompting, funciona haciendo generar al modelo pasos intermedios como texto antes de la respuesta final. Cuanto más largo es el razonamiento, mejor el resultado, pero cada paso es un token que cuesta y que puede desviarse. Los métodos de latent reasoning intentan hacer lo mismo sin pasar por el texto: trabajan directamente sobre los vectores numéricos dentro del Transformer.
GradCuit resuelve un problema específico de los métodos anteriores. Técnicas como LatentSeek conectan los estados latentes al razonamiento a través de los tokens generados, lo que hace indirecto el vínculo entre el ajuste de vectores y la calidad de la respuesta. GradCuit inserta estados optimizables en una capa intermedia del modelo y aprovecha la self-attention causal para crear una ruta diferencial directa: cada token de la respuesta final tiene una conexión calculable a cada estado latente que lo precede. En la práctica, el gradiente de la respuesta puede retroceder y ajustar los vectores latentes de forma dirigida.
Un detalle que ayuda a entender: el análisis de interpretabilidad muestra que los estados latentes influyen principalmente en los tokens conectores del razonamiento (preposiciones, conjunciones, palabras que estructuran el flujo lógico) y que las capas más efectivas son las iniciales e intermedias del Transformer, no las finales.
Qué cambia y qué no. El resultado abre un eje de scaling diferente: en lugar de hacer generar más texto, se optimiza el espacio interno del modelo. Los límites son concretos. Requiere acceso a los pesos y a la forward pass con gradientes, así que nada de APIs comerciales: se necesita un modelo open-weight local con suficiente memoria para mantener los gradientes. El paper prueba cinco modelos instruction-tuned, pero no está claro cómo escala en modelos mucho más grandes o en tareas fuera de los benchmarks de reasoning. Y un detalle que da que pensar: la variante random walk de GradCuit sigue siendo competitiva con LatentSeek. Si una optimización aleatoria funciona casi tan bien como la dirigida, la pregunta sobre qué está realmente haciendo el gradiente sigue abierta.
El código es público en GitHub. Para quien experimenta con modelos open-weight y tiene recursos para ejecutar forward pass con gradientes, es material para probar. Para quien trabaja vía API, es una señal de dirección: el reasoning al test time se está moviendo más allá del «genera más texto».