Radar · 04/08/2026 · survenu le 02/08/2026 · recherche

GradCuit : le reasoning latent au test time bat le chain-of-thought sans générer de tokens

Un paper sur arXiv (3 août 2026) présente GradCuit, une méthode qui améliore le raisonnement des modèles frontier en optimisant leurs états internes au moment de l’inférence, sans réapprentissage des poids et sans générer plus de tokens. Sur trois benchmarks de reasoning et cinq modèles instruction-tuned, elle atteint 64,5% de précision moyenne : 6,6 points au-dessus du chain-of-thought classique et 2,4 au-dessus de la méthode concurrente la plus forte (LatentSeek).

Pourquoi ça te concerne. Le levier le plus utilisé aujourd’hui pour obtenir de meilleures réponses d’un modèle est de le faire raisonner plus longtemps, c’est-à-dire générer plus de tokens d’étapes intermédiaires. Plus de tokens, plus de coût. GradCuit fonctionne dans un espace différent : elle optimise des vecteurs numériques à l’intérieur du modèle avant qu’il ne commence à produire du texte. Le coût est en temps de calcul, pas en tokens. Pour ceux qui construisent des agents sur des modèles open-weight localement, c’est une direction de qualité qui n’alourdit pas la facture API.

La méthode est aussi plus stable que les prédécesseurs. La variance de précision en fonction du learning rate diminue de 1,53 à 0,82, un problème réel des techniques similaires qui deviennent peu fiables en changeant un paramètre.

Elle nécessite l’accès aux poids du modèle, ce que les API commerciales ne fournissent pas. Pour l’instant, c’est de la recherche avec du code public, pas un outil prêt pour la production.

En détail

Le chain-of-thought, dont nous avons parlé dans le paper qui a donné le nom au trick le plus utilisé du prompting, fonctionne en faisant générer au modèle des étapes intermédiaires sous forme de texte avant la réponse finale. Plus long le raisonnement, meilleur le résultat, mais chaque étape est un token qui coûte et qui peut dévier. Les méthodes de latent reasoning tentent de faire la même chose sans passer par le texte : elles travaillent directement sur les vecteurs numériques à l’intérieur du Transformer.

GradCuit résout un problème spécifique des méthodes précédentes. Des techniques comme LatentSeek connectent les états latents au raisonnement à travers les tokens générés, ce qui rend indirect le lien entre l’ajustement des vecteurs et la qualité de la réponse. GradCuit insère des états optimisables dans une couche intermédiaire du modèle et exploite l’auto-attention causale pour créer un chemin différentiel direct : chaque token de la réponse finale a un lien calculable avec chaque état latent qui le précède. En pratique, le gradient de la réponse peut remonter et ajuster les vecteurs latents de manière ciblée.

Un détail qui aide à comprendre : l’analyse d’interprétabilité montre que les états latents influencent surtout les tokens connecteurs du raisonnement (prépositions, conjonctions, mots qui structurent le flux logique) et que les couches les plus efficaces sont celles initiales et intermédiaires du Transformer, pas les finales.

Ce qui change et ce qui ne change pas. Le résultat ouvre un axe d’scaling différent : au lieu de faire générer plus de texte, on optimise l’espace interne du modèle. Les limites sont concrètes. Il faut accès aux poids et à la forward pass avec gradients, donc pas d’API commerciales : il faut un modèle open-weight local avec assez de mémoire pour garder les gradients. Le paper teste cinq modèles instruction-tuned, mais il n’est pas clair comment ça scale sur des modèles beaucoup plus grands ou sur des tâches en dehors des benchmarks de reasoning. Et un détail qui fait réfléchir : la variante random walk de GradCuit reste compétitive avec LatentSeek. Si une optimisation aléatoire fonctionne presque aussi bien que celle ciblée, la question sur ce que fait vraiment le gradient reste ouverte.

Le code est public sur GitHub. Pour ceux qui expérimentent avec des modèles open-weight et qui ont les ressources pour faire tourner forward pass avec gradients, c’est du matériel à essayer. Pour ceux qui travaillent via API, c’est un signal de direction : le test-time reasoning se déplace au-delà du « génère plus de texte ».

Tapez pour chercher dans cours, playbooks, skills, papers…