Radar · 05/08/2026 · recherche

Les LLM ne peuvent pas faire de sauts : le position paper qui formalise la limite du saut logique dans les modèles

Un position paper sur OpenReview, intitulé « LLMs Can’t Jump », atteint 165 points sur Hacker News avec 116 commentaires. La thèse dans le titre : les modèles de langage ont une limite fondamentale pour effectuer des sauts logiques, c’est-à-dire pour connecter des informations qui ne sont pas proches dans l’espace de ce qu’ils ont vu pendant l’entraînement.

Pourquoi ça te concerne. Si tu construis des workflows qui attendent de l’IA l’éclair qui relie deux idées lointaines, ce paper dit que l’éclair ne vient pas tout seul. Les modèles interpolent bien dans leurs données d’entraînement, mais peinent à extrapoler au-delà. La différence compte quand la tâche nécessite une étape qui n’est pas déjà dans le matériau vu : là l’IA te rend la réponse plausible la plus proche ; la bonne réponse nécessite un saut logique.

C’est le même fil que nous avons suivi en parlant de comment l’expertise de celui qui guide le modèle compte plus que les astuces de prompting : le saut logique, c’est la personne qui connaît le domaine qui le fait, l’IA l’articule et le développe. Un paper qui formalise cette limite te dit où déléguer et où conserver le jugement humain dans la boucle.

En détail

La page OpenReview du paper n’était pas accessible au moment de la collecte (elle nécessite une vérification du navigateur), donc ce qui suit s’appuie sur le titre, sur le contexte de la discussion sur Hacker News et sur le fil de recherche que le site a suivi les dernières semaines.

Qu’est-ce que les position papers. Sur des venues de machine learning comme OpenReview, un « position paper » ne présente pas une nouvelle expérience : il argumente un point de vue, souvent pour stimuler le débat sur une direction de recherche ou sur une limite que la communauté sous-estime. Le format permet de dire « arrêtons-nous pour réfléchir » sans avoir nécessairement besoin de montrer des courbes de précision.

Le saut qui manque. Le titre utilise une métaphore sportive : le cheval qui ne saute pas l’obstacle. Dans le contexte du raisonnement, un « saut logique » est ce passage qui relie deux idées ou deux données qui ne sont pas proches dans l’espace des informations vues pendant l’entraînement. Les modèles sont bons à interpoler : trouver la réponse qui se situe au milieu de deux choses qu’ils connaissent. Ils peinent davantage à extrapoler : faire le pas qui va au-delà de ce qu’ils ont vu.

Ce n’est pas une nouvelle limite en soi. La littérature sur le raisonnement des LLM discute depuis longtemps de la différence entre interpolation et extrapolation. Le paper semble arguer que cette limite soit structurelle, non un bug à résoudre avec plus de données ou plus de paramètres. Le point compte parce que, si c’est vrai, ça change les attentes : un modèle plus grand répond mieux aux questions qui ressemblent à ses données d’entraînement, mais ne fait pas nécessairement la connexion créative qu’un expert humain voit.

Où ça s’insère dans le fil du site. Le 4 août, nous racontions comment l’analyse de Sean Goedecke montrait que l’expertise de celui qui guide le modèle compte plus que les astuces de prompting : la vraie compétence dans le domaine produit de meilleurs résultats parce que celui qui la possède sait où chercher le saut logique. Le même jour, le paper sur GradCuit montrait que l’optimisation des états internes au test time améliore le raisonnement sans plus de tokens. Deux angles différents du même problème : combien du raisonnement pouvons-nous déléguer et combien reste irréductiblement humain.

Ce qu’on ne sait pas encore. Sans accès au texte complet, nous ne pouvons pas vérifier si le paper présente des exemples concrets de sauts logiques échoués, s’il propose des métriques pour les mesurer, ou s’il se limite à un argument théorique. Les 116 commentaires sur Hacker News suggèrent que la thèse a soulevé un débat, mais nous ne pouvons pas citer les détails des objections sans les avoir lus. Le paper doit être lu avant de tirer des conclusions opérationnelles.

Tapez pour chercher dans cours, playbooks, skills, papers…