Radar · 10/07/2026 · survenu le 09/07/2026 · modèles

OpenAI lance GPT-5.6 avec trois variantes et ChatGPT Work

OpenAI a rendu public GPT-5.6, après deux semaines de prévisualisation réservée aux organisations approuvées par le gouvernement. Le modèle arrive en trois variantes : Luna (la plus petite), Terra (taille moyenne) et Sol (la plus grande), avec des prix de $1 à $5 par million de tokens en entrée. Les trois ont une fenêtre de contexte d’un million de tokens et un maximum de 128.000 tokens en sortie.

Alongside the models, OpenAI launches ChatGPT Work: un agent qui se déplace entre les apps (Google Drive, Slack, Salesforce) et les fichiers, reste sur un projet pendant des heures si nécessaire, et accomplir des tâches complexes sans que tu orchestres chaque étape. Sol démontre des capacités avancées : il peut effectuer un post-training autonome sur Luna et, en mode Ultra, a produit une démonstration mathématique de la Cycle Double Cover Conjecture.

Pourquoi ça te concerne. Si tu utilises des modèles de langage au quotidien, le choix se complique : trois tailles du même modèle, cinq niveaux de raisonnement (de Light à xhigh, plus Max et Ultra), et maintenant un agent qui devrait gérer le cycle complet d’un projet. La question devient pratique : quand Luna suffit, quand il faut Sol, et si ChatGPT Work tient vraiment une journée de travail ou s’arrête en chemin. OpenAI publie des benchmarks montrant Sol devant Claude Fable 5 dans les tâches d’agent longues, mais c’est le même jour où elle disqualifie environ 30% de SWE-Bench Pro, un test de programmation où Fable avait écrasé Sol. Les chiffres des benchmarks doivent être considérés dans ce contexte.

Où regarder. La page model guidance d’OpenAI liste les nouvelles fonctionnalités API (tool calling programmatique, multi-agent, breakpoints de cache). Une comparaison indépendante a compilé les coûts de 18 variantes du même prompt : de 0,71 cent (Luna, sans raisonnement) à 48,55 cents (Sol, effort maximal).

Dans les détails

Le contexte : la prévisualisation freinée

Il y a deux semaines, OpenAI avait lancé GPT-5.6 uniquement auprès des organisations approuvées par le gouvernement, dans une « limited preview » qui avait soulevé des questions. Le 9 juillet, l’administration Trump a donné le feu vert public. Sam Altman l’a appelé « le meilleur modèle que nous ayons jamais produit ».

Les trois variantes et les prix

Luna, Terra et Sol coûtent respectivement $1/$6, $2.50/$15, $5/$30 par million de tokens (entrée/sortie). Pour comparaison, Claude Opus est à $5/$25 et Fable 5 à $10/$50. Mais le prix par million de tokens ne dit pas grand-chose : les modèles avec raisonnement peuvent consommer des quantités très différentes de tokens internes pour la même tâche.

Les trois variantes ont une date de connaissance au 16 février 2026, une fenêtre de contexte d’un million de tokens, et un output maximum de 128.000 tokens. Les cinq niveaux de raisonnement (none, low, medium, high, xhigh) te permettent de choisir combien de travail interne le modèle doit faire. Au-dessus de xhigh se trouvent Max et Ultra, qui activent des sous-agents parallèles.

Les benchmarks : OpenAI en tête sur les agents, derrière en code

OpenAI mise sur les tâches d’agent longues : sur Agents’ Last Exam (55 domaines professionnels), GPT-5.6 Sol arrive à 53.6 points, battant Fable 5 de 13.1 points. Même avec un raisonnement moyen, Sol bat Fable de 11.4 points au quart du coût estimé. Luna et Terra surpassent Fable au seizième du coût.

Sur SWE-Bench Pro (un test de programmation), Fable 5 avait obtenu 80% contre 64.6% pour Sol. La veille du lancement, OpenAI a publié un article estimant qu’environ 30% des tâches de SWE-Bench Pro sont « broken » et recommande la prudence dans l’utilisation de ce benchmark. Un timing qui n’est pas passé inaperçu.

ChatGPT Work : l’agent qui devrait faire le tour complet

ChatGPT Work est décrit comme un agent qui prend un objectif et le mène à bien, se déplaçant entre les apps et les fichiers, restant sur un projet pendant des heures. Il est alimenté par Codex (l’outil de programmation d’OpenAI, maintenant fusionné dans ChatGPT) et GPT-5.6. Il peut accéder à Google Drive, Slack, Salesforce. La promesse : donne une tâche, reviens quand c’est fait.

Le problème est que les agents autonomes tendent à s’enliser ou à dévier quand les tâches deviennent longues. La capacité à « rester sur un projet pendant des heures » est la partie la plus difficile à vérifier sans l’utiliser vraiment.

Sol Ultra et les mathématiques avancées

GPT-5.6 Sol, en mode Ultra, a produit une démonstration de la Cycle Double Cover Conjecture, un problème ouvert en théorie des graphes. Le PDF de la démonstration est public. Selon OpenAI, Sol peut aussi effectuer du post-training autonome sur Luna : il s’auto-améliore en entraînant des versions plus petites de lui-même. Ce sont des affirmations fortes, qui vont au-delà de l’usage quotidien, mais qui indiquent la direction.

Les nouvelles fonctionnalités API

La model guidance liste des innovations qui changent la façon d’utiliser les modèles :

  • Programmatic Tool Calling : le modèle écrit et exécute JavaScript pour orchestrer les appels à des outils, au lieu de retourner une séquence d’appels à exécuter en externe.
  • Multi-agent : le modèle peut activer des sous-agents pour des travaux parallèles et ciblés, directement depuis l’API.
  • Prompt cache breakpoints : comme Claude, tu peux spécifier où placer les points de cache au lieu de te fier à la détection automatique.
  • detail: original pour les images : le modèle ne redimensionne pas l’image avant de la traiter.

Le tool calling programmatique ressemble au mécanisme de dynamic filtering qu’Anthropic a ajouté à la recherche web : au lieu de retourner des résultats bruts, le modèle exécute du code sur les résultats en un seul tour.

Ce qu’on NE sait PAS

Ceux qui ont eu un accès anticipé à Sol le décrivent comme « vraiment très compétent », mais pas meilleur que Fable sur les tâches complexes de programmation essayées. C’est une donnée anecdotique, pas un benchmark, mais c’est le type d’observation qui compte : celle de quelqu’un qui utilise les modèles chaque jour.

On ne sait pas encore comment ChatGPT Work tiendra sur des vrais projets longs, ni à quel point le post-training autonome de Sol sur Luna est fiable. Et le fait qu’OpenAI ait disqualifié environ un tiers de SWE-Bench Pro la veille du lancement soulève la question : à quel point les autres benchmarks qu’ils citent sont-ils robustes ?

Où cela mène

Les modèles sont maintenant des familles, pas des entités uniques. Choisir le bon modèle pour une tâche devient partie du métier : quand Luna suffit, quand il faut Terra, quand Sol justifie le coût. Et si les agents comme ChatGPT Work tiennent vraiment, le métier change : tu passes de donner des instructions étape par étape à donner des objectifs et à vérifier qu’ils soient atteints. Mais on en est encore au stade où les promesses doivent être vérifiées sur le terrain, pas acceptées sur parole.

Tapez pour chercher dans cours, playbooks, skills, papers…