Radar · 14/07/2026 · survenu le 13/07/2026 · modèles

GPT-5.6 disponible sur Amazon Bedrock

Ce qui s’est passé. OpenAI a lancé GPT-5.6 Sol, Terra et Luna sur Amazon Bedrock le 13 juillet. Les trois modèles sont disponibles sur toute l’infrastructure AWS avec le même tarif que l’API OpenAI directe et l’utilisation compte pour vos engagements AWS existants. La version inclut le nouveau moteur d’inférence Bedrock conçu pour les charges agentiques avec des pics imprévisibles.

Pourquoi ça te concerne. Si tu travailles dans une organisation qui utilise déjà AWS, tu peux maintenant intégrer les modèles GPT-5.6 dans tes systèmes sans sortir de l’infrastructure, avec les politiques IAM, VPC et zero-operator access déjà en place. Le caching de prompts avec des points d’arrêt explicites réduit de 90% le coût des inputs réutilisables—utile pour les agents qui répètent les instructions système et les définitions d’outils à chaque appel. Pour ceux qui travaillent sur des charges multi-étapes (coding agents, recherche, analyses génomiques), l’inférence in-Region et le pooling de capacité répondent aux contraintes de résidence de données et de stabilité du débit que les API publiques ne garantissent pas.

Comme nous l’expliquions le 10 juillet, GPT-5.6 introduit trois niveaux de capacité : Sol pour le raisonnement complexe, Terra pour la production quotidienne, Luna pour le high-volume à faible coût. Maintenant cette intelligence tourne sur une infrastructure conçue pour les agents en production, pas seulement pour les expériences.

En détail

Le contexte. OpenAI avait lancé GPT-5.6 le 10 juillet avec trois modèles (Sol, Terra, Luna) et des tarifs de $1 à $5 par million de tokens. L’arrivée sur Bedrock trois jours plus tard marque la première intégration native enterprise des nouveaux modèles, tandis que l’accès via l’API directe est encore limité à quelques early access.

Ce qui change par rapport à l’API directe. Sur Bedrock, GPT-5.6 fonctionne sur le nouveau moteur d’inférence AWS construit pour les charges agentiques : capacité mutualisée qui absorbe les pics de requêtes sans dégrader le débit individuel, inférence in-Region pour la résidence des données, et caching de prompts avec points d’arrêt explicites qui conserve le cache disponible pendant au moins 30 minutes. Ce que tu payes $10 par million de tokens en tant qu’input standard, tu le payes $1 sur les parties de prompt réutilisables. Pour un agent qui envoie 50k tokens d’instructions système et de définitions d’outils à chaque appel, les économies sur 100 appels sont tangibles.

Les chiffres annoncés. Selon OpenAI, Sol surpasse le modèle précédent de 2.8 points sur le Coding Agent Index (80 vs 77.2) en utilisant moins de la moitié des output tokens et en coûtant un tiers de moins. Sur ExploitBench (cybersecurity research) elle monte de 47.9% à 73.5%. Sur Agents’ Last Exam (workflows professionnels multi-étapes sur 55 domaines), Sol atteint 53.6 points contre 40.5 du deuxième classificateur. Ces benchmarks sont déclarés par OpenAI et AWS : nous n’avons pas encore de runs indépendants.

Qui devrait l’envisager. Les équipes qui opèrent sur AWS avec des contraintes de résidence de données, qui construisent des agents avec des outils récurrents (où le caching réduit structurellement les coûts), ou qui gèrent des charges avec des pics imprévisibles où le pooling de Bedrock vaut plus que la latence minimale de l’API directe. Le fit s’adresse aux organisations, pas aux développeurs individuels : la complexité du setup (IAM, VPC, perimeter policies) ne se justifie pas pour les expériences personnelles.

Les limites déclarées. Le classificateur de rétention des abus conserve les données flaggées jusqu’à 30 jours pour la détection automatique des abus, un compromis entre sécurité et confidentialité que certaines organisations pourraient ne pas accepter. Le caching fonctionne sur les prompts qui partagent des préfixes identiques : si tes appels varient même légèrement dans le message système, l’avantage diminue. Et la stack de sécurité de GPT-5.6, décrite comme «la plus robuste d’OpenAI», n’a pas encore de données publiques de red-teaming indépendant : nous savons qu’elle existe, pas à quel point elle tient.

Tapez pour chercher dans cours, playbooks, skills, papers…