Radar · 25/07/2026 · survenu le 24/07/2026 · business

GPT-5.6 sur Bedrock avec caching et Opus 5 à moitié prix : le coût de la réponse utilisable devient critère de choix

GPT-5.6 Sol, Terra et Luna sont désormais généralement disponibles sur Amazon Bedrock, avec prompt caching et intégration Codex. L’annonce d’AWS arrive le même jour où Anthropic présente Claude Opus 5 à moitié prix du haut de gamme.

Pourquoi ça te concerne. La question se déplace sur le coût d’une réponse que tu peux réellement utiliser. Comme nous le racontions le 22 juillet, le coût par output utilisable raconte une histoire différente des benchmarks : GPT-5.6 dépensait 8 dollars là où Claude Fable 5 en brûlait 160 sur la même tâche. Maintenant GPT-5.6 sur Bedrock a le caching actif, et Opus 5 se positionne à moitié prix. La pression concurrentielle se concentre entièrement sur le coût par résultat vérifié.

Pour ceux qui font tourner des agents des centaines de fois par jour sur des tâches similaires, le prompt caching peut réduire la facture de manière mesurable. Pour ceux qui sont dans l’écosystème Claude, Opus 5 réduit l’écart. Dans les deux cas, le choix du fournisseur devient un calcul économique.

Si tu veux l’essayer. Le post d’AWS explique comment activer le caching via la Responses API sur l’endpoint bedrock-mantle. Compare le coût sur ta charge réelle avant de migrer.

En détail

GPT-5.6 était sur Bedrock depuis le 14 juillet, mais en accès limité. La nouveauté d’aujourd’hui est la disponibilité générale avec deux éléments qui changent le calcul opérationnel : le prompt caching et l’intégration avec l’agent de coding Codex.

Le prompt caching fonctionne ainsi : quand ton agent envoie répétitivement le même contexte initial (un long system prompt, un document de référence, un historique de conversation), Bedrock le mémorise et tu ne paies que la première fois. Les appels suivants sur ce même contexte coûtent une fraction du prix plein. Si ton flux répète le même préambule sur des centaines de requêtes, l’économie est immédiate et mesurable.

La Responses API est l’interface que Bedrock expose pour les modèles OpenAI, à travers l’endpoint bedrock-mantle. Elle est conçue pour les agents, avec gestion intégrée de l’état de conversation et du tool calling. Pour ceux qui avaient déjà de la familiarité avec l’API OpenAI native, la courbe d’adaptation est minime.

L’intégration avec Codex signifie que ceux qui utilisent Bedrock comme infrastructure peuvent orienter l’agent de coding vers les modèles GPT-5.6 hébergés là sans passer par l’API OpenAI directe. Cela compte pour les entreprises qui ont déjà un contrat AWS et veulent garder le trafic dans un seul périmètre de facturation et de conformité.

La convergence avec Opus 5. Le même jour, Anthropic annonce Claude Opus 5 : performances proches de Fable 5 à moitié coût, disponible par défaut sur Claude Max. La synchronisation n’est pas du hasard. Les deux laboratoires répondent à la même pression : les clients ne choisissent plus sur le benchmark, ils choisissent sur le coût par réponse utilisable. L’article du 22 juillet montrait un écart de 20x entre GPT-5.6 et Fable 5 sur la même tâche. Anthropic ferme l’écart en baissant le prix ; OpenAI élargit le canal en mettant GPT-5.6 sur Bedrock avec caching.

Ce qui reste à vérifier. Les tarifs publiés par AWS pour le caching sur Bedrock n’ont pas encore été testés sur le terrain par des sources indépendantes. L’économie réelle dépend de la quantité de contexte qui se répète entre les appels : si chaque requête a un contexte différent, le caching ne s’active pas et le prix est celui plein. Les quotas et limites de scaling, documentés dans le post, varient selon la région et le compte.

Pour ceux qui veulent mesurer avec leurs propres données au lieu de se fier aux chiffres de marketing, le playbook pour comparer deux modèles en un quart d’heure est le point de départ : même tâche, mêmes cas de test, tableau des résultats avec coût pour chaque exécution.

Tapez pour chercher dans cours, playbooks, skills, papers…