GPT-5.6 Luna à 0,20 dollar par million de tokens : le frontier coûte moins cher que les modèles compacts
OpenAI a réduit de 80% le prix de GPT-5.6 Luna. Le modèle coûte désormais 0,20 dollar par million de tokens en input et 1,20 en output (source : OpenAI, 30 juillet 2026). Le modèle le plus grand de la famille, Terra, a suivi une réduction de 20%.
Pour ceux qui construisent des agents, les calculs du choix du modèle changent. Jusqu’à hier, le compromis était clair : modèle frontier pour les tâches difficiles, modèle compact pour le reste, parce que le frontier coûtait trop cher pour l’utiliser partout. Maintenant Luna coûte moins que Gemini 3.1 Flash-Lite et un cinquième de Claude Haiku 4.5 sur l’input. L’écart entre modèle capable et modèle économique s’amenuise.
La réduction est rendue possible par GPT-5.6 Sol, qu’OpenAI a utilisé pour réécrire les kernel d’inférence (le code qui exécute les calculs du modèle sur GPU) en Triton et Gluon, deux langages GPU open-source du laboratoire. Le serving end-to-end coûte 20% de moins, et OpenAI a répercuté l’économie sur les prix.
Comme nous l’avons raconté le 25 juillet, le choix du modèle passe du benchmark au coût par output vérifié. Avec Luna à ce prix, de nombreuses tâches qui finissaient sur un modèle compact pour économiser peuvent revenir à un frontier sans que le coût change.
En détail
Le prix de Luna avant la réduction était égal à celui de Claude Haiku 4.5 sur l’input : 1 dollar par million de tokens. Avec le nouveau tarif à 0,20 dollar, le coût d’input baisse de cinq fois. Sur l’output, l’écart est moins extrême (1,20 contre 5 dollars pour Haiku 4.5), mais reste important. La comparaison avec Gemini 3.1 Flash-Lite est nette : Luna coûte moins cher, même s’il s’agit d’un modèle de la famille frontier d’OpenAI.
Ce qui rend la réduction possible. OpenAI attribue l’économie à GPT-5.6 Sol, le modèle de la famille optimisé pour le raisonnement profond. Sol a travaillé sur deux fronts : l’équilibrage de charge et, plus important, la réécriture des kernel d’inférence. Les kernel sont le code qui exécute les opérations mathématiques du modèle sur le GPU. Quand les opérations individuelles sont déjà rapides, ce qui ralentit, c’est le déplacement des données en mémoire, la synchronisation entre opérations et les layouts de données inefficaces. Sol a trouvé des calculs qui pouvaient être précalculés, évités ou parallélisés, et a réécrit les kernel de production en Triton et Gluon, deux langages GPU open-source maintenus par OpenAI. Le résultat annoncé est une réduction de 20% du coût de serving end-to-end.
Ce qui change pour ceux qui construisent. Si vous avez un agent qui utilise un modèle compact pour maîtriser les coûts, le calcul doit être refait. Un agent de recherche qui traite des centaines de documents, un triage d’emails, un assistant qui répond aux questions fréquentes : des tâches où la qualité du modèle compact était « suffisamment bonne » mais le frontier était trop cher. Avec Luna à 0,20 dollar par million de tokens en input, la lecture d’un document long (disons 10 000 tokens) coûte une fraction de centime. La différence de qualité entre un frontier et un compact, sur les tâches qui requièrent compréhension et jugement, peut valoir cette dépense.
Un signal concret : un agent démo sur Datasette qui tournait sur Gemini 3.1 Flash-Lite a été migré à Luna le jour même de l’annonce.
Où faire attention. Les prix publiés sont ceux officiels d’OpenAI. Chez les fournisseurs tiers (Bedrock, Azure), les tarifs peuvent différer, et le prompt caching change encore le calcul. La réduction de 20% sur les coûts de serving est une déclaration d’OpenAI, pas un chiffre vérifié par des tiers. Et le prix par token n’est pas le seul coût d’un agent en production : latence, nombre d’appels, retry et overhead d’orchestration pèsent autant que le tarif.
Pour décider si Luna convient à votre cas, la méthode reste la même : même tâche, mêmes cas de test, tableau des résultats avec coût et qualité. Le playbook pour le faire en un quart d’heure est ici.