Blank white background with no objects or features visible.

Nous vous offrons un accès gratuit à l'intégralité du Gartner Hype Cycle for AI Governance 2026. Obtenez votre exemplaire →

Tarification de GPT-6 Astra : où la mise en cache reste rentable à 10 $ en entrée

Par Ashish Dubey

Published: October 6, 2026

⚡ TL;DR
  • What shipped. OpenAI released GPT-6 Astra on 3 September 2026, callable in the API as gpt-6-astra (API changelog, announcement). It is available through the OpenAI API, Microsoft Azure and AWS Bedrock.
  • What changed. Same 1,050,000-token context window and 128,000-token max output as GPT-5.6 Sol, a later knowledge cutoff, and large gains on long-horizon agentic work. Also a 2.5x price increase on every text token rate (model docs).
  • Who should care. Teams running agents that browse, use a computer, or work a terminal for many turns. If your workload is single-shot question answering, the gains are much smaller and the bill is not.
  • What it costs. Per 1M tokens: $10.00 input, $1.00 cached input, $12.50 cache writes, $50.00 output. Requests over 272K input tokens are billed at 2x input and cache rates and 1.5x output, for the whole request.
  • All figures below are as of September 2026 and come from OpenAI’s own model documentation, API changelog or launch post. Anything not in a primary source is marked.

Ce qu'OpenAI a lancé

GPT-6 Astra est arrivé le 3 septembre 2026. La chaîne API est gpt-6-astra — pas d'instantané daté, pas d'alias distinct ; la page du modèle indique gpt-6-astra à la fois comme instantané et comme alias.

Les spécifications, selon la documentation du modèle d'OpenAI :

Property GPT-6 Astra
API model string gpt-6-astra
Context window 1,050,000 tokens
Max output 128,000 tokens
Knowledge cutoff 30 April 2026
Reasoning effort low / medium / high / xhigh / max
Input modalities Text, image
Output modalities Text
Endpoints Responses, Chat Completions
Fine-tuning Not supported

Trois points dans les petites lignes comptent plus que l'annonce principale.

Premièrement, reasoning.effort n'accepte plus none. C'était le cas pour GPT-5.6 Sol. Si vous avez un chemin rapide et économique configuré sur none, il ne sera pas compatible.

Deuxièmement, temperature, top_p et logprobs ont disparu. Le journal des modifications indique qu'Astra « ne prend pas en charge les valeurs personnalisées de température ou de top_p, ni les probabilités logarithmiques ». Tout élément de votre pile technique définissant des paramètres d'échantillonnage doit être audité avant toute migration.

Troisièmement, l'appel d'outils nécessite l'API Responses. Si vous appelez des outils via Chat Completions aujourd'hui, il s'agit d'une migration, pas d'un simple changement de modèle.

[CAPTURE D'ÉCRAN : Plateforme OpenAI — la page du modèle gpt-6-astra affichant la fenêtre de contexte, la sortie maximale et la tarification par jeton]

Ce qui a changé par rapport à GPT-5.6 Sol

La fenêtre de contexte et la limite de sortie n'ont pas bougé. Le prix, si.

Per 1M tokens GPT-5.6 Sol GPT-6 Astra Change
Input $4.00 $10.00 2.5x
Cached input $0.40 $1.00 2.5x
Cache write $5.00 $12.50 2.5x
Output $20.00 $50.00 2.5x
Context window 1,050,000 1,050,000 unchanged
Max output 128,000 128,000 unchanged
Knowledge cutoff 16 Feb 2026 30 Apr 2026 +10 weeks

Sources : documentation du modèle GPT-6 Astra, documentation du modèle GPT-5.6 Sol, septembre 2026. Notez qu'OpenAI décrit les tarifs de GPT-5.6 Sol comme une tarification promotionnelle disponible au moins jusqu'au 21 novembre 2026 ; le ratio pourrait donc ne plus être valable après cette date.

Chaque tarif a évolué selon exactement le même facteur. Cela s'avère important pour la question du cache abordée ci-dessous.

Les modes Batch et Flex restent à 50 % du tarif Standard. Le mode Fast, qui, selon OpenAI, offre une vitesse jusqu'à deux fois supérieure au traitement Standard, est facturé au double des tarifs en vigueur ; ainsi, le mode Fast pour Astra coûte 20 $ en entrée et 100 $ en sortie.

Analyse honnête des benchmarks

OpenAI publie un vaste tableau comparatif dans son article de lancement. Voici la partie qui mérite d'être reproduite, suivie de celle que la plupart des médias omettent.

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1 Claude Opus 5
Terminal-Bench 4.0 57.9% 37.3% 55.8% 52.6%
Terminal-Bench Science 0.1 64.6% 22.4% 52.6% 30.0%
AutomationBench 41.4% 18.1% 31.4% 26.9%
Agents’ Last Exam 59.3% 53.6% — 55.5%
ScreenSpot-Pro (no tools) 92.7% 76.9% — —
OSWorld 2.0 (offline set) 72.6% 65.7% — 70.2%
FrontierMath Tier 4 (v2) 97.6% 83.0% 87.8% 73.2%
GPQA Diamond 96.0% 94.6% 93.7% 93.7%
DeepSWE v1.1 74.1% 72.7% 67.4% 73.7%
MRCR v2 8-needle 512K-1M 96.3% 73.8% — —
AA Intelligence Index v4.1.1 61.2 60.9 65.7 63.1
AA Coding Agent Index v1.4 67.0 65.1 — 68.1

Source : Article de lancement de GPT-6 Astra, septembre 2026. Les scores correspondent au maximum atteint quel que soit l'effort de raisonnement.

Là où Astra domine clairement. Travail d'agent sur le long terme. Terminal-Bench 4.0 progresse de plus de vingt points par rapport à Sol. Terminal-Bench Science triple presque son score. AutomationBench fait plus que doubler. La récupération sur contexte long (512K-1M) passe de 73,8 % à 96,3 %. Ce sont les charges de travail pour lesquelles le modèle a été conçu, et l'écart est flagrant.

Là où l'écart devient négligeable. Connaissances et raisonnement en une seule étape. GPQA Diamond passe de 94,6 % à 96,0 %. DeepSWE passe de 72,7 % à 74,1 %. Si votre trafic consiste en des questions nécessitant des réponses plutôt que des tâches nécessitant des étapes, vous payez 2,5 fois plus cher pour gagner environ un point.

Là où Astra ne gagne pas. Sur les deux indices composites tiers qu'OpenAI a choisi d'inclure, Astra n'arrive pas en tête. L'Artificial Analysis Intelligence Index place Claude Fable 5.1 à 65,7 contre 61,2 pour Astra. Le Coding Agent Index place Claude Opus 5 à 68,1 contre 67,0 pour Astra. OpenAI a publié ces deux chiffres, ce qui est tout à son honneur, et ils constituent un contrepoids honnête à la supériorité constatée sur les tâches d'agent.

Un élément qui complexifie la question du prix. Les estimations de coût par tâche d'OpenAI sont parfois inférieures à celles de Sol malgré des tarifs 2,5 fois plus élevés, car Astra termine les tâches avec moins de jetons. L'article de lancement annonce un coût API estimé par tâche environ 9 % inférieur sur Terminal-Bench 4.0 par rapport à Sol, environ 27 % inférieur sur Terminal-Bench Science avec un paramètre de coût réduit, et environ 43 % inférieur sur BenchCAD. Il s'agit des propres estimations d'OpenAI dans des configurations spécifiques, et non de reproductions indépendantes ; elles ne seront donc pas généralisables à votre propre trafic. Cependant, cela signifie que « 2,5 fois plus cher » n'est pas le résumé approprié pour le travail d'agent. Mesurez les jetons par tâche accomplie, pas le prix par jeton.

Ce que la tarification de GPT-6 implique pour la mise en cache

TrueFoundry a effectué le calcul du seuil de rentabilité du cache sur GPT-5.6 lorsque les écritures en cache sont devenues facturables pour la première fois. La même question se pose ici, et la réponse est plus intéressante qu'il n'y paraît.

Les multiplicateurs de cache d'Astra sont identiques à ceux de GPT-5.6. La documentation du modèle indique que les écritures en cache sont facturées à 1,25 fois le tarif d'entrée sans cache, et le tarif publié pour les entrées en cache de 1,00 $ par rapport à un tarif d'entrée de 10,00 $ représente exactement 0,10 fois. Donc :

  • Entrée : P
  • Écriture en cache : 1,25 x P
  • Lecture en cache : 0,10 x P

Soit w la part des requêtes sur un préfixe partagé qui sont des écritures en cache plutôt que des lectures. Le seuil de rentabilité du cache est atteint lorsque :

1,25w + 0,10(1 - w) = 1
1,15w = 0,90
w = 78,3 %

Le seuil de rentabilité est de 78,3 %, inchangé par rapport à GPT-5.6. P s'annule, c'est pourquoi l'augmentation de prix de 2,5x ne change rien. Le cache cesse d'être rentable uniquement lorsque plus de 78 % environ de vos requêtes sur un préfixe donné sont des écritures — c'est-à-dire lorsque votre contexte partagé survit à moins de 1,3 requête en moyenne avant d'être modifié ou d'expirer. Presque aucune charge de travail d'agent réel ne se situe dans cette zone.

Ce que l'augmentation de prix change, c'est l'enjeu financier. Prenons un préfixe partagé de 32 000 jetons réutilisé sur une session de 25 requêtes — une écriture, vingt-quatre lectures :


GPT-5.6 Sol GPT-6 Astra
No caching $3.20 $8.00
With caching $0.47 $1.17
Saved $2.73 $6.83
Saved (%) 85.4% 85.4%

Le pourcentage est identique. Les montants en dollars sont 2,5 fois plus élevés. L'utilisation du cache a toujours été pertinente ; avec Astra, ne pas l'utiliser coûte deux fois et demie plus cher.

Le mode de défaillance reste également inchangé : un contexte qui change trop rapidement. Si votre agent reconstruit son prompt système ou son schéma d'outils toutes les quelques itérations, vous payez 12,50 $ par million pour écrire un cache que vous lisez à peine. C'est désormais une erreur qui coûte 12,50 $ au lieu de 5,00 $.

Le seuil critique des 272 000 jetons dont personne ne parle

La fenêtre de contexte annoncée pour GPT-6 est de 1 050 000 jetons. La facturation n'est pas linéaire sur cette plage.

Extrait de la documentation du modèle : « Les prompts de plus de 272 000 jetons en entrée sont facturés au double des tarifs d'entrée et de cache, et à 1,5 fois le tarif de sortie pour l'ensemble de la requête. »

Lisez ceci attentivement. C'est pour l'ensemble de la requête, et non pour le dépassement au-delà de 272 000. Franchir cette limite ne vous coûte pas le double sur les jetons supplémentaires ; cela vous coûte le double sur la totalité des jetons.

Input tokens Input rate Cost of the input
271,000 $10.00 / 1M $2.71
273,000 $20.00 / 1M $5.46

Une augmentation de 0,7 % de la taille du prompt entraîne une hausse de 101 % de la facture d'entrée. Les lectures en cache doublent également, passant de 1,00 $ à 2,00 $ par million, et la sortie passe de 50,00 $ à 75,00 $. GPT-5.6 Sol applique la même règle, ce n'est donc pas nouveau — mais aux tarifs d'Astra, le saut est 2,5 fois plus important.

La conséquence pratique : si vos prompts avoisinent les 272 000 jetons, l'optimisation des coûts la plus efficace à votre disposition est de les réduire en dessous de ce seuil. Supprimer 5 000 jetons d'un prompt de 275 000 jetons est plus rentable que n'importe quel changement de routage.

[CAPTURE D'ÉCRAN : Plateforme OpenAI — tableau de bord d'utilisation affichant les dépenses en jetons d'entrée, d'entrée en cache et de sortie par modèle]

Où les équipes rencontrent des difficultés

Quatre types de défaillances reviennent systématiquement dans les premières semaines suivant le lancement d'un modèle de pointe, et Astra les présente tous les quatre.

Tout est redirigé vers le nouveau modèle. La dépense la plus lourde pour une équipe après un lancement est de définir le nouveau modèle par défaut pour tout. À 10 $ pour l'entrée et 50 $ pour la sortie, un appel de classification qu'un modèle économique traite correctement coûte désormais 2,5 fois plus cher que le mois dernier, sans aucun gain de qualité. L'écart de performance observé ci-dessus plaide en faveur d'une flotte mixte, et non d'une migration totale.

La migration ne se résume pas à un simple remplacement de chaîne de caractères. Pas d'effort de raisonnement, pas de température, pas de top_p, pas de logprobs, et un appel d'outils qui nécessite l'API Responses. Le code qui fonctionnait avec gpt-5.6-sol peut échouer avec gpt-6-astra de manières qui ne deviennent évidentes qu'en production.

La surveillance des désalignements peut interrompre votre requête. OpenAI effectue des vérifications asynchrones sur le travail des agents dans les requêtes prises en charge par l'API Responses. L'article de lancement est explicite sur les conséquences : dans ChatGPT ou Codex, il peut vous être demandé de valider une action, mais « dans l'API, la tâche s'arrêtera ». OpenAI reconnaît que ces vérifications « peuvent parfois interrompre un travail légitime ». Il s'agit d'une nouvelle caractéristique de fiabilité à prendre en compte dès la conception, et non d'une simple note de bas de page.

Personne ne connaît le coût réel avant de recevoir la facture. Le prix par jeton ne signifie pas grand-chose lorsque le modèle utilise un nombre de jetons différent selon la tâche. Sans attribution des coûts par requête et par équipe, il est impossible de répondre à la question : « Astra est-il plus ou moins coûteux pour nous ? »

Route across models instead of standardising on one.
TrueFoundry’s AI Gateway fronts 1,000+ LLMs through a single OpenAI-compatible API, adding roughly 3-4 ms of latency and handling 350+ RPS on 1 vCPU.

La place de TrueFoundry

Un modèle de pointe plus coûteux ne rend pas l'utilisation d'une passerelle moins pertinente. Au contraire, elle la renforce, car chaque décision de routage vaut désormais 2,5 fois plus cher.

Routez selon la complexité, pas par habitude. La Passerelle IA classifie les requêtes entrantes et envoie chacune vers le niveau approprié, afin que les tâches complexes des agents atteignent Astra, tandis que l'extraction, la classification et la synthèse ne le font pas. Dans le benchmark d'Auto Routing de TrueFoundry portant sur 550 prompts, la hiérarchisation a réduit les coûts de 69 % tout en conservant 98 % de qualité de référence, avec une latence moyenne passant de 7,6 s à 4,0 s. Sur un trafic représentatif de la production, la réduction a atteint 80 %. Ces pourcentages appliqués à des tarifs de 10 $/50 $ ont une valeur nettement supérieure à ce qu'ils représentaient à 4 $/20 $.

Registering a model in the TrueFoundry AI Gateway catalogue
Enregistrer un modèle dans le catalogue de la passerelle IA de TrueFoundry
Complexity routing tiers and the models each tier targets
Niveaux de routage par complexité et modèles ciblés par chaque niveau

Normaliser la mise en cache entre les fournisseurs. Les sémantiques de cache d'Astra sont celles d'OpenAI. Celles d'Anthropic sont différentes, et celles de Bedrock diffèrent encore. Mise en cache de prompts agnostique vis-à-vis du fournisseur au niveau de la passerelle signifie que vous écrivez le préfixe une seule fois et que la règle des 78,3 % mentionnée plus haut reste valable, quel que soit le modèle choisi par le routeur.

Routing configuration in the TrueFoundry AI Gateway
Configuration du routage dans la passerelle IA de TrueFoundry

Mesurez le coût par tâche, pas le coût par jeton. L'argument commercial d'Astra repose entièrement sur l'efficacité des jetons, et vous ne pouvez pas le trancher à partir d'une simple liste de prix. Le coût par requête, le nombre de jetons et la latence ventilés par équipe et par modèle sont les indicateurs qui vous permettront de vérifier si la promesse d'Astra, à savoir moins de jetons par tâche, se confirme sur votre charge de travail.

Per-model cost, token and latency metrics in TrueFoundry
Coût par modèle, métriques de jetons et de latence dans TrueFoundry

Maintenez un chemin de garde-fous unique pour tous les modèles. Les garde-fous au niveau de la passerelle s'exécutent sur le chemin de la requête et de la réponse, quel que soit le modèle qui répond ; ainsi, un changement de routage ne modifie pas discrètement votre niveau de sécurité.

Guardrails applied on the request and response path through the AI Gateway
Garde-fous appliqués sur le chemin de la requête et de la réponse via la passerelle IA
Put GPT-6 Astra next to your current models and compare on your own traffic.
One endpoint, per-team cost attribution, and a routing layer that keeps the expensive model for the work that needs it.

Comment exécuter GPT-6 Astra via la passerelle

En résumé, à la date de septembre 2026 :

  1. Ajoutez OpenAI comme fournisseur et enregistrez gpt-6-astra. La passerelle l'expose via le même point de terminaison compatible OpenAI que tout le reste, de sorte que le code de l'application n'a pas besoin d'être modifié si vous choisissez de router vers une autre destination plus tard.
  2. Auditez d'abord vos paramètres de requête. Supprimez temperature, top_p et logprobs. Remplacez tout reasoning.effort: none par low. Déplacez le trafic lié aux appels d'outils vers l'API Responses.
  3. Définissez délibérément l'effort de raisonnement par itinéraire. faible pour les appels de routine, élevé pour le travail quotidien des agents, très élevé ou maximal pour les cas complexes. Il s'agit du levier de coût le plus important pour le modèle, car l'effort génère des jetons de sortie et la sortie est facturée 50 $ par million.
  4. Fixez un plafond strict en dessous de 272 000 jetons d'entrée. Tronquez, résumez ou segmentez avant la requête plutôt qu'après la réception de la facture.
  5. Acheminez une partie du trafic, ne migrez pas tout. Envoyez du trafic réel à la fois vers Astra et vers votre fournisseur actuel, comparez le coût par tâche terminée plutôt que le coût par jeton, et ne développez l'utilisation d'Astra que là où elle s'avère plus avantageuse.
Model routing configuration across providers
Configuration du routage des modèles entre les fournisseurs

Lectures complémentaires

Conclusion

GPT-6 Astra représente une véritable avancée pour les tâches pour lesquelles il a été conçu. Terminal-Bench 4.0 en hausse de vingt points, récupération en contexte long en hausse de vingt-deux, AutomationBench plus que doublé : ce ne sont pas des améliorations incrémentales. Sur les indices composites tiers publiés par OpenAI lui-même, il n'est pas le leader, et sur les questions de connaissances en un seul essai, l'écart par rapport à GPT-5.6 Sol est proche d'une erreur d'arrondi.

La tarification reflète cette même dualité. Tous les tarifs ont été multipliés par 2,5, ce qui ressemble à une augmentation directe jusqu'à ce que l'on remarque que les estimations par tâche d'OpenAI sont inférieures à celles de Sol sur plusieurs benchmarks d'agents, car Astra termine avec moins de jetons. Les deux affirmations peuvent être vraies. Celle qui s'applique à vous est une question empirique liée à votre trafic, et la seule façon d'y répondre est d'exécuter les deux et de mesurer le coût par tâche terminée.

Deux points ne nécessitent aucune mesure. La mise en cache reste rentable exactement au même seuil de rentabilité de 78,3 % que sur GPT-5.6 ; donc, si vous utilisez le cache aujourd'hui, continuez. Et le seuil de facturation de 272 000 jetons est une fonction en escalier qui doublera discrètement une facture d'entrée pour un prompt qui s'est allongé de quelques milliers de jetons.

Tout dépend donc de ce que vous souhaitez maîtriser. Si vous voulez un modèle unique et une facture simple, dirigez tout vers Astra et acceptez de surpayer pour la moitié la plus simple de votre trafic. Si vous préférez envoyer les tâches complexes vers le modèle de pointe et tout le reste vers une solution moins coûteuse, il vous faut une couche de routage — et à 10 $ en entrée et 50 $ en sortie, le calcul pour en construire une vient de devenir deux fois et demie plus convaincant.

Route GPT-6 Astra alongside your existing models

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

INSCRIVEZ-VOUS
Table des matières

Gouvernez, déployez et suivez l'IA dans votre propre infrastructure

Réservez un séjour de 30 minutes avec notre Expert en IA

Réservez une démo

Le moyen le plus rapide de créer, de gérer et de faire évoluer votre IA

Démo du livre
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Découvrez-en plus

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

10 meilleurs outils LLmops en 2026

comparaison
October 10, 2026
|
5 min de lecture

5 leçons sur l'exploitation d'IA agentique en production - D'après la discussion au coin du feu

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

Passer à zéro dans Kubernetes : une plongée approfondie dans Elasti

Ingénierie et produits
October 10, 2026
|
5 min de lecture

L'observabilité dans les flux de travail LLM : transformer les boîtes noires en boîtes en verre

Aucun article n'a été trouvé.
Aucun article n'a été trouvé.

Blogs récents

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.

Questions fréquemment posées

Qu'est-ce que GPT-6 et quand est-il sorti ?

GPT-6 Astra est le modèle de pointe d'OpenAI, sorti le 3 septembre 2026 et appelable dans l'API sous le nom gpt-6-astra. Il est disponible via l'API OpenAI, Microsoft Azure et AWS Bedrock, ainsi que pour les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise.

Combien coûte GPT-6 ?

En septembre 2026, par million de tokens : 10,00 $ en entrée, 1,00 $ en entrée mise en cache, 12,50 $ pour les écritures en cache, 50,00 $ en sortie. Batch et Flex sont à 50 % de ces tarifs ; le mode Fast est à 2x. Les requêtes de plus de 272K tokens d'entrée sont facturées à 2x les tarifs d'entrée et de cache et à 1,5x le tarif de sortie pour l'ensemble de la requête.

Quelle est la fenêtre de contexte de GPT-6 ?

1 050 000 tokens, avec une sortie maximale de 128 000 tokens. Les deux valeurs sont identiques à celles de GPT-5.6 Sol. La limite pratique est commerciale plutôt que technique : au-delà de 272K tokens d'entrée, toute la requête est facturée au double du tarif d'entrée.

GPT-6 vaut-il le coup par rapport à GPT-5 ?

Cela dépend entièrement de la nature de la tâche. Sur le travail agentique de longue durée, les gains sont importants — Terminal-Bench 4.0 passe de 37,3 % à 57,9 %. Sur les questions de connaissance à réponse unique, ils sont marginaux, et vous les payez 2,5 fois plus cher par token. Routez en conséquence plutôt que de tout basculer.

Le prompt caching reste-t-il rentable aux prix de GPT-6 ?

Oui, et dans la même proportion. Les écritures en cache coûtent 1,25 fois le prix d'entrée et les lectures 0,10 fois, exactement comme avec GPT-5.6, si bien que le seuil de rentabilité se situe dans les deux cas à une part d'écritures de 78,3 %. Des prix catalogue plus élevés augmentent les économies en valeur absolue, pas le seuil.

Une passerelle d'IA ajoute-t-elle une latence significative ?

L'AI Gateway de TrueFoundry ajoute environ 3 à 4 ms et soutient plus de 350 RPS sur 1 vCPU, ce qui est négligeable face à des temps de génération de plusieurs secondes.

Faites un rapide tour d'horizon des produits
Commencer la visite guidée du produit
Visite guidée du produit