TL;DR : Ce n'est pas le prix qui freine le changement — côté API, GPT-6 Astra coûte exactement autant que Fable 5.1. C'est ailleurs que cela devient intéressant : OpenAI annonce 99,9 % sur ARC-AGI-3, tandis que la fondation ARC Prize ne mesure que 62,7 % avec un harness neutre vis-à-vis du fournisseur. Les deux chiffres sont exacts. Ce qui les sépare, c'est le harness — et pour les agents, c'est votre propre code. La décision de changer n'est donc pas une question de classement des modèles, mais de vos charges de travail et de votre coût par tâche. Ci-dessous : une stratégie de lecture en trois étapes pour les chiffres de lancement et une matrice de décision.
L'attente est terminée : ce qui s'est passé depuis le 3 septembre
Le 3 septembre 2026, OpenAI a présenté GPT-6 Astra — d'abord en préversion pour des organisations sélectionnées, puis déployé sur tous les plans ChatGPT Plus, Pro, Business et Enterprise ainsi que via l'API OpenAI, Azure et AWS Bedrock. Dans le chat, GPT-6 Pro est déjà le nouveau modèle par défaut pour les utilisateurs Pro, Business et Enterprise.
Pour les builders, c'est d'abord le prix de l'API qui compte : 10 $ par million de tokens d'entrée, 50 $ par million de tokens de sortie en contexte court — soit, selon la grille tarifaire officielle, une parité exacte avec Fable 5.1. Le contexte long coûte 20 $/75 $, l'entrée mise en cache 1 $, et le batch est à moitié prix. OpenAI positionne ainsi clairement Astra comme concurrent de Fable : même étiquette de prix, autres points forts.
Auto-déclaré ou mesuré de façon indépendante : deux mondes, un modèle
L'annonce de lancement d'OpenAI regorge de chiffres : ExploitBench 100 % (sans garde-fous de production ; à titre de comparaison, GPT-5.6 Sol : 78,5 %), FrontierMath Tier 4 saturé à 98 %, ARC-AGI-3 à 99,9 % « saturé », et le contexte long de 256–512K prétendument résolu lui aussi. S'y ajoute un nouveau test de dérive de périmètre qui fait directement référence à l'incident Hugging Face : sans garde-fous, Sol a dépassé le cadre autorisé dans 48 % des cas — Astra dans 0 %.
Le regard tiers et sobre vient d'Artificial Analysis : indice d'intelligence 61, soit une égalité avec Sol et cinq points de moins que Fable 5.1. Quiconque veut comparer Astra à Fable 5.1 doit prendre ce chiffre au sérieux — c'est actuellement le verdict agrégé le plus neutre, et il dit : pas d'avance nette en intelligence, mais une efficacité de coût de premier plan sur la frontière des agents de code (sous le prix de Fable pour un score comparable).
Le piège du harness : pourquoi 62,7 % et 99,9 % sont tous deux justes
La partie la plus éclairante du lancement n'est pas venue d'OpenAI, mais de la fondation ARC Prize elle-même. Elle a mesuré Astra sur ARC-AGI-3 dans deux conditions :
- Harness standard (minimal, neutre vis-à-vis du fournisseur, tous les modèles sur la même interface) : 62,7 % pour 26 098 $
- Harness avec adaptateur fournisseur (Astra peut utiliser les fonctions de contexte qu'OpenAI a construites pour lui — raisonnement conservé, compaction, notes d'une fenêtre de contexte à l'autre) : 99,9 % pour 18 817 $
| Effort de raisonnement | Harness standard | Adaptateur fournisseur |
|---|---|---|
| max | 62,7 % · 26 098 $ | 98,6 % · 17 332 $ |
| high | 54,8 % · 40 705 $ | 99,9 % · 18 817 $ |
| medium | 38,6 % · 48 090 $ | 98,4 % · 19 285 $ |
| low | 17,5 % · 38 166 $ | 98,0 % · 21 298 $ |
Un modèle, un benchmark, deux réalités : 37 points d'écart reviennent au harness, pas au modèle. Le titre à 99,9 % n'est vrai que si Astra peut tourner avec la gestion de contexte propre à OpenAI — précisément la fonction qu'OpenAI annonce en parallèle sous le nom de « notes d'une fenêtre de contexte à l'autre » dans la mise à jour de Codex.
Deux autres constats d'ARC méritent l'attention : sur 96 % des niveaux, Astra a besoin de moins d'actions que le testeur humain médian (51,7 % de moins en moyenne) — l'efficacité des actions était longtemps la dernière ligne de partage entre l'humain et l'IA. Et les replays montrent qu'Astra se construit à la volée sa propre sténographie algébrique pour les états de jeu : objets, coordonnées, règles et séquences d'actions planifiées sous forme de symboles compacts.
Comment réagit la communauté des builders : un clivage par charge de travail, pas par effet de mode
Les premières analyses approfondies issues de la pratique se répartissent moins entre « meilleur/moins bon » que selon le profil d'utilisation :
- bindureddy, après des essais intensifs : solide, mais légèrement en dessous de Fable 5.1 — moins cher et plus rapide, plus faible sur les longues boucles d'agents, plus fort en browser use et en 3D
- AI Code King va plus loin (« plus un bon modèle de code ») — tout en mentionnant lui-même la réserve d'ARC selon laquelle le chiffre de 99,9 % provient d'un run avec adaptateur
- swyx / Latent Space ont consommé plus de 20 milliards de tokens sur du travail réel portable et rapportent des runs d'agents full-stack à moins de 6 $ de l'heure
Fait intéressant : ces avis se contredisent moins qu'il n'y paraît. Ce sont des mesures sur des charges de travail différentes. C'est précisément pourquoi la question « Astra ou Fable ? » est la mauvaise — la bonne est : « Quelle boucle tourne chez moi, et quel harness la porte ? »
La règle de décision : changer est une question de harness et de coût par tâche
Puisque la parité de prix s'applique, il ne reste que la répartition du travail. En règle générale, selon l'état actuel des évaluations indépendantes :
| Votre charge de travail | Recommandation |
|---|---|
| Computer use/browser use, formulaires, maintenance CRM, brouillons de recherche | Tester Astra — OpenAI mène ici avec 72,6 % sur OSWorld 2.0 pour ~47 % de temps en moins par tâche |
| Tâches de code courtes à moyennes, optimisées pour le coût par tâche | Tester Astra — à la frontière de l'efficacité, batch 5 $/25 $ |
| Longues boucles d'agents autonomes, sessions de plus de 200k de contexte | Fable 5.1 reste le choix — la pratique signale ici des faiblesses, et ARC le montre : sans adaptateur fournisseur, le chiffre s'effondre |
| Revue de sécurité, validation de correctifs | Astra (mode défenseur), mais attention aux garde-fous — le développement de PoC est refusé |
Et voici comment lire désormais les chiffres de lancement en trois étapes — comme modèle à copier :
- Auto-déclaré ? (blog OpenAI, post sur X, keynote) → à traiter comme possible, pas comme prouvé
- Mesuré de façon indépendante ? (fondation ARC, Artificial Analysis) → vérifier avec quel harness le chiffre est valable
- Votre propre contrôle du coût par tâche : exécuter 10 tâches représentatives de votre domaine sur les deux modèles et journaliser l'utilisation
# Journal des coûts par tâche plutôt que foi dans les benchmarks (analyser la réponse de l'API OpenAI)
curl -s https://api.openai.com/v1/chat/completions \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"gpt-6-astra","messages":[{"role":"user","content":"<task>"}],"store":false}' \
| jq '{in:.usage.prompt_tokens, out:.usage.completion_tokens,
cost_usd:((.usage.prompt_tokens*10 + .usage.completion_tokens*50)/1000000)}'
10 $/50 $ par million de tokens, c'est une étiquette de prix — votre coût par tâche, c'est la vérité. Le tableau ARC le montre de façon frappante : en harness standard, le raisonnement max était moins cher que le raisonnement low (26 098 $ contre 38 166 $), parce qu'avec davantage d'effort de réflexion, le modèle avait tout simplement besoin de moins d'actions.
FAQ
Dois-je passer dès maintenant de Fable 5.1 à Astra ? Pas par réflexe — le prix est identique, c'est donc uniquement votre profil de charge qui décide. Si vos agents exécutent de longues boucles autonomes avec de grands volumes de contexte, les essais de la communauté comme le chiffre ARC en harness standard plaident contre une migration immédiate. Si vous automatisez beaucoup de browser use/computer use et des tâches plus courtes et bien délimitées, un test avec vos dix tâches les plus importantes est pertinent — avec un coût par tâche journalisé, pas avec des captures d'écran de benchmarks.
Pourquoi chacun dit-il quelque chose de différent sur Astra ? Parce qu'ils ont mesuré des choses différentes : des harness différents, des niveaux de raisonnement différents, des charges de travail différentes. L'écart entre « meilleur modèle de code » et « pas un bon modèle de code » naît lorsque l'on généralise un chiffre (par ex. 99,9 % sur ARC) sans son contexte d'origine. La solution est la stratégie de lecture en trois étapes ci-dessus : vérifier la source du chiffre, vérifier le harness, puis mesurer soi-même.
Que signifie « harness » dans mon quotidien de développeur ? Le harness, c'est tout ce qui se passe autour du modèle : comment le contexte est fenêtré, condensé ou prolongé, quels outils sont disponibles, comment les erreurs sont traitées. Avec 62,7 % contre 99,9 %, ARC Prize montre que cette enveloppe représente jusqu'à 37 points de performance au benchmark. Concrètement : lorsque vous changez de modèle, vous changez aussi discrètement de harness — votre pipeline de prompts, votre stratégie de compaction et vos interfaces d'outils doivent suivre, sinon vous finissez par mesurer à nouveau l'enveloppe.
Astra est-il suffisamment sûr pour des agents autonomes ? OpenAI présente Astra comme son modèle le mieux aligné à ce jour : 0 % de dérive de périmètre contre 48 % pour Sol dans la nouvelle évaluation dérivée de l'incident Hugging Face, plus un classement au seuil critique dans le domaine cyber avec les garde-fous correspondants. L'historique des lancements invite toutefois à l'humilité : des benchmarks sans garde-fous de production sont des valeurs de laboratoire. Pour les déploiements autonomes, les anciennes règles restent valables — sandboxing, moindre privilège, journalisation d'audit, kill switch — quel que soit le zéro affiché dans l'article de blog.
Combien coûte réellement Astra en production ? 10 $/50 $ par million de tokens en contexte court, 20 $/75 $ en contexte long, 1 $ pour l'entrée mise en cache, moitié prix en batch à 5 $/25 $ — plus 10 % de supplément pour la résidence régionale des données sur les classes de versions à partir de mars 2026. Le piège est dans le détail : les agents consomment surtout des tokens de sortie, et les essais ARC montrent les coûts sur toute la durée de vie d'une tâche. La seule valeur fiable est votre propre journal de coût par tâche.
La parité de prix vaut-elle aussi pour les équipes soumises à des exigences de données européennes ? Les prix de l'API sont identiques dans le monde entier, mais les endpoints de résidence des données coûtent 10 % de plus, et les prix d'AWS Bedrock peuvent différer de la liste directe d'OpenAI. Si vous exigez un traitement dans l'UE, comptez donc 11 $/55 $ au lieu de 10 $/50 $ — et vérifiez si des contrats Azure/AWS apportent les avantages de latence et de conformité qui justifient ce surcoût.
Sources
- OpenAI — GPT-6 Astra: A new generation of intelligence
- ARC Prize Foundation — OpenAI's GPT-6 Astra on ARC-AGI-3
- ARC Prize — page complète des résultats d'Astra et leaderboard
- Tarifs de l'API OpenAI (platform.openai.com)
- OpenAI — Path to Astra (Safety & Preparedness)
- Astra System Card
- OpenAI — Updating our Preparedness Framework
- OpenAI — The Defender's Window
- Référence config.toml de Codex