TL;DR: Non è il prezzo a ostacolare il passaggio — lato API, GPT-6 Astra costa esattamente quanto Fable 5.1. La questione si fa interessante altrove: OpenAI dichiara il 99,9% su ARC-AGI-3, mentre la fondazione ARC Prize, con un harness neutrale rispetto al fornitore, misura solo il 62,7%. Entrambi i numeri sono corretti. A separarli è l'harness — e negli agenti l'harness è il Suo codice. La decisione di cambiare non è quindi una questione di classifiche dei modelli, ma dei Suoi carichi di lavoro e del Suo costo per task. Più sotto: una strategia di lettura in tre passi per i numeri dei lanci e una matrice decisionale.
L'attesa è finita: cosa è successo dal 3 settembre
Il 3 settembre 2026 OpenAI ha presentato GPT-6 Astra — prima come anteprima per organizzazioni selezionate, poi esteso a tutti i piani ChatGPT Plus, Pro, Business ed Enterprise, oltre che tramite l'API di OpenAI, Azure e AWS Bedrock. Nella chat, GPT-6 Pro è già il nuovo modello predefinito per gli utenti Pro, Business ed Enterprise.
Per chi sviluppa, conta prima di tutto il prezzo dell'API: 10 $ per milione di token di input, 50 $ per milione di token di output nel contesto breve — secondo il listino ufficiale, parità esatta con Fable 5.1. Il contesto lungo costa 20 $/75 $, l'input in cache 1 $, e il batch è a metà prezzo. OpenAI posiziona così Astra in modo evidente come concorrente di Fable: stesso cartellino del prezzo, punti di forza diversi.
Dichiarato dal produttore vs. misurato in modo indipendente: due mondi, un modello
Il post di lancio di OpenAI è ricco di numeri: ExploitBench 100% (senza guardrail di produzione; per confronto, GPT-5.6 Sol: 78,5%), FrontierMath Tier 4 saturato al 98%, ARC-AGI-3 al 99,9% «saturato», e il contesto lungo a 256–512K presumibilmente risolto anch'esso. A ciò si aggiunge un nuovo test di scope drift che fa diretto riferimento all'incidente di Hugging Face: senza guardrail, Sol è andato oltre il perimetro autorizzato nel 48% dei casi — Astra nello 0%.
La prospettiva terza e sobria arriva da Artificial Analysis: Intelligence Index 61, quindi un pareggio con Sol e cinque punti sotto Fable 5.1. Chi vuole confrontare Astra con Fable 5.1 deve prendere sul serio questo numero — è attualmente il giudizio aggregato più neutrale e dice: nessun vantaggio netto in intelligenza, ma un'efficienza dei costi al vertice sulla frontiera dei coding agent (sotto il prezzo di Fable a parità di punteggio).
La trappola dell'harness: perché 62,7% e 99,9% sono entrambi veri
La parte più rivelatrice del lancio non è arrivata da OpenAI, ma dalla fondazione ARC Prize stessa. Ha misurato Astra su ARC-AGI-3 in due condizioni:
- Harness standard (minimale, neutrale rispetto al fornitore, tutti i modelli sulla stessa interfaccia): 62,7% per 26.098 $
- Harness con adattatore del fornitore (Astra può usare le funzioni di contesto che OpenAI ha costruito per lui — reasoning conservato, compaction, note tra finestre di contesto): 99,9% per 18.817 $
| Reasoning effort | Harness standard | Adattatore del fornitore |
|---|---|---|
| max | 62,7% · 26.098 $ | 98,6% · 17.332 $ |
| high | 54,8% · 40.705 $ | 99,9% · 18.817 $ |
| medium | 38,6% · 48.090 $ | 98,4% · 19.285 $ |
| low | 17,5% · 38.166 $ | 98,0% · 21.298 $ |
Un modello, un benchmark, due realtà: 37 punti di differenza appartengono all'harness, non al modello. Il titolo del 99,9% è vero solo se Astra può girare con la gestione del contesto propria di OpenAI — esattamente la funzione che OpenAI annuncia in parallelo come «note tra finestre di contesto» nell'aggiornamento di Codex.
Meritano attenzione altri due risultati di ARC: sul 96% dei livelli Astra ha bisogno di meno azioni del tester umano mediano (in media il 51,7% in meno) — l'efficienza delle azioni è stata a lungo l'ultima linea di demarcazione tra uomo e IA. E i replay mostrano che Astra si costruisce al volo una propria stenografia algebrica per gli stati di gioco: oggetti, coordinate, regole e sequenze di azioni pianificate come simboli compatti.
Come reagisce la scena dei builder: divisione per carico di lavoro, non per hype
I primi approfondimenti pratici si dividono meno tra «migliore/peggiore» e più per profilo d'uso:
- bindureddy dopo test intensivi: forte, ma leggermente sotto Fable 5.1 — più economico e più veloce, più debole nei lunghi loop di agenti, più forte in browser use e 3D
- AI Code King va oltre («non è più un buon modello per il coding») — pur citando lui stesso l'avvertenza di ARC secondo cui il 99,9% è un run con adattatore
- swyx / Latent Space hanno consumato oltre 20 miliardi di token per lavoro reale portabile e riportano run di agenti full-stack a meno di 6 $ l'ora
Interessante: queste opinioni si contraddicono meno di quanto sembri. Sono misurazioni su carichi di lavoro diversi. Proprio per questo la domanda «Astra o Fable?» è sbagliata — quella giusta è: «Quale loop gira da me, e quale harness lo sostiene?»
La regola decisionale: cambiare è una questione di harness e costo per task
Poiché vale la parità di prezzo, resta solo la distribuzione del lavoro. Come regola pratica, allo stato attuale delle valutazioni indipendenti:
| Il Suo carico di lavoro | Raccomandazione |
|---|---|
| Computer use/browser use, moduli, gestione CRM, bozze di ricerca | Testare Astra — qui OpenAI è in testa con il 72,6% su OSWorld 2.0 e ~47% di tempo in meno per task |
| Task di coding brevi e medi, ottimizzati per il costo per task | Testare Astra — alla frontiera dell'efficienza, batch 5 $/25 $ |
| Lunghi loop di agenti autonomi, sessioni con oltre 200k di contesto | Fable 5.1 resta la scelta — qui la pratica segnala debolezze e ARC lo dimostra: senza adattatore del fornitore il numero crolla |
| Security review, validazione delle patch | Astra (modalità defender), ma attenzione ai guardrail — lo sviluppo di PoC viene rifiutato |
Ed ecco come leggere d'ora in poi i numeri dei lanci in tre passi — come modello da copiare:
- Dichiarato dal produttore? (blog di OpenAI, post su X, keynote) → trattarlo come possibile, non come dimostrato
- Misurato in modo indipendente? (fondazione ARC, Artificial Analysis) → verificare con quale harness vale il numero
- Verifica del proprio costo per task: eseguire 10 task rappresentativi del Suo dominio su entrambi i modelli e registrare l'utilizzo
# Log dei costi per task invece di fede nei benchmark (analizzare la risposta dell'API OpenAI)
curl -s https://api.openai.com/v1/chat/completions \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"gpt-6-astra","messages":[{"role":"user","content":"<task>"}],"store":false}' \
| jq '{in:.usage.prompt_tokens, out:.usage.completion_tokens,
cost_usd:((.usage.prompt_tokens*10 + .usage.completion_tokens*50)/1000000)}'
10 $/50 $ per milione di token sono un cartellino del prezzo — il Suo costo per task è la verità. La tabella ARC lo mostra in modo drastico: nell'harness standard, il reasoning max costava meno del reasoning low (26.098 $ contro 38.166 $), perché con più sforzo di ragionamento il modello aveva semplicemente bisogno di meno azioni.
FAQ
Devo passare subito da Fable 5.1 ad Astra? Non per riflesso — il prezzo è identico, quindi a decidere è esclusivamente il Suo profilo di carico. Se i Suoi agenti eseguono lunghi loop autonomi con grandi quantità di contesto, sia i test della community sia il valore ARC con harness standard sconsigliano di migrare ora. Se automatizza molto browser use/computer use e task più brevi e ben delimitati, ha senso un test con i Suoi dieci task più importanti — con il costo per task registrato, non con screenshot dei benchmark.
Perché tutti dicono qualcosa di diverso su Astra? Perché hanno misurato cose diverse: harness diversi, livelli di reasoning diversi, carichi di lavoro diversi. La forbice tra «miglior modello per il coding» e «non è un buon modello per il coding» nasce quando si generalizza un numero (ad es. 99,9% su ARC) senza il contesto in cui è stato ottenuto. La via d'uscita è la strategia di lettura in tre passi illustrata sopra: verificare la fonte del numero, verificare l'harness, poi misurare in prima persona.
Cosa significa «harness» nel mio lavoro quotidiano di sviluppatore? L'harness è tutto ciò che accade intorno al modello: come il contesto viene suddiviso in finestre, condensato o portato avanti, quali strumenti sono disponibili, come vengono gestiti gli errori. Con il 62,7% contro il 99,9%, ARC Prize dimostra che questo involucro vale fino a 37 punti di prestazione nel benchmark. In pratica: quando Lei cambia modello, cambia silenziosamente anche l'harness — pipeline di prompt, strategia di compaction e interfacce degli strumenti devono adeguarsi, altrimenti alla fine si torna a misurare l'involucro.
Astra è abbastanza sicuro per agenti autonomi? OpenAI presenta Astra come il suo modello meglio allineato finora: 0% di scope drift contro il 48% di Sol nella nuova valutazione derivata dall'incidente di Hugging Face, più una classificazione a soglia critica in ambito cyber con i relativi guardrail. La storia dei lanci, però, insegna umiltà: i benchmark senza guardrail di produzione sono valori di laboratorio. Per i deployment autonomi restano valide le vecchie regole — sandboxing, least privilege, audit logging, kill switch — indipendentemente da quale zero compaia nel post del blog.
Quanto costa davvero Astra in produzione? 10 $/50 $ per milione di token nel contesto breve, 20 $/75 $ nel contesto lungo, input in cache 1 $, batch a metà prezzo 5 $/25 $ — più un sovrapprezzo del 10% per la residenza regionale dei dati sulle classi di release da marzo 2026 in poi. Il problema sta nei dettagli: gli agenti consumano soprattutto token di output e i test ARC mostrano i costi sull'intero ciclo di vita del task. L'unico valore affidabile è il Suo log del costo per task.
La parità di prezzo vale anche per i team con requisiti di dati UE? I prezzi delle API sono identici in tutto il mondo, ma gli endpoint con residenza dei dati costano il 10% in più e i prezzi di AWS Bedrock possono discostarsi dal listino diretto di OpenAI. Chi insiste sul trattamento dei dati nell'UE deve quindi calcolare 11 $/55 $ invece di 10 $/50 $ — e verificare se i contratti Azure/AWS offrono i vantaggi di latenza e compliance che giustificano il sovrapprezzo.
Fonti
- OpenAI — GPT-6 Astra: A new generation of intelligence
- ARC Prize Foundation — OpenAI's GPT-6 Astra on ARC-AGI-3
- ARC Prize — pagina completa dei risultati di Astra e leaderboard
- Prezzi dell'API OpenAI (platform.openai.com)
- OpenAI — Path to Astra (Safety & Preparedness)
- Astra System Card
- OpenAI — Updating our Preparedness Framework
- OpenAI — The Defender's Window
- Riferimento config.toml di Codex