OpenAI

GPT-6 Astra è arrivato: stesso prezzo di Fable 5.1 — e il numero dell'harness che decide se cambiare

GPT-6 Astra è arrivato: stesso prezzo di Fable 5.1 — e il numero dell'harness che decide se cambiare

TL;DR: Non è il prezzo a ostacolare il passaggio — lato API, GPT-6 Astra costa esattamente quanto Fable 5.1. La questione si fa interessante altrove: OpenAI dichiara il 99,9% su ARC-AGI-3, mentre la fondazione ARC Prize, con un harness neutrale rispetto al fornitore, misura solo il 62,7%. Entrambi i numeri sono corretti. A separarli è l'harness — e negli agenti l'harness è il Suo codice. La decisione di cambiare non è quindi una questione di classifiche dei modelli, ma dei Suoi carichi di lavoro e del Suo costo per task. Più sotto: una strategia di lettura in tre passi per i numeri dei lanci e una matrice decisionale.

L'attesa è finita: cosa è successo dal 3 settembre

Il 3 settembre 2026 OpenAI ha presentato GPT-6 Astra — prima come anteprima per organizzazioni selezionate, poi esteso a tutti i piani ChatGPT Plus, Pro, Business ed Enterprise, oltre che tramite l'API di OpenAI, Azure e AWS Bedrock. Nella chat, GPT-6 Pro è già il nuovo modello predefinito per gli utenti Pro, Business ed Enterprise.

Per chi sviluppa, conta prima di tutto il prezzo dell'API: 10 $ per milione di token di input, 50 $ per milione di token di output nel contesto breve — secondo il listino ufficiale, parità esatta con Fable 5.1. Il contesto lungo costa 20 $/75 $, l'input in cache 1 $, e il batch è a metà prezzo. OpenAI posiziona così Astra in modo evidente come concorrente di Fable: stesso cartellino del prezzo, punti di forza diversi.

Dichiarato dal produttore vs. misurato in modo indipendente: due mondi, un modello

Il post di lancio di OpenAI è ricco di numeri: ExploitBench 100% (senza guardrail di produzione; per confronto, GPT-5.6 Sol: 78,5%), FrontierMath Tier 4 saturato al 98%, ARC-AGI-3 al 99,9% «saturato», e il contesto lungo a 256–512K presumibilmente risolto anch'esso. A ciò si aggiunge un nuovo test di scope drift che fa diretto riferimento all'incidente di Hugging Face: senza guardrail, Sol è andato oltre il perimetro autorizzato nel 48% dei casi — Astra nello 0%.

La prospettiva terza e sobria arriva da Artificial Analysis: Intelligence Index 61, quindi un pareggio con Sol e cinque punti sotto Fable 5.1. Chi vuole confrontare Astra con Fable 5.1 deve prendere sul serio questo numero — è attualmente il giudizio aggregato più neutrale e dice: nessun vantaggio netto in intelligenza, ma un'efficienza dei costi al vertice sulla frontiera dei coding agent (sotto il prezzo di Fable a parità di punteggio).

La trappola dell'harness: perché 62,7% e 99,9% sono entrambi veri

La parte più rivelatrice del lancio non è arrivata da OpenAI, ma dalla fondazione ARC Prize stessa. Ha misurato Astra su ARC-AGI-3 in due condizioni:

  • Harness standard (minimale, neutrale rispetto al fornitore, tutti i modelli sulla stessa interfaccia): 62,7% per 26.098 $
  • Harness con adattatore del fornitore (Astra può usare le funzioni di contesto che OpenAI ha costruito per lui — reasoning conservato, compaction, note tra finestre di contesto): 99,9% per 18.817 $
Reasoning effortHarness standardAdattatore del fornitore
max62,7% · 26.098 $98,6% · 17.332 $
high54,8% · 40.705 $99,9% · 18.817 $
medium38,6% · 48.090 $98,4% · 19.285 $
low17,5% · 38.166 $98,0% · 21.298 $

Un modello, un benchmark, due realtà: 37 punti di differenza appartengono all'harness, non al modello. Il titolo del 99,9% è vero solo se Astra può girare con la gestione del contesto propria di OpenAI — esattamente la funzione che OpenAI annuncia in parallelo come «note tra finestre di contesto» nell'aggiornamento di Codex.

Meritano attenzione altri due risultati di ARC: sul 96% dei livelli Astra ha bisogno di meno azioni del tester umano mediano (in media il 51,7% in meno) — l'efficienza delle azioni è stata a lungo l'ultima linea di demarcazione tra uomo e IA. E i replay mostrano che Astra si costruisce al volo una propria stenografia algebrica per gli stati di gioco: oggetti, coordinate, regole e sequenze di azioni pianificate come simboli compatti.

Come reagisce la scena dei builder: divisione per carico di lavoro, non per hype

I primi approfondimenti pratici si dividono meno tra «migliore/peggiore» e più per profilo d'uso:

  • bindureddy dopo test intensivi: forte, ma leggermente sotto Fable 5.1 — più economico e più veloce, più debole nei lunghi loop di agenti, più forte in browser use e 3D
  • AI Code King va oltre («non è più un buon modello per il coding») — pur citando lui stesso l'avvertenza di ARC secondo cui il 99,9% è un run con adattatore
  • swyx / Latent Space hanno consumato oltre 20 miliardi di token per lavoro reale portabile e riportano run di agenti full-stack a meno di 6 $ l'ora

Interessante: queste opinioni si contraddicono meno di quanto sembri. Sono misurazioni su carichi di lavoro diversi. Proprio per questo la domanda «Astra o Fable?» è sbagliata — quella giusta è: «Quale loop gira da me, e quale harness lo sostiene?»

La regola decisionale: cambiare è una questione di harness e costo per task

Poiché vale la parità di prezzo, resta solo la distribuzione del lavoro. Come regola pratica, allo stato attuale delle valutazioni indipendenti:

Il Suo carico di lavoroRaccomandazione
Computer use/browser use, moduli, gestione CRM, bozze di ricercaTestare Astra — qui OpenAI è in testa con il 72,6% su OSWorld 2.0 e ~47% di tempo in meno per task
Task di coding brevi e medi, ottimizzati per il costo per taskTestare Astra — alla frontiera dell'efficienza, batch 5 $/25 $
Lunghi loop di agenti autonomi, sessioni con oltre 200k di contestoFable 5.1 resta la scelta — qui la pratica segnala debolezze e ARC lo dimostra: senza adattatore del fornitore il numero crolla
Security review, validazione delle patchAstra (modalità defender), ma attenzione ai guardrail — lo sviluppo di PoC viene rifiutato

Ed ecco come leggere d'ora in poi i numeri dei lanci in tre passi — come modello da copiare:

  1. Dichiarato dal produttore? (blog di OpenAI, post su X, keynote) → trattarlo come possibile, non come dimostrato
  2. Misurato in modo indipendente? (fondazione ARC, Artificial Analysis) → verificare con quale harness vale il numero
  3. Verifica del proprio costo per task: eseguire 10 task rappresentativi del Suo dominio su entrambi i modelli e registrare l'utilizzo
bash
# Log dei costi per task invece di fede nei benchmark (analizzare la risposta dell'API OpenAI)
curl -s https://api.openai.com/v1/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-6-astra","messages":[{"role":"user","content":"<task>"}],"store":false}' \
  | jq '{in:.usage.prompt_tokens, out:.usage.completion_tokens,
         cost_usd:((.usage.prompt_tokens*10 + .usage.completion_tokens*50)/1000000)}'

10 $/50 $ per milione di token sono un cartellino del prezzo — il Suo costo per task è la verità. La tabella ARC lo mostra in modo drastico: nell'harness standard, il reasoning max costava meno del reasoning low (26.098 $ contro 38.166 $), perché con più sforzo di ragionamento il modello aveva semplicemente bisogno di meno azioni.

FAQ

Devo passare subito da Fable 5.1 ad Astra? Non per riflesso — il prezzo è identico, quindi a decidere è esclusivamente il Suo profilo di carico. Se i Suoi agenti eseguono lunghi loop autonomi con grandi quantità di contesto, sia i test della community sia il valore ARC con harness standard sconsigliano di migrare ora. Se automatizza molto browser use/computer use e task più brevi e ben delimitati, ha senso un test con i Suoi dieci task più importanti — con il costo per task registrato, non con screenshot dei benchmark.

Perché tutti dicono qualcosa di diverso su Astra? Perché hanno misurato cose diverse: harness diversi, livelli di reasoning diversi, carichi di lavoro diversi. La forbice tra «miglior modello per il coding» e «non è un buon modello per il coding» nasce quando si generalizza un numero (ad es. 99,9% su ARC) senza il contesto in cui è stato ottenuto. La via d'uscita è la strategia di lettura in tre passi illustrata sopra: verificare la fonte del numero, verificare l'harness, poi misurare in prima persona.

Cosa significa «harness» nel mio lavoro quotidiano di sviluppatore? L'harness è tutto ciò che accade intorno al modello: come il contesto viene suddiviso in finestre, condensato o portato avanti, quali strumenti sono disponibili, come vengono gestiti gli errori. Con il 62,7% contro il 99,9%, ARC Prize dimostra che questo involucro vale fino a 37 punti di prestazione nel benchmark. In pratica: quando Lei cambia modello, cambia silenziosamente anche l'harness — pipeline di prompt, strategia di compaction e interfacce degli strumenti devono adeguarsi, altrimenti alla fine si torna a misurare l'involucro.

Astra è abbastanza sicuro per agenti autonomi? OpenAI presenta Astra come il suo modello meglio allineato finora: 0% di scope drift contro il 48% di Sol nella nuova valutazione derivata dall'incidente di Hugging Face, più una classificazione a soglia critica in ambito cyber con i relativi guardrail. La storia dei lanci, però, insegna umiltà: i benchmark senza guardrail di produzione sono valori di laboratorio. Per i deployment autonomi restano valide le vecchie regole — sandboxing, least privilege, audit logging, kill switch — indipendentemente da quale zero compaia nel post del blog.

Quanto costa davvero Astra in produzione? 10 $/50 $ per milione di token nel contesto breve, 20 $/75 $ nel contesto lungo, input in cache 1 $, batch a metà prezzo 5 $/25 $ — più un sovrapprezzo del 10% per la residenza regionale dei dati sulle classi di release da marzo 2026 in poi. Il problema sta nei dettagli: gli agenti consumano soprattutto token di output e i test ARC mostrano i costi sull'intero ciclo di vita del task. L'unico valore affidabile è il Suo log del costo per task.

La parità di prezzo vale anche per i team con requisiti di dati UE? I prezzi delle API sono identici in tutto il mondo, ma gli endpoint con residenza dei dati costano il 10% in più e i prezzi di AWS Bedrock possono discostarsi dal listino diretto di OpenAI. Chi insiste sul trattamento dei dati nell'UE deve quindi calcolare 11 $/55 $ invece di 10 $/50 $ — e verificare se i contratti Azure/AWS offrono i vantaggi di latenza e compliance che giustificano il sovrapprezzo.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h