OpenAI ha annunciato il 10 agosto 2026 che le valutazioni interne di Astra, uno dei suoi prossimi modelli, mostrano "significativi progressi nel coding agentico e nella cybersecurity" — abbastanza forti che l'azienda "non può escludere" che il modello raggiunga la soglia di cybersecurity Critica (Critical) definita nel suo Preparedness Framework.
È la prima volta che OpenAI segnala pubblicamente un modello a questa soglia. I modelli precedenti, inclusi GPT-5.6-Sol, sono stati valutati al livello Alto (High), un gradino sotto Critico (Critical).
L'annuncio è breve e accuratamente scritto. Ma il dettaglio strutturale che conta — il dettaglio che nessun media sta mettendo in primo piano — è il divario tra ciò che il framework definisce come Critico e la risposta di OpenAI a quella soglia.
Cosa significa "Critico" realmente
Secondo il Preparedness Framework di OpenAI (pubblicato per la prima volta a dicembre 2023), un modello raggiunge la soglia di cybersecurity Critica se può, senza intervento umano:
- Identificare e sviluppare exploit zero-day funzionali di tutti i livelli di gravità in molti sistemi reali rinforzati — non solo un sistema, non solo un livello di gravità, ma in modo generalizzato.
- Progettare ed eseguire end-to-end strategie novel di cyberattacchi contro bersagli rinforzati, ricevendo solo un obiettivo di alto livello.
Non si tratta di "il modello può scrivere email di phishing" o "il modello può suggerire exploit." Si tratta di scoperta e armamento autonomi di vulnerabilità in sistemi di produzione, su larga scala, senza un umano nel ciclo.
Il framework è stato progettato prima che i modelli raggiungessero questo livello. OpenAI nota che è stato pubblicato "ben prima che i modelli si avvicinassero a capacità biologiche, chimiche, di cybersecurity e di auto-miglioramento dell'IA a questo livello." Il framework è ora messo alla prova dalla cosa che era stato costruito per anticipare.
La risposta: escalation controllata, non un arresto
È qui che appare il divario di governance.
Se la soglia Critica significa "questo modello può sviluppare autonomamente exploit zero-day contro infrastrutture critiche", la risposta intuitiva sarebbe: fermare. Sospendere lo sviluppo. Non distribuire.
La risposta effettiva di OpenAI è diversa. I passi annunciati:
- Controlli di sicurezza più severi per modelli con capacità elevate: ambienti di test isolati, accesso di rete e strumenti limitato, protezioni dei pesi del modello potenziate e crittografia, capacità di monitoraggio e rilevamento aggiuntive, esecuzione sandbox.
- Sospensione delle attività interne coinvolgenti Astra che non soddisfano ancora i requisiti di sicurezza rafforzati.
- Monitoraggio universale delle azioni a rischio e del disallineamento in tutte le applicazioni agentiche di Astra, inclusi training e valutazione. I monitor valutano la catena di pensiero (Chain of Thought) del modello e attivano una risposta di sicurezza per esaminare e interrompere le attività ad alto rischio.
- Coinvolgimento governativo: collaborazione con agenzie governative pertinenti e organizzazioni di sicurezza IA selezionate per testare le capacità del modello.
- Controlli di sicurezza per partner di test terzi: fornitura di controlli raccomandati per eseguire in modo sicuro valutazioni e carichi di lavoro ad alto rischio.
Queste sono misure reali e sostanziose. Ma noti cosa è assente: nessun arresto di deployment, nessun impegno pubblico di trattenere il modello, nessun trigger normativo. Il framework definisce una soglia; la risposta è un'escalation controllata di misure di sicurezza attorno a uno sviluppo continuo.
Questo è lo stesso pattern strutturale che abbiamo osservato in altri tre momenti di governance nell'ultima settimana:
- 7 agosto: Anthropic ha creato entrambe le tecnologie che la specifica Agent Plugins 1.0.0 racchiude, ma è assente dal TSC che le standardizza.
- 6 agosto: Un test riproducibile della build AI-crawler di time.com ha prodotto evidenza primaria che ha invertito il reporting pubblicato — ma solo perché qualcuno ha eseguito il test invece di citare la copertura.
- 5 agosto: Un fornitore ha annunciato una correzione nelle note di rilascio, ma npm
stablepuntava ancora alla versione pre-correzione. L'annuncio e la distribuzione erano cose diverse.
In ogni caso, l'annuncio conteneva il divario. Nessuno lo ha cercato.
Cosa è Astra — e cosa non è
OpenAI chiarisce che Astra è un "modello in arrivo" e non è stata coinvolta nello sfruttamento di Hugging Face. (L'intrusione di Hugging Face, attribuita a un agente IA a luglio 2026, è un incidente separato.)
Le valutazioni preliminari indicano "performance sufficientemente forte che non possiamo escludere il livello di capacità Critica in questo momento." Non è una valutazione Critica confermata — è un riscontro "non può escludere", che nel framework attiva l'escalation dei controlli di sicurezza.
La distinzione è importante: OpenAI non sta dicendo che Astra ha superato la soglia Critica. Stanno dicendo che le loro valutazioni sono abbastanza forti che non possono dire con sicurezza che non lo ha fatto. In un framework di gestione del rischio, "non può escludere" attiva un'azione — allo stesso modo in cui una diagnosi "non può escludere" un cancro attiva un trattamento, non un approccio di attesa.
Il bilancio del Preparedness Framework
Non è la prima volta che il framework si attiva. A giugno 2025, quando i modelli di OpenAI si avvicinavano alla soglia di capacità Alta per la biologia, l'azienda ha delineato passi simili: salvaguardie rafforzate, test espansi, coinvolgimento di esperti esterni, controlli di sicurezza aggiuntivi.
La differenza: la soglia Alta per la biologia ha innescato la stessa risposta della soglia Critica per la cybersecurity. Se i gradienti di risposta del framework non distinguono significativamente Alto da Critico, i nomi delle soglie diventano etichette anziché trigger per azioni diverse.
Un framework che risponde a "non possiamo escludere Critico" allo stesso modo in cui risponde a "ci stiamo avvicinando ad Alto" è un framework in cui il nome della soglia non cambia la risposta operativa. Questa è un'osservazione di design di governance, non una critica ai controlli stessi — i controlli sono reali e sostanziosi. Ma se un costruttore cerca di capire cosa significhi "Critico" per le sue decisioni di deployment, la risposta è: significa la stessa escalation di sicurezza di "Alto", solo con più misure.
Cosa dovrebbero fare i costruttori
Per i team che costruiscono sull'API di OpenAI o che considerano Astra per workflow agenticci:
1. Date per scontato che il modello sarà pubblicato. Il pattern di risposta del framework è la continuazione controllata, non l'arresto. Pianificate per Astra che diventa disponibile sotto accesso limitato, non per essere trattenuta.
2. I controlli di sicurezza elencati da OpenAI sono la vostra anteprima del limite di deployment. Ambienti di test isolati, accesso di rete limitato, esecuzione sandbox, monitoraggio universale — queste sono le condizioni sotto cui Astra sarà resa disponibile. Se la vostra infrastruttura non può soddisfare queste condizioni, non potrete eseguire Astra in produzione.
3. Il dettaglio sul monitoraggio della catena di pensiero è operativamente il più significativo. OpenAI indica che i monitor valutano la catena di pensiero del modello e attivano una risposta di sicurezza per interrompere le attività ad alto rischio. Ciò significa che il ragionamento interno di Astra è supervisionato in fase di esecuzione — non solo durante la valutazione. Se state costruendo sistemi agenticci su Astra, le tracce di ragionamento del vostro agente saranno monitorate dall'infrastruttura di OpenAI. Questo ha implicazioni per latenza, privacy e modalità di fallimento.
4. Il coinvolgimento governativo significa visibilità normativa. OpenAI lavora con "agenzie governative pertinenti e organizzazioni di sicurezza IA selezionate" per testare il modello. Ciò significa che le capacità di Astra saranno note ai regolatori prima del rilascio del modello. I costruttori dovrebbero aspettarsi che il deployment di modelli di livello Critico sia accompagnato da condizioni normative — e dovrebbero preparare la loro postura di conformità di conseguenza.
5. La formulazione "non può escludere" si ripeterà. Man mano che i modelli avanzano, più laboratori raggiungeranno soglie dove non possono escludere capacità Critiche. La trasparenza di OpenAI qui crea un precedente. La domanda per i costruttori non è se smettere di usare questi modelli — è se il proprio framework di governance può rispondere a riscontri "non può escludere" con la stessa escalation strutturata di OpenAI.
Conclusione
Il Preparedness Framework di OpenAI è stato progettato per rispondere a: "Cosa facciamo quando i modelli diventano pericolosi?" L'annuncio di Astra è il primo test nel mondo reale di questo framework alla soglia di cybersecurity Critica. La risposta del framework — scalare i controlli di sicurezza, sospendere le attività non conformi, coinvolgere i governi, continuare lo sviluppo — è una risposta operativa ragionevole.
Ma non è un arresto. E il divario tra "capacità Critica" e "sviluppo continuo con controlli" è lo spazio in cui ogni costruttore, regolatore e ricercatore di sicurezza ora lavorerà.
L'annuncio contiene il divario. Ora lo avete cercato.
Domande frequenti
Qual è la soglia di cybersecurity Critica di OpenAI?
Secondo il Preparedness Framework di OpenAI, un modello raggiunge la soglia di cybersecurity Critica se può identificare e sviluppare autonomamente exploit zero-day funzionali di tutti i livelli di gravità in molti sistemi reali rinforzati senza intervento umano, o progettare ed eseguire end-to-end strategie novel di cyberattacchi contro bersagli rinforzati ricevendo solo un obiettivo di alto livello.
Astra è già distribuita?
No. Astra è un modello in arrivo. OpenAI non ha annunciato una data di rilascio. L'azienda ha sospeso le attività interne coinvolgenti Astra che non soddisfano i requisiti di sicurezza rafforzati.
Astra era coinvolta nell'exploit di Hugging Face?
No. OpenAI afferma esplicitamente che Astra non è stata coinvolta nello sfruttamento di Hugging Face. L'intrusione di Hugging Face, attribuita a un agente IA a luglio 2026, è un incidente separato.
Qual è la differenza tra High e Critical nel Preparedness Framework?
I modelli precedenti come GPT-5.6-Sol sono stati valutati alla soglia High. Critical è un gradino sopra. In pratica, la risposta di OpenAI a entrambe le soglie è stata simile: scalare i controlli di sicurezza, espandere i test, coinvolgere esperti esterni. Il framework non prevede un arresto di deployment al livello Critical.
Cosa dovrebbero preparare i costruttori?
I costruttori dovrebbero dare per scontato che Astra sarà pubblicata sotto accesso limitato (ambienti isolati, accesso di rete limitato, esecuzione sandbox, monitoraggio a runtime). I team che costruiscono sistemi agenticci dovrebbero prepararsi al monitoraggio della catena di pensiero da parte dell'infrastruttura di OpenAI e aspettarsi condizioni normative per il deployment di modelli di livello Critico.