Approccio di Sviluppo

Rilascio vincolato dalle valutazioni vs barriere di sicurezza automatiche: due approcci alla sicurezza dell’IA

OpenAI rinvia Astra per capacità di cybersicurezza critiche; Anthropic rende Auto Mode predefinito. Confronto tra rilascio valutato e barriere automatiche.

3
Rilascio vincolato dalle valutazioni (Preparedness Framework)
vs
3
Barriere di sicurezza automatiche (Auto Mode)
Verdetto Rapido

Il contrasto non è teorico. Il 7 agosto 2026, OpenAI ha esaminato le valutazioni interne di Astra e ha concluso di non poter escludere capacità di cybersicurezza Critiche: la capacità di scoprire e sviluppare autonomamente exploit zero-day contro sistemi rafforzati senza intervento umano. Ha sospeso la distribuzione, rafforzato i controlli di sicurezza e informato le agenzie governative. L’8 agosto 2026, Anthropic ha esaminato 1,053 partecipanti e ha concluso che Auto Mode blocca l’89% delle azioni pericolose: molto meglio del 13.6% degli esseri umani che ha rifiutato un comando chiaramente pericoloso. Ha reso Auto Mode predefinito a partire dal 14 agosto 2026. Queste decisioni non sono contraddittorie. Affrontano livelli di rischio diversi. Il rilascio vincolato dalle valutazioni chiede: “Questo modello è troppo pericoloso per essere distribuito?” Le barriere automatiche chiedono: “Una volta distribuito, che cosa può fare il modello in una sessione?” Il Preparedness Framework di OpenAI copre domini di capacità — cybersicurezza, biologia, chimica, replica autonoma — che Auto Mode non è mai stato progettato per valutare. Auto Mode copre azioni nella sessione — comandi da riga di comando pericolosi, iniezione di prompt, esfiltrazione di dati — che una valutazione pre-distribuzione non può anticipare completamente, perché la superficie di attacco dipende dall’ambiente dell’utente. La valutazione onesta: nessuno dei due approcci è sufficiente da solo. Il rilascio vincolato dalle valutazioni senza barriere in distribuzione lascia una lacuna tra ciò che il modello può fare in un prova controllata e ciò che fa in una sessione reale con dati reali. Le barriere automatiche senza valutazione a livello di capacità rischiano di distribuire un modello le cui capacità fondamentali — come la scoperta autonoma di zero-day — superano la soglia alla quale i controlli nella sessione possono contenerle in modo affidabile. Il tasso di mancato blocco dell’11% di Auto Mode ricorda che le barriere riducono il danno, non lo eliminano. Scelga il rilascio vincolato dalle valutazioni quando il rischio è il limite massimo di capacità del modello stesso: quando un modello capace di sviluppare autonomamente exploit zero-day non deve essere rilasciato finché le sue salvaguardie non sono proporzionate a quel potere. Scelga le barriere automatiche quando il rischio è il comportamento nella sessione: quando gli sviluppatori che usano un agente di codifica hanno bisogno di protezione in tempo reale da iniezione di prompt e comandi pericolosi, e l’affaticamento da conferme ha reso l’approvazione umana un controllo di sicurezza peggiore del giudizio del modello stesso. L’architettura di produzione più solida usa entrambi.

Confronto Dettagliato

Un'analisi comparativa dei fattori chiave per aiutarti a fare la scelta giusta.

Fattore
Rilascio vincolato dalle valutazioni (Preparedness Framework)Consigliato
Barriere di sicurezza automatiche (Auto Mode)Vincitore
Filosofia della sicurezza
Precauzionale: valuta le capacità prima del rilascio; se le valutazioni non possono escludere un pericolo Critico, sospende la distribuzione
Proattiva: distribuisce con barriere di sicurezza automatiche che bloccano le azioni pericolose in tempo reale durante l’uso
Velocità di distribuzione
Più lenta: Astra è sospeso a tempo indeterminato mentre vengono rafforzati i prove di robustezza e i controlli di sicurezza; le agenzie governative sono consultate
Più rapida: Auto Mode diventa predefinito il 14 agosto 2026, rimuovendo l’approvazione umana per ogni singola azione dal flusso di lavoro
Modello di supervisione umana
Revisione di esperti umani richiesta al varco: team di sicurezza, agenzie governative e valutatori esterni devono autorizzare il modello prima della distribuzione
Varichi automatici guidati dal modello: il modello stesso valuta ogni azione e blocca l’89% di quelle pericolose senza intervento umano
Ambito delle capacità coperte
Copre tutti i domini di capacità nel Preparedness Framework: cybersicurezza, biologia, chimica, auto-miglioramento dell’IA e replica autonoma
Copre solo le azioni di codifica nella sessione: comandi da riga di comando pericolosi, operazioni sui file e attacchi di iniezione di prompt dentro Claude Code
Adattabilità a nuovi tipi di minaccia
Richiede una nuova valutazione quando emergono nuove categorie di minaccia; il quadro è stato pubblicato nel dicembre 2023 ed è stato aggiornato con l’evoluzione delle capacità
Blocca le azioni pericolose in tempo reale sulla base del giudizio del modello; si adatta a nuovi schemi di attacco senza un ciclo di valutazione separato
Trasparenza e responsabilità esterna
Documento quadro pubblico (pubblicato nel dicembre 2023); OpenAI ha informato il pubblico e le agenzie governative quando Astra ha superato la soglia
Valutazioni interne commissionate a una terza parte (Trajectory Labs); metodologia e risultati completi non pubblicati
Affaticamento da conferme
Nessun effetto sul flusso di lavoro degli sviluppatori: il modello non viene distribuito finché non è autorizzato, quindi gli sviluppatori non interagiscono mai con un modello bloccato dal varco
Elimina le richieste costanti di approvazione: lo studio su 1,053 partecipanti ha mostrato che solo il 13.6% degli esseri umani ha rifiutato un comando chiaramente pericoloso, il che significa che l’86.4% lo ha approvato
Rischio residuo dopo il controllo
Rischio che un modello superi le valutazioni ma si comporti diversamente nella distribuzione: il quadro valuta la capacità, non il comportamento in ambienti reali
Tasso di mancato blocco dell’11%: Auto Mode non previene l’11% delle azioni pericolose, e nuovi vettori di attacco come pacchetti malevoli mascherati da strumenti di prova possono aggirarlo
Punteggio Totale3/ 83/ 82 pareggi
Filosofia della sicurezza
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Precauzionale: valuta le capacità prima del rilascio; se le valutazioni non possono escludere un pericolo Critico, sospende la distribuzione
Barriere di sicurezza automatiche (Auto Mode)
Proattiva: distribuisce con barriere di sicurezza automatiche che bloccano le azioni pericolose in tempo reale durante l’uso
Velocità di distribuzione
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Più lenta: Astra è sospeso a tempo indeterminato mentre vengono rafforzati i prove di robustezza e i controlli di sicurezza; le agenzie governative sono consultate
Barriere di sicurezza automatiche (Auto Mode)
Più rapida: Auto Mode diventa predefinito il 14 agosto 2026, rimuovendo l’approvazione umana per ogni singola azione dal flusso di lavoro
Modello di supervisione umana
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Revisione di esperti umani richiesta al varco: team di sicurezza, agenzie governative e valutatori esterni devono autorizzare il modello prima della distribuzione
Barriere di sicurezza automatiche (Auto Mode)
Varichi automatici guidati dal modello: il modello stesso valuta ogni azione e blocca l’89% di quelle pericolose senza intervento umano
Ambito delle capacità coperte
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Copre tutti i domini di capacità nel Preparedness Framework: cybersicurezza, biologia, chimica, auto-miglioramento dell’IA e replica autonoma
Barriere di sicurezza automatiche (Auto Mode)
Copre solo le azioni di codifica nella sessione: comandi da riga di comando pericolosi, operazioni sui file e attacchi di iniezione di prompt dentro Claude Code
Adattabilità a nuovi tipi di minaccia
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Richiede una nuova valutazione quando emergono nuove categorie di minaccia; il quadro è stato pubblicato nel dicembre 2023 ed è stato aggiornato con l’evoluzione delle capacità
Barriere di sicurezza automatiche (Auto Mode)
Blocca le azioni pericolose in tempo reale sulla base del giudizio del modello; si adatta a nuovi schemi di attacco senza un ciclo di valutazione separato
Trasparenza e responsabilità esterna
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Documento quadro pubblico (pubblicato nel dicembre 2023); OpenAI ha informato il pubblico e le agenzie governative quando Astra ha superato la soglia
Barriere di sicurezza automatiche (Auto Mode)
Valutazioni interne commissionate a una terza parte (Trajectory Labs); metodologia e risultati completi non pubblicati
Affaticamento da conferme
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Nessun effetto sul flusso di lavoro degli sviluppatori: il modello non viene distribuito finché non è autorizzato, quindi gli sviluppatori non interagiscono mai con un modello bloccato dal varco
Barriere di sicurezza automatiche (Auto Mode)
Elimina le richieste costanti di approvazione: lo studio su 1,053 partecipanti ha mostrato che solo il 13.6% degli esseri umani ha rifiutato un comando chiaramente pericoloso, il che significa che l’86.4% lo ha approvato
Rischio residuo dopo il controllo
Rilascio vincolato dalle valutazioni (Preparedness Framework)
Rischio che un modello superi le valutazioni ma si comporti diversamente nella distribuzione: il quadro valuta la capacità, non il comportamento in ambienti reali
Barriere di sicurezza automatiche (Auto Mode)
Tasso di mancato blocco dell’11%: Auto Mode non previene l’11% delle azioni pericolose, e nuovi vettori di attacco come pacchetti malevoli mascherati da strumenti di prova possono aggirarlo

Statistiche Chiave

Dati reali da fonti verificate del settore per supportare la tua decisione.

Solo il 13.6% di 1,053 partecipanti umani pagati ha rifiutato un comando chiaramente pericoloso; Auto Mode avrebbe bloccato l’89% di quelle stesse azioni

Anthropic

0 su 720 tentativi di iniezione indiretta di prompt hanno avuto successo contro Claude Fable 5, Opus 5 e Sonnet 5 con Auto Mode in prove di terza parte

Trajectory Labs

Auto Mode lascia un tasso residuo di mancato blocco dell’11% sulle azioni pericolose: non ogni attacco viene bloccato

Simon Willison

Il Preparedness Framework di OpenAI è stato pubblicato nel dicembre 2023; GPT-5.6 Sol è stato valutato alla soglia Alta, mentre Astra potrebbe superare la soglia Critica di cybersicurezza

OpenAI

La soglia Critica di cybersicurezza indica che un modello può identificare e sviluppare exploit zero-day funzionali di tutti i livelli di gravità in sistemi reali rafforzati senza intervento umano

OpenAI Preparedness Framework

OpenAI ha sospeso tutte le attività interne su Astra che non rispettano controlli di sicurezza rafforzati e sta collaborando con le agenzie governative prima di riprendere

OpenAI

Tutte le statistiche provengono da fonti terze verificate. Fonte, anno e link diretto sono mostrati su ogni metrica.

Quando Scegliere Ogni Opzione

Una guida chiara basata sulla tua situazione specifica ed esigenze.

Scegli Rilascio vincolato dalle valutazioni (Preparedness Framework) quando...

  • Sta distribuendo un modello le cui capacità coprono cybersicurezza, biologia o replica autonoma: domini in cui le barriere in distribuzione non possono coprire l’intera superficie di rischio
  • Ha bisogno di una responsabilità pubblica e verificabile, con notifica al governo e coinvolgimento di istituti esterni per la sicurezza
  • Il Suo modello di rischio richiede di valutare il limite massimo di capacità del modello stesso, non solo il suo comportamento nella sessione
  • Sta costruendo infrastrutture in cui una singola capacità pericolosa, come la scoperta autonoma di zero-day, causerebbe danni catastrofici e irreversibili

Scegli Barriere di sicurezza automatiche (Auto Mode) quando...

  • Sta distribuendo un agente di codifica in cui il rischio principale sono azioni pericolose durante le sessioni di sviluppo, non la capacità autonoma del modello
  • I Suoi sviluppatori soffrono di affaticamento da conferme: l’86.4% degli esseri umani ha approvato un comando chiaramente pericoloso nelle prove
  • Ha bisogno di protezione in tempo reale che si adatti a nuovi schemi di attacco senza attendere un ciclo di valutazione separato
  • Il Suo modello di minaccia riguarda iniezione di prompt ed esfiltrazione di dati dentro una sessione di codifica interattiva, non la capacità di cyberattacco autonomo

La Nostra Raccomandazione

Il contrasto non è teorico. Il 7 agosto 2026, OpenAI ha esaminato le valutazioni interne di Astra e ha concluso di non poter escludere capacità di cybersicurezza Critiche: la capacità di scoprire e sviluppare autonomamente exploit zero-day contro sistemi rafforzati senza intervento umano. Ha sospeso la distribuzione, rafforzato i controlli di sicurezza e informato le agenzie governative. L’8 agosto 2026, Anthropic ha esaminato 1,053 partecipanti e ha concluso che Auto Mode blocca l’89% delle azioni pericolose: molto meglio del 13.6% degli esseri umani che ha rifiutato un comando chiaramente pericoloso. Ha reso Auto Mode predefinito a partire dal 14 agosto 2026. Queste decisioni non sono contraddittorie. Affrontano livelli di rischio diversi. Il rilascio vincolato dalle valutazioni chiede: “Questo modello è troppo pericoloso per essere distribuito?” Le barriere automatiche chiedono: “Una volta distribuito, che cosa può fare il modello in una sessione?” Il Preparedness Framework di OpenAI copre domini di capacità — cybersicurezza, biologia, chimica, replica autonoma — che Auto Mode non è mai stato progettato per valutare. Auto Mode copre azioni nella sessione — comandi da riga di comando pericolosi, iniezione di prompt, esfiltrazione di dati — che una valutazione pre-distribuzione non può anticipare completamente, perché la superficie di attacco dipende dall’ambiente dell’utente. La valutazione onesta: nessuno dei due approcci è sufficiente da solo. Il rilascio vincolato dalle valutazioni senza barriere in distribuzione lascia una lacuna tra ciò che il modello può fare in un prova controllata e ciò che fa in una sessione reale con dati reali. Le barriere automatiche senza valutazione a livello di capacità rischiano di distribuire un modello le cui capacità fondamentali — come la scoperta autonoma di zero-day — superano la soglia alla quale i controlli nella sessione possono contenerle in modo affidabile. Il tasso di mancato blocco dell’11% di Auto Mode ricorda che le barriere riducono il danno, non lo eliminano. Scelga il rilascio vincolato dalle valutazioni quando il rischio è il limite massimo di capacità del modello stesso: quando un modello capace di sviluppare autonomamente exploit zero-day non deve essere rilasciato finché le sue salvaguardie non sono proporzionate a quel potere. Scelga le barriere automatiche quando il rischio è il comportamento nella sessione: quando gli sviluppatori che usano un agente di codifica hanno bisogno di protezione in tempo reale da iniezione di prompt e comandi pericolosi, e l’affaticamento da conferme ha reso l’approvazione umana un controllo di sicurezza peggiore del giudizio del modello stesso. L’architettura di produzione più solida usa entrambi.

Domande Frequenti

Risposte alle domande comuni su questo confronto.

No. Auto Mode e il rilascio vincolato dalle valutazioni affrontano livelli di rischio diversi. Il rilascio vincolato dalle valutazioni stabilisce se le capacità di un modello siano troppo pericolose per distribuirlo; Auto Mode blocca le azioni pericolose durante l’uso. Anthropic conduce comunque prove di sicurezza prima della distribuzione dei modelli: Auto Mode aggiunge uno strato in distribuzione sopra quel varco, non lo sostituisce.
Un modello raggiunge la soglia Critica di cybersicurezza se può identificare e sviluppare exploit zero-day funzionali di tutti i livelli di gravità in molti sistemi critici reali rafforzati senza intervento umano, oppure può ideare ed eseguire strategie nuove dall’inizio alla fine per cyberattacchi contro bersagli rafforzati avendo solo un obiettivo desiderato di alto livello.
Nello studio di Anthropic su 1,053 partecipanti retribuiti, Auto Mode ha bloccato l’89% delle azioni pericolose che gli esseri umani avevano approvato. L’11% restante rappresenta azioni pericolose che Auto Mode non avrebbe prevenuto. Simon Willison ha segnalato nuovi vettori di attacco, come pacchetti malevoli mascherati da strumenti di prova, che potrebbero rientrare in quella lacuna. Auto Mode è uno strato di riduzione del danno, non una garanzia.
Sì, e dovrebbero esserlo. Il Preparedness Framework di OpenAI decide se un modello sia sicuro da distribuire; Auto Mode di Anthropic regola ciò che il modello può fare una volta distribuito. La maggior parte degli architetture di sicurezza IA in produzione ha bisogno di entrambi: rilascio vincolato dalle valutazioni per i rischi a livello di capacità (rischi cibernetici, biologici e di replica autonoma) e barriere automatiche per i rischi nella sessione (iniezione di prompt, comandi pericolosi, esfiltrazione di dati).

Hai bisogno di aiuto per decidere?

Prenota una consulenza gratuita di 30 minuti e ti aiuteremo a determinare l'approccio migliore per il tuo progetto specifico.

Consulenza gratuita
Senza impegno
Risposta entro 24h