Approccio di Sviluppo

Banco di valutazione interno o punteggi di benchmark pubblicati: su cosa basare la scelta del modello?

GPT-5.6 Sol ha ottenuto 7,8 % e 38,3 % sulle stesse prove ARC-AGI-3. Era cambiato solo il banco. Quando fidarsi delle classifiche e quando no.

4
Banco di valutazione interno
vs
4
Punteggi di benchmark pubblicati
Verdetto Rapido

Usi i benchmark pubblicati per la preselezione, il Suo banco di valutazione per decidere, e non inverta mai i due ruoli. La controversia su ARC-AGI-3 del luglio 2026 è la prova più limpida finora prodotta. La posizione di OpenAI — un benchmark non misura mai il solo modello, ma anche l'impianto tecnico che lo circonda — è corretta. La posizione di ARC Prize — i punteggi ufficiali devono seguire un approccio standardizzato, senza impostazioni specifiche del fornitore, perché il confronto resti onesto — è altrettanto corretta. François Chollet ha tracciato la linea che scioglie davvero il nodo: i banchi costruiti apposta per risolvere il benchmark, o che incorporano conoscenza del suo formato, sono esclusi; le funzioni generiche dell'API, disponibili a tutta la clientela, sono ammesse purché impostazioni e costi vengano dichiarati. È una regola che può applicare alle Sue misurazioni già da domani. Per una decisione d'acquisto ne discende un ordine, non un'alternativa. Le classifiche scremano in fretta e senza spesa: un modello che non compare nel discorso sui benchmark pubblici di ragionamento o di codice non verrà salvato da nessuna catena di esecuzione. Ma non appena due o tre candidati restano separati da pochi punti, il numero pubblicato smette di distinguere e comincia a farlo il Suo banco. Un'oscillazione di circa cinque volte ottenuta con due interruttori dell'API supera quasi ogni distacco tra modelli di punta in una classifica: la decisione sulla catena di esecuzione pesa quindi più della decisione sul modello, proprio nel momento in cui i team smettono di pensarci. I dati di ingegneria di Cursor puntano nella stessa direzione da un angolo del tutto diverso: la quota di richieste di merge integrate scritte da agenti in cloud è passata da circa una su dieci a dicembre a oltre la metà a luglio, e l'azienda lo attribuisce all'ambiente — dare agli agenti macchine proprie e lasciare che riparino da soli la propria installazione — non a un modello migliore. Due dati indipendenti del 2026, una sola conclusione: a muoversi è stato il sistema attorno al modello. C'è un caso in cui i punteggi pubblicati vincono senza discussione, e non è di natura tecnica. Se un numero deve reggere davanti al consiglio di amministrazione, a una gara d'appalto o a un'autorità di vigilanza, un risultato interno autodichiarato non regge. ARC Prize pubblica il proprio finanziamento, le regole di astensione per il personale che detiene quote in un laboratorio sottoposto a test e la composizione di un comitato accademico indipendente proprio per questo. Il Suo banco non ha nulla di tutto ciò, e non deve fingere il contrario. Il nostro consiglio: preselezione in un pomeriggio sui benchmark pubblici, poi due settimane per costruire un banco con 30-50 prove reali estratte dai Suoi registri, con rilevazione di token e costo per singola prova e almeno un parametro della catena di esecuzione commutabile. Ripeta la prova a ogni cambio di modello e a ogni modifica del ciclo. Se il budget copre una sola delle due strade, costruisca il banco — ma pubblichi impostazioni e costi accanto al punteggio, cioè esattamente il criterio che pretenderebbe da un fornitore.

Confronto Dettagliato

Un'analisi comparativa dei fattori chiave per aiutarti a fare la scelta giusta.

Fattore
Banco di valutazione internoConsigliato
Punteggi di benchmark pubblicatiVincitore
Che cosa misura davvero il numero
Il modello insieme alla Sua catena di esecuzione come sistema unico: le istruzioni, la gestione dello stato, gli strumenti, la politica di ritentativo.
Il modello in un impianto neutrale rispetto ai fornitori, che esclude deliberatamente le funzioni API specifiche di un fornitore.
Confrontabilità tra fornitori
Equa quanto lo è il Suo involucro, non di più. OpenAI ha usato impostazioni specifiche per modello: proprio questo rende il suo 38,3 per cento non confrontabile con un'esecuzione standardizzata.
È l'obiettivo stesso. ARC Prize fa passare ogni modello attraverso un approccio standardizzato, senza impostazioni specifiche del fornitore.
Prevede ciò che manderete davvero in esercizio
Alta. Sol è passato dal 7,8 al 38,3 per cento sulle stesse prove pubbliche senza alcuna modifica ai pesi, per il solo effetto del ragionamento conservato e della condensazione al posto del troncamento.
Bassa per il lavoro agentico. Nel banco ufficiale il ragionamento viene scartato dopo ogni azione: non è così che si manda un agente in produzione.
Sforzo per arrivare a un numero utilizzabile
Da giorni a settimane: insieme di prove, criteri di valutazione, rilevazione dei costi e qualcuno che tenga tutto onesto mentre il codice cambia.
Minuti. Le classifiche sono pubblicate, datate e consultabili gratuitamente.
Rende visibile quanto pesa il Suo ciclo
In modo diretto. Due impostazioni della Responses API hanno spostato il punteggio di un modello di circa cinque volte, riducendo nello stesso tempo i token prodotti a un sesto.
Invisibile per costruzione. Un banco standardizzato tiene ferma la catena di esecuzione, perciò la leva più grande del Suo impianto non compare mai nel numero.
Verificabilità e gestione dei conflitti di interesse
Solo quanto lo imponete voi stessi. I banchi interni sono raramente rivisti e si lasciano tarare con facilità, in modo consapevole o meno, verso il modello già preferito.
Politica pubblicata. ARC Prize dichiara il proprio finanziamento, impone l'astensione al personale che detiene quote in un laboratorio sottoposto a test e sottopone la metodologia a un comitato accademico indipendente.
Riproducibilità da parte di terzi
Solo interna. Nessuno fuori dal team può ripetere la prova, e un'affermazione del fornitore misurata così resta autodichiarata: il 38,3 per cento non ha avuto alcuna verifica indipendente su insieme chiuso.
Riproducibile da chi pubblica, su un insieme di dati e con una cadenza di pubblicazione dichiarati in anticipo.
Visibilità dei costi
La Sua fattura reale sulle Sue prove reali, ritentativi compresi, insieme ai token che il ciclo spreca. Sol a 5 / 30 dollari per milione e Opus 5 a 5 / 25 differiscono molto meno dei volumi di token prodotti da due banchi diversi.
Pubblicata ma generica. La classifica ARC-AGI-3 mette a confronto costo per prova e punteggio e riporta solo i sistemi la cui esecuzione costa meno di 10.000 dollari: segnale utile, non la Sua fattura.
Attinenza al Suo carico di lavoro
Le prove le sceglie Lei, quindi il punteggio parla del Suo settore, dei Suoi documenti e dei Suoi modi di fallire.
Astratta per costruzione. ARC-AGI-3 verifica l'adattamento in tempo reale ad ambienti interattivi mai visti; i collaudatori umani si fermano in media al 48 per cento.
Punteggio Totale4/ 94/ 91 pareggi
Che cosa misura davvero il numero
Banco di valutazione interno
Il modello insieme alla Sua catena di esecuzione come sistema unico: le istruzioni, la gestione dello stato, gli strumenti, la politica di ritentativo.
Punteggi di benchmark pubblicati
Il modello in un impianto neutrale rispetto ai fornitori, che esclude deliberatamente le funzioni API specifiche di un fornitore.
Confrontabilità tra fornitori
Banco di valutazione interno
Equa quanto lo è il Suo involucro, non di più. OpenAI ha usato impostazioni specifiche per modello: proprio questo rende il suo 38,3 per cento non confrontabile con un'esecuzione standardizzata.
Punteggi di benchmark pubblicati
È l'obiettivo stesso. ARC Prize fa passare ogni modello attraverso un approccio standardizzato, senza impostazioni specifiche del fornitore.
Prevede ciò che manderete davvero in esercizio
Banco di valutazione interno
Alta. Sol è passato dal 7,8 al 38,3 per cento sulle stesse prove pubbliche senza alcuna modifica ai pesi, per il solo effetto del ragionamento conservato e della condensazione al posto del troncamento.
Punteggi di benchmark pubblicati
Bassa per il lavoro agentico. Nel banco ufficiale il ragionamento viene scartato dopo ogni azione: non è così che si manda un agente in produzione.
Sforzo per arrivare a un numero utilizzabile
Banco di valutazione interno
Da giorni a settimane: insieme di prove, criteri di valutazione, rilevazione dei costi e qualcuno che tenga tutto onesto mentre il codice cambia.
Punteggi di benchmark pubblicati
Minuti. Le classifiche sono pubblicate, datate e consultabili gratuitamente.
Rende visibile quanto pesa il Suo ciclo
Banco di valutazione interno
In modo diretto. Due impostazioni della Responses API hanno spostato il punteggio di un modello di circa cinque volte, riducendo nello stesso tempo i token prodotti a un sesto.
Punteggi di benchmark pubblicati
Invisibile per costruzione. Un banco standardizzato tiene ferma la catena di esecuzione, perciò la leva più grande del Suo impianto non compare mai nel numero.
Verificabilità e gestione dei conflitti di interesse
Banco di valutazione interno
Solo quanto lo imponete voi stessi. I banchi interni sono raramente rivisti e si lasciano tarare con facilità, in modo consapevole o meno, verso il modello già preferito.
Punteggi di benchmark pubblicati
Politica pubblicata. ARC Prize dichiara il proprio finanziamento, impone l'astensione al personale che detiene quote in un laboratorio sottoposto a test e sottopone la metodologia a un comitato accademico indipendente.
Riproducibilità da parte di terzi
Banco di valutazione interno
Solo interna. Nessuno fuori dal team può ripetere la prova, e un'affermazione del fornitore misurata così resta autodichiarata: il 38,3 per cento non ha avuto alcuna verifica indipendente su insieme chiuso.
Punteggi di benchmark pubblicati
Riproducibile da chi pubblica, su un insieme di dati e con una cadenza di pubblicazione dichiarati in anticipo.
Visibilità dei costi
Banco di valutazione interno
La Sua fattura reale sulle Sue prove reali, ritentativi compresi, insieme ai token che il ciclo spreca. Sol a 5 / 30 dollari per milione e Opus 5 a 5 / 25 differiscono molto meno dei volumi di token prodotti da due banchi diversi.
Punteggi di benchmark pubblicati
Pubblicata ma generica. La classifica ARC-AGI-3 mette a confronto costo per prova e punteggio e riporta solo i sistemi la cui esecuzione costa meno di 10.000 dollari: segnale utile, non la Sua fattura.
Attinenza al Suo carico di lavoro
Banco di valutazione interno
Le prove le sceglie Lei, quindi il punteggio parla del Suo settore, dei Suoi documenti e dei Suoi modi di fallire.
Punteggi di benchmark pubblicati
Astratta per costruzione. ARC-AGI-3 verifica l'adattamento in tempo reale ad ambienti interattivi mai visti; i collaudatori umani si fermano in media al 48 per cento.

Statistiche Chiave

Dati reali da fonti verificate del settore per supportare la tua decisione.

GPT-5.6 Sol ha ottenuto il 7,8 per cento sull'insieme pubblico ARC-AGI-3 nel banco ufficiale di ARC Prize e il 38,3 per cento tramite la Responses API di OpenAI con ragionamento conservato e condensazione: pesi identici, banco diverso.

MLQ.ai

Claude Opus 5 ha ottenuto il 30,2 per cento sullo stesso insieme pubblico nel banco standardizzato: davanti al 7,8 per cento ufficiale di Sol, dietro al suo 38,3 per cento autodichiarato.

THE DECODER

Ragionamento conservato e condensazione hanno triplicato il punteggio riducendo a un sesto i token prodotti, secondo OpenAI.

MLQ.ai

I collaudatori umani ottengono in media il 48 per cento su ARC-AGI-3: entrambi i modelli di punta restano sotto la prestazione umana con qualunque banco.

MLQ.ai

In Cursor circa una richiesta di merge integrata su dieci era scritta da agenti in cloud a dicembre, contro oltre la metà a luglio 2026; l'azienda lo attribuisce all'ambiente, non a un modello migliore.

Cursor Engineering Blog

La classifica ARC-AGI-3 mette a confronto costo per prova e punteggio e riporta solo i sistemi la cui esecuzione costa meno di 10.000 dollari.

ARC Prize

OpenRouter riporta GPT-5.6 Sol a 5 / 30 dollari per milione di token e Claude Opus 5 a 5 / 25: quanti di quei token vengano davvero spesi lo decide il banco.

OpenRouter Models API

Tutte le statistiche provengono da fonti terze verificate. Fonte, anno e link diretto sono mostrati su ogni metrica.

Quando Scegliere Ogni Opzione

Una guida chiara basata sulla tua situazione specifica ed esigenze.

Scegli Banco di valutazione interno quando...

  • State portando in esercizio un agente e non un'interfaccia di conversazione: gestione dello stato, condensazione e ritentativi fanno parte del prodotto, e un punteggio misurato senza di essi non dice nulla sui tempi di risposta né sulla fattura.
  • Due modelli candidati sono separati da pochi punti nelle classifiche pubbliche: a quella distanza il banco pesa più del modello.
  • Il Suo settore è circoscritto (gestione sinistri, revisione contrattuale, strumenti interni) e nessun benchmark pubblico copre il lavoro che svolgete davvero.
  • Le serve un costo per prova difendibile per un budget o per un'offerta al cliente, misurato sulle Sue prove e non su quelle di altri.

Scegli Punteggi di benchmark pubblicati quando...

  • Siete alla preselezione e dovete scartare i modelli palesemente inadatti prima di investirci tempo di sviluppo.
  • Le serve un numero di terze parti citabile per una nota al consiglio, una gara d'appalto o una comunicazione all'autorità di vigilanza: un risultato interno autodichiarato non supera quel vaglio.
  • State seguendo il progresso da una generazione all'altra, invece di scegliere quale modello mandare in esercizio questo trimestre.
  • Nel team nessuno è responsabile della valutazione: un banco interno non curato porta a decisioni peggiori di una classifica pubblicata.

La Nostra Raccomandazione

Usi i benchmark pubblicati per la preselezione, il Suo banco di valutazione per decidere, e non inverta mai i due ruoli. La controversia su ARC-AGI-3 del luglio 2026 è la prova più limpida finora prodotta. La posizione di OpenAI — un benchmark non misura mai il solo modello, ma anche l'impianto tecnico che lo circonda — è corretta. La posizione di ARC Prize — i punteggi ufficiali devono seguire un approccio standardizzato, senza impostazioni specifiche del fornitore, perché il confronto resti onesto — è altrettanto corretta. François Chollet ha tracciato la linea che scioglie davvero il nodo: i banchi costruiti apposta per risolvere il benchmark, o che incorporano conoscenza del suo formato, sono esclusi; le funzioni generiche dell'API, disponibili a tutta la clientela, sono ammesse purché impostazioni e costi vengano dichiarati. È una regola che può applicare alle Sue misurazioni già da domani. Per una decisione d'acquisto ne discende un ordine, non un'alternativa. Le classifiche scremano in fretta e senza spesa: un modello che non compare nel discorso sui benchmark pubblici di ragionamento o di codice non verrà salvato da nessuna catena di esecuzione. Ma non appena due o tre candidati restano separati da pochi punti, il numero pubblicato smette di distinguere e comincia a farlo il Suo banco. Un'oscillazione di circa cinque volte ottenuta con due interruttori dell'API supera quasi ogni distacco tra modelli di punta in una classifica: la decisione sulla catena di esecuzione pesa quindi più della decisione sul modello, proprio nel momento in cui i team smettono di pensarci. I dati di ingegneria di Cursor puntano nella stessa direzione da un angolo del tutto diverso: la quota di richieste di merge integrate scritte da agenti in cloud è passata da circa una su dieci a dicembre a oltre la metà a luglio, e l'azienda lo attribuisce all'ambiente — dare agli agenti macchine proprie e lasciare che riparino da soli la propria installazione — non a un modello migliore. Due dati indipendenti del 2026, una sola conclusione: a muoversi è stato il sistema attorno al modello. C'è un caso in cui i punteggi pubblicati vincono senza discussione, e non è di natura tecnica. Se un numero deve reggere davanti al consiglio di amministrazione, a una gara d'appalto o a un'autorità di vigilanza, un risultato interno autodichiarato non regge. ARC Prize pubblica il proprio finanziamento, le regole di astensione per il personale che detiene quote in un laboratorio sottoposto a test e la composizione di un comitato accademico indipendente proprio per questo. Il Suo banco non ha nulla di tutto ciò, e non deve fingere il contrario. Il nostro consiglio: preselezione in un pomeriggio sui benchmark pubblici, poi due settimane per costruire un banco con 30-50 prove reali estratte dai Suoi registri, con rilevazione di token e costo per singola prova e almeno un parametro della catena di esecuzione commutabile. Ripeta la prova a ogni cambio di modello e a ogni modifica del ciclo. Se il budget copre una sola delle due strade, costruisca il banco — ma pubblichi impostazioni e costi accanto al punteggio, cioè esattamente il criterio che pretenderebbe da un fornitore.

Domande Frequenti

Risposte alle domande comuni su questo confronto.

No. Misurano qualcosa di preciso e circoscritto, e lo dichiarano apertamente: il modello in un impianto standardizzato, senza impostazioni specifiche del fornitore, in modo che numeri provenienti da fornitori diversi possano stare nella stessa tabella. Nello scambio del luglio 2026 François Chollet ha tracciato la linea utile: i banchi costruiti per risolvere un benchmark, o che incorporano conoscenza del suo formato, sono esclusi; le funzioni generiche dell'API, aperte a tutta la clientela, sono ammesse finché impostazioni e costi vengono dichiarati con chiarezza. L'errore non sta nel leggere le classifiche, ma nello scambiare un numero di classifica per una previsione del Suo esercizio.
Più di quanto separi i modelli di punta tra loro. Sull'insieme pubblico ARC-AGI-3 gli stessi pesi di GPT-5.6 Sol hanno dato il 7,8 per cento nel banco ufficiale e il 38,3 per cento tramite la Responses API di OpenAI con ragionamento conservato e condensazione: circa cinque volte tanto, e con un sesto dei token prodotti anziché di più. Per confronto, Claude Opus 5 sullo stesso insieme si ferma al 30,2 per cento nella misura ufficiale. Se la Sua catena di esecuzione butta via il ragionamento tra un passo e l'altro o tronca bruscamente il contesto quando la finestra si riempie, sta facendo girare il modello con il freno a mano tirato.
Entrambi, ma in sequenza, e l'ordine conta. Usi i benchmark pubblici per ridurre in un pomeriggio una lista lunga a due o tre candidati: è ciò in cui riescono bene e non costa nulla. Poi decida tra i finalisti con il Suo banco, perché a quella distanza i numeri pubblicati non distinguono più. Se può finanziare una sola delle due strade, finanzi il banco: è l'unico dei due che misura ciò per cui sta effettivamente pagando.
Da trenta a cinquanta prove reali estratte dai Suoi registri anziché casi inventati, un criterio di valutazione di cui si fida (a questa scala basta una revisione umana), la rilevazione per singola prova di token in ingresso, token in uscita e costo effettivo, e almeno un parametro della catena di esecuzione commutabile: quello che sposta di più i numeri è la conservazione dello stato tra un passo e l'altro. Ripeta la prova a ogni cambio di modello e di ciclo, e annoti le impostazioni accanto al punteggio. È proprio quest'ultimo passaggio a distinguere una misurazione da un aneddoto, ed è il criterio a cui è approdata la controversia con ARC Prize.

Hai bisogno di aiuto per decidere?

Prenota una consulenza gratuita di 30 minuti e ti aiuteremo a determinare l'approccio migliore per il tuo progetto specifico.

Consulenza gratuita
Senza impegno
Risposta entro 24h