LLM

Jev misurato sul campo: 92–214 ms per decisione, meno di 1 centesimo per 8 richieste — e il tranello del 25x contro 200x

Jev misurato sul campo: 92–214 ms per decisione, meno di 1 centesimo per 8 richieste — e il tranello del 25x contro 200x

TL;DR: Tre ondate di misurazioni indipendenti danno per la prima volta numeri concreti alla classe System One: 92–214 ms di latenza per decisione, meno di 1 centesimo per otto richieste e 75.3 punti per l'originale nella leaderboard JevBench. Rimisurato, il fattore di marketing di 200x si riduce a circa 25x. Questo articolo mostra i dati, il tranello e un test rapido in tre passaggi con cui Lei può misurare personalmente qualsiasi router.

La classe System One in una frase

Jev non scrive — decide. Invece di generare token dopo token, la classe dei modelli System One restituisce una classificazione o una decisione di routing in un unico passaggio estremamente rapido. È esattamente lo scopo per cui è stata costruita: come stadio preliminare davanti al costoso modello autoregressivo, che entra in gioco solo quando la decisione lo richiede.

Le tre ondate di misurazioni in sintesi

Nell'arco di due settimane, tre fonti indipendenti hanno strumentato la stessa classe. I numeri risultano molto vicini tra loro — cosa rara, che li rende affidabili.

Fonte di misuraLatenza per decisioneCostiNota
Prima ondata di misurazioni (blog principale)92–214 ms< 1 centesimo / 8 richiestecontato direttamente al gateway
Rimisurazione di Isenberg~200 ms / query18 centesimi per decine di e-mailworkflow quotidiano, ripetibile
Kai (misurazione pubblica)70–500 ms42 $/M in input, output gratuitobanda di latenza più ampia, stesso ordine di grandezza

La terza colonna è il punto chiave: ogni fonte calcola in modo diverso, ma tutte arrivano a millisecondi e frazioni di centesimo per task. La classe non è quindi più una vaga promessa, ma un protocollo di misura.

Il tranello del 200x: ricalcolato, resta circa 25x

Il salto dichiarato di 200x rispetto a un classico modello autoregressivo non regge del tutto alla verifica incrociata. Il motivo: il 200x confronta di solito il passaggio di generazione completo con il solo passaggio decisionale — inclusi gli effetti di warm-up e di avvio su entrambi i lati. Il valore ricalcolato, più omogeneo nel confronto, è di circa 25x, misurato su reimplementazioni aperte della stessa architettura. Resta comunque un salto di un ordine di grandezza, ma con una nota a piè di pagina.

Il meccanismo che c'è dietro

In sintesi, il meccanismo si basa su tre componenti:

  • Architettura incentrata sulla decisione: un passaggio compatto invece di cicli iterativi del decoder.
  • Campionamento parallelo: più decisioni candidate vengono eseguite contemporaneamente anziché in sequenza.
  • Calibrazione RLCD: la qualità decisionale viene ottimizzata direttamente sulla distribuzione dei TASK, non sulla generica log-verosimiglianza del token successivo.

Avvertenza dalla revisione 7: parti dell'impianto ricordano classiche architetture di classificatori con un'amplificazione di marketing. La classe è reale e lo sono anche i numeri — ma come inquadrare il tutto resta una questione aperta.

JevBench e l'ondata di cloni

Con JevBench la classe ha per la prima volta una propria leaderboard. I primi tre nella classifica generale:

ModelloGenerale
Jev75.3
SemIF75.1
DJev74.3

A ciò si aggiunge un notevole segnale di adozione: in otto giorni sono nate 20–30 reimplementazioni aperte — un ecosistema di cloni che cresce a questo ritmo è il segnale più forte che un'architettura colma una lacuna nello stack di routing. Laya (non autoregressivo) compare come seconda menzione indipendente della classe e sostiene così la tassonomia a due classi emersa dai primi test.

L'adozione come quarto dato

Il Vercel AI Gateway segnala per Jev l'adozione di modello più rapida della sua storia: circa il 13 per cento dei team già il primo giorno, misurato sul numero di team attivi. A titolo di confronto: la famiglia GPT-5.6 ha impiegato il doppio del tempo, Fable 5.1 sei volte tanto — Jev si è quindi affermato molto più velocemente.

Tabella del costo per task (copiabile)

GrandezzaValoreFonte
Latenza per decisione92–214 msprima ondata di misurazioni
Costo per 8 richieste< 1 centesimoprima ondata di misurazioni
Latenza, rimisurata~200 ms / queryIsenberg
Adozione giorno 1~13 % dei teamVercel AI Gateway
JevBench generale75.3 (Jev), 75.1 (SemIF), 74.3 (DJev)JevBench
Cloni in 8 giorni20–30conteggio pubblico

Calcolo minimo per il Suo stack:

python
# Costo per task di un passaggio decisionale
delay_ms = (92 + 214) / 2          # ~153 ms di latenza media
cost_per_request = 0.01 / 8         # 8 richieste per centesimo -> ~0.00125 EUR
print(f"1500 decisioni: {1500 * cost_per_request:.3f} EUR, "
      f"{1500 * delay_ms / 1000:.0f} s cumulati")

Il test rapido in 3 punti per il Suo router

  1. Punto latenza: Misuri 50 richieste sul Suo gateway e calcoli la mediana per decisione. Se resta sotto i 300 ms, la classe è rilevante per Lei.
  2. Punto costi: Divida il numero mensile di richieste per 8 e lo moltiplichi per il prezzo in centesimi della Sua regione. Sotto il quintuplo del costo per chiamata del Suo router attuale? Passi al punto 3.
  3. Punto qualità: Confronti a livello JevBench: quanto spesso il router decide diversamente da quanto concluderebbe a posteriori il modello grande? Scostamenti inferiori al 20 per cento sono considerati accettabili.

Chi completa tutti e tre i punti in un'ora ha verificato lo schema in prima persona — senza appoggiarsi all'hype.

Cosa significa per chi sviluppa

  • Accoppiamento del decisore: i compiti di routing (classificazione, intent, ordinamento) passano alla classe veloce, la generazione resta al modello grande.
  • Numeri prima dei nomi: ogni nuovo modello citato ottiene uno spazio solo quando latenza e costo per task sono documentati.
  • Sfruttare l'ecosistema di cloni: con 20–30 reimplementazioni aperte, vale la pena considerare SemIF e DJev come alternative locali con un profilo simile.

FAQ

Qual è la differenza tra una decisione System One e una normale chiamata al modello? Una classica chiamata al modello genera token dopo token e fornisce quindi testo come sottoprodotto della catena di probabilità. Un passaggio System One, invece, restituisce una decisione già pronta in un unico passaggio compatto — ad esempio una classe o un percorso di routing. Si risparmiano così proprio quei cicli di iterazione che causano la maggior parte della latenza nei compiti di classificazione.

Come devo leggere l'intervallo di 92–214 ms per decisione? L'intervallo indica l'estremo inferiore e superiore delle mediane misurate su più ondate indipendenti, sempre per singola decisione. La media si attesta intorno ai 150 ms, per cui una catena sequenziale di dieci decisioni richiede circa 1,5 secondi. Per le pipeline interattive è un margine sufficiente per operare prima o accanto al primo livello del modello completo.

Perché il fattore 25x è più onesto del 200x? Il 200x confronta livelli di warm-up e profondità di passaggio diversi, per cui i costi di avvio su entrambi i lati gonfiano la differenza. Confrontando direttamente un passaggio di generazione completo con un passaggio decisionale sullo stesso hardware, resta circa 25x. Questo valore è stato ricalcolato in modo riproducibile ed è quindi il valore di lavoro prudente.

Che cosa mi dice un'adozione del 13 per cento dei team già il primo giorno? Il dato proviene dal Vercel AI Gateway e conta i team attivi che hanno richiamato il modello almeno una volta entro 24 ore dal rilascio. Nella storia del gateway è la crescita più rapida mai misurata, davanti alle note famiglie di modelli. Il numero misura la curiosità e non necessariamente la fidelizzazione — per una stima costi-benefici è più significativa la mediana delle settimane successive.

Come integro concretamente il test rapido in 3 punti nella mia pipeline? Crei un contatore di richieste per ogni route, registri in un log latenza e importo in centesimi di ogni chiamata e calcoli la mediana dopo 50 righe. Poi confronti la decisione con il risultato del modello grande e segnali gli scostamenti. Con questi tre valori può valutare qualsiasi nuovo candidato router in un'ora, senza bisogno di una seconda fonte di riferimento.

Conviene un clone come SemIF o DJev rispetto all'originale? L'ondata di cloni ha prodotto in otto giorni 20–30 reimplementazioni aperte, le due migliori delle quali raggiungono rispettivamente 75.1 e 74.3 punti JevBench — solo da 0.2 a 1.0 punti dietro l'originale. Per setup locali con limiti hardware fissi sono quindi pienamente utilizzabili. La scelta dipende di solito dalla licenza e dal numero di parametri disponibile, non dal punteggio in sé.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h