---
type: "BlogPosting"
title: "Jev misurato sul campo: 92–214 ms per decisione, meno di 1 centesimo per 8 richieste — e il tranello del 25x contro 200x"
description: "Tre ondate di misurazioni indipendenti quantificano la classe System One: 92–214 ms per decisione, meno di 1 centesimo per 8 richieste, JevBench 75.3 — e, rimisurato, il fattore 200x si riduce a circa 25x."
resource: "https://www.contextstudios.ai/it/blog/jev-misurato-92-214-ms-per-decisione-meno-di-1-centesimo-per-8-richieste"
language: "it"
tags: ["LLM", "AI Agents", "Inference Optimization", "Daily Intel"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-03T01:39:58.931Z"
status: "stable"
---

# Jev misurato sul campo: 92–214 ms per decisione, meno di 1 centesimo per 8 richieste — e il tranello del 25x contro 200x

Published: 2026-09-23
Tags: LLM, AI Agents, Inference Optimization, Daily Intel

![Jev misurato sul campo: 92–214 ms per decisione, meno di 1 centesimo per 8 richieste — e il tranello del 25x contro 200x](https://wary-platypus-754.convex.cloud/api/storage/a4c23a50-e966-4e13-8599-7f2a08e886ac)

**TL;DR:** Tre ondate di misurazioni indipendenti danno per la prima volta numeri concreti alla classe System One: 92–214 ms di latenza per decisione, meno di 1 centesimo per otto richieste e 75.3 punti per l'originale nella leaderboard JevBench. Rimisurato, il fattore di marketing di 200x si riduce a circa 25x. Questo articolo mostra i dati, il tranello e un test rapido in tre passaggi con cui Lei può misurare personalmente qualsiasi router.

## La classe System One in una frase
Jev non scrive — decide. Invece di generare token dopo token, la classe dei **modelli System One** restituisce una classificazione o una decisione di routing in un unico passaggio estremamente rapido. È esattamente lo scopo per cui è stata costruita: come stadio preliminare davanti al costoso modello autoregressivo, che entra in gioco solo quando la decisione lo richiede.

## Le tre ondate di misurazioni in sintesi
Nell'arco di due settimane, tre fonti indipendenti hanno strumentato la stessa classe. I numeri risultano molto vicini tra loro — cosa rara, che li rende affidabili.

| Fonte di misura | Latenza per decisione | Costi | Nota |
|---|---|---|---|
| Prima ondata di misurazioni (blog principale) | 92–214 ms | < 1 centesimo / 8 richieste | contato direttamente al gateway |
| Rimisurazione di Isenberg | ~200 ms / query | 18 centesimi per decine di e-mail | workflow quotidiano, ripetibile |
| Kai (misurazione pubblica) | 70–500 ms | 42 $/M in input, output gratuito | banda di latenza più ampia, stesso ordine di grandezza |

La terza colonna è il punto chiave: ogni fonte calcola in modo diverso, ma tutte arrivano a **millisecondi e frazioni di centesimo per task**. La classe non è quindi più una vaga promessa, ma un protocollo di misura.

## Il tranello del 200x: ricalcolato, resta circa 25x
Il salto dichiarato di 200x rispetto a un classico modello autoregressivo non regge del tutto alla verifica incrociata. Il motivo: il 200x confronta di solito il passaggio di generazione completo con il solo passaggio decisionale — inclusi gli effetti di warm-up e di avvio su entrambi i lati. Il valore ricalcolato, più omogeneo nel confronto, è di **circa 25x**, misurato su reimplementazioni aperte della stessa architettura. Resta comunque un salto di un ordine di grandezza, ma con una nota a piè di pagina.

## Il meccanismo che c'è dietro
In sintesi, il meccanismo si basa su tre componenti:
- **Architettura incentrata sulla decisione:** un passaggio compatto invece di cicli iterativi del decoder.
- **Campionamento parallelo:** più decisioni candidate vengono eseguite contemporaneamente anziché in sequenza.
- **Calibrazione RLCD:** la qualità decisionale viene ottimizzata direttamente sulla distribuzione dei TASK, non sulla generica log-verosimiglianza del token successivo.

Avvertenza dalla revisione 7: parti dell'impianto ricordano classiche architetture di classificatori con un'amplificazione di marketing. La classe è reale e lo sono anche i numeri — ma come inquadrare il tutto resta una questione aperta.

## JevBench e l'ondata di cloni
Con **JevBench** la classe ha per la prima volta una propria leaderboard. I primi tre nella classifica generale:

| Modello | Generale |
|---|---|
| Jev | 75.3 |
| SemIF | 75.1 |
| DJev | 74.3 |

A ciò si aggiunge un notevole segnale di adozione: in otto giorni sono nate **20–30 reimplementazioni aperte** — un ecosistema di cloni che cresce a questo ritmo è il segnale più forte che un'architettura colma una lacuna nello stack di routing. **Laya** (non autoregressivo) compare come seconda menzione indipendente della classe e sostiene così la tassonomia a due classi emersa dai primi test.

## L'adozione come quarto dato
Il **Vercel AI Gateway** segnala per Jev l'adozione di modello più rapida della sua storia: circa il **13 per cento dei team già il primo giorno**, misurato sul numero di team attivi. A titolo di confronto: la famiglia GPT-5.6 ha impiegato il doppio del tempo, Fable 5.1 sei volte tanto — Jev si è quindi affermato molto più velocemente.

## Tabella del costo per task (copiabile)

| Grandezza | Valore | Fonte |
|---|---|---|
| Latenza per decisione | 92–214 ms | prima ondata di misurazioni |
| Costo per 8 richieste | < 1 centesimo | prima ondata di misurazioni |
| Latenza, rimisurata | ~200 ms / query | Isenberg |
| Adozione giorno 1 | ~13 % dei team | Vercel AI Gateway |
| JevBench generale | 75.3 (Jev), 75.1 (SemIF), 74.3 (DJev) | JevBench |
| Cloni in 8 giorni | 20–30 | conteggio pubblico |

Calcolo minimo per il Suo stack:

```python
# Costo per task di un passaggio decisionale
delay_ms = (92 + 214) / 2          # ~153 ms di latenza media
cost_per_request = 0.01 / 8         # 8 richieste per centesimo -> ~0.00125 EUR
print(f"1500 decisioni: {1500 * cost_per_request:.3f} EUR, "
      f"{1500 * delay_ms / 1000:.0f} s cumulati")
```

## Il test rapido in 3 punti per il Suo router
1. **Punto latenza:** Misuri 50 richieste sul Suo gateway e calcoli la mediana per decisione. Se resta sotto i 300 ms, la classe è rilevante per Lei.
2. **Punto costi:** Divida il numero mensile di richieste per 8 e lo moltiplichi per il prezzo in centesimi della Sua regione. Sotto il quintuplo del costo per chiamata del Suo router attuale? Passi al punto 3.
3. **Punto qualità:** Confronti a livello JevBench: quanto spesso il router decide diversamente da quanto concluderebbe a posteriori il modello grande? Scostamenti inferiori al 20 per cento sono considerati accettabili.

Chi completa tutti e tre i punti in un'ora ha verificato lo schema in prima persona — senza appoggiarsi all'hype.

## Cosa significa per chi sviluppa
- **Accoppiamento del decisore:** i compiti di routing (classificazione, intent, ordinamento) passano alla classe veloce, la generazione resta al modello grande.
- **Numeri prima dei nomi:** ogni nuovo modello citato ottiene uno spazio solo quando latenza e costo per task sono documentati.
- **Sfruttare l'ecosistema di cloni:** con 20–30 reimplementazioni aperte, vale la pena considerare SemIF e DJev come alternative locali con un profilo simile.

## FAQ
**Qual è la differenza tra una decisione System One e una normale chiamata al modello?**
Una classica chiamata al modello genera token dopo token e fornisce quindi testo come sottoprodotto della catena di probabilità. Un passaggio System One, invece, restituisce una decisione già pronta in un unico passaggio compatto — ad esempio una classe o un percorso di routing. Si risparmiano così proprio quei cicli di iterazione che causano la maggior parte della latenza nei compiti di classificazione.

**Come devo leggere l'intervallo di 92–214 ms per decisione?**
L'intervallo indica l'estremo inferiore e superiore delle mediane misurate su più ondate indipendenti, sempre per singola decisione. La media si attesta intorno ai 150 ms, per cui una catena sequenziale di dieci decisioni richiede circa 1,5 secondi. Per le pipeline interattive è un margine sufficiente per operare prima o accanto al primo livello del modello completo.

**Perché il fattore 25x è più onesto del 200x?**
Il 200x confronta livelli di warm-up e profondità di passaggio diversi, per cui i costi di avvio su entrambi i lati gonfiano la differenza. Confrontando direttamente un passaggio di generazione completo con un passaggio decisionale sullo stesso hardware, resta circa 25x. Questo valore è stato ricalcolato in modo riproducibile ed è quindi il valore di lavoro prudente.

**Che cosa mi dice un'adozione del 13 per cento dei team già il primo giorno?**
Il dato proviene dal Vercel AI Gateway e conta i team attivi che hanno richiamato il modello almeno una volta entro 24 ore dal rilascio. Nella storia del gateway è la crescita più rapida mai misurata, davanti alle note famiglie di modelli. Il numero misura la curiosità e non necessariamente la fidelizzazione — per una stima costi-benefici è più significativa la mediana delle settimane successive.

**Come integro concretamente il test rapido in 3 punti nella mia pipeline?**
Crei un contatore di richieste per ogni route, registri in un log latenza e importo in centesimi di ogni chiamata e calcoli la mediana dopo 50 righe. Poi confronti la decisione con il risultato del modello grande e segnali gli scostamenti. Con questi tre valori può valutare qualsiasi nuovo candidato router in un'ora, senza bisogno di una seconda fonte di riferimento.

**Conviene un clone come SemIF o DJev rispetto all'originale?**
L'ondata di cloni ha prodotto in otto giorni 20–30 reimplementazioni aperte, le due migliori delle quali raggiungono rispettivamente 75.1 e 74.3 punti JevBench — solo da 0.2 a 1.0 punti dietro l'originale. Per setup locali con limiti hardware fissi sono quindi pienamente utilizzabili. La scelta dipende di solito dalla licenza e dal numero di parametri disponibile, non dal punteggio in sé.

## Fonti
- Blog principale sulla classe System One e su Jev: [https://typesafe.ai/blog/introducing-system-one-models-and-jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev)
- Laya, menzione non autoregressiva della stessa classe: [https://laya.convaiinnovations.com](https://laya.convaiinnovations.com)
- Video di Two Minute Papers sul meccanismo (architettura decisionale, campionamento parallelo, RLCD): [https://www.youtube.com/watch?v=53wDOI_7x8I](https://www.youtube.com/watch?v=53wDOI_7x8I)
- Thread di discussione e conteggio su Hacker News (lancio di Jev 86+36 commenti, analisi di Arcturus Labs 253, raccolta Awesome Jev 88): [https://news.ycombinator.com](https://news.ycombinator.com)
- Leaderboard JevBench (punteggi generali 75.3 / 75.1 / 74.3) e riscontro di adozione first-party del Vercel AI Gateway — citati dalle misurazioni verificate quotidianamente dal 19 al 23 settembre 2026

## Related

- [Sviluppo agenti AI](https://www.contextstudios.ai/it/sviluppo-agente-ia.md)
- [Sviluppo LLM](https://www.contextstudios.ai/it/sviluppo-llm.md)
- [Sviluppo AI](https://www.contextstudios.ai/it/sviluppo-ia.md)
- [Sistemi multi-agente](https://www.contextstudios.ai/it/sistemi-multi-agente.md)
