---
type: "Comparison"
title: "Jev vs. SemIF vs. DJev: il duello JevBench in 8 giorni"
description: "Jev vs. SemIF vs. DJev su JevBench: 75,3, 75,1, 74,3 — meno di un punto di scarto. La migrazione si decide per ruolo: originale calibrato o pesi aperti."
resource: "https://www.contextstudios.ai/it/confronto/jev-vs-semif-vs-djev"
language: "it"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T21:54:47.255Z"
status: "stable"
---

# Jev vs. SemIF vs. DJev: il duello JevBench in 8 giorni

Il 15 settembre 2026 TypeSafe AI ha pubblicato Jev — il primo modello System One, che restituisce decisioni tipizzate con probabilità calibrate invece di testo. In otto giorni sono nati 20-30 clone. Il JevBench del produttore indica: Jev 75,3, SemIF 75,1, DJev 74,3. Tutti e tre stanno in un punto — ed è proprio per questo che la classifica non decide. L'asse è il ruolo: originale calibrato ospitato, oppure pesi aperti in gestione propria.

## Confronto Dettagliato

| Fattore | Jev (TypeSafe AI) | SemIF e DJev (clone open source) | Vincitore |
|--------|------|------|--------|
| Punteggio JevBench | 75,3 — in testa al primo benchmark dedicato ai modelli di decisione, scritto dalla stessa mano del modello | SemIF 75,1, DJev 74,3 — tutti gli scarti sotto un punto, sotto la risoluzione dei più set di test interni | Jev (TypeSafe AI) |
| Latenza e costi | 70–500 ms per decisione; 42 $ per M di token in input, output gratuito; nessun secondo livello di infrastruttura | gira sulla propria inferenza (backbone 4B/35B); costi dipendenti dall'hardware, senza SLA ospitato | Jev (TypeSafe AI) |
| Calibrazione | Obiettivo: probabilità calibrata — una risposta al 95 % deve essere giusta circa il 95 % delle volte, base delle decisioni a soglia automatiche | SemIF usa un classificatore NLI a tre classi sull'ultimo token; sfumatura di confidenza più grossolana | Jev (TypeSafe AI) |
| Apertura e gestione | API ospitata, lancio in early access; nessun peso aperto | Checkpoint aperti su Hugging Face — SemIF in 4B e 35B su backbone Qwen3.5, DJev nella stessa classe; riproducibili in proprio | SemIF e DJev (clone open source) |
| Ecosistema e adozione | Adozione più rapida nella storia del Vercel AI Gateway: circa il 13 % dei team il primo giorno; Playground e JevBench dallo stesso fornitore | Lignaggio più giovane ma rapido: la linea Kev è cresciuta da 0,5B a 8B in pochi giorni; i clone seguono l'originale a ruota | Jev (TypeSafe AI) |

## Statistiche Chiave

- **75,3 · 75,1 · 74,3 — Jev, SemIF, DJev su JevBench — un punto di ampiezza per tutta la classe** — [Rilevazioni JevBench, digest IA 19–20 settembre 2026](https://explainx.ai/blog/jev-playground-jevbench-launch-2026) (2026)
- **20–30 — clone della lignia Jev in otto giorni — sei solo nei primi due** — [Latent.Space AINews 17–18 settembre 2026](https://www.latent.space/p/ainews-here-are-6-clones-of-jev-in) (2026)
- **A inizio ottobre 2026 Cloudflare ha rilasciato Clef e Clef-flash (27B/9B, backbone Qwen, Apache 2.0) su Workers AI — compatibili con l'API Jev e a pesi aperti; nella tabella auto-misurata di Cloudflare Clef supera Jev in otto righe di benchmark su dieci (es. API-Bank 93,11 vs 88,19; BANKING77 macro-F1 94,2 vs 79,74), mentre Jev resta davanti su When2Call e BRIGHT — tutti numeri riportati dal fornitore.** — [Cloudflare blog — Introducing Clef (ott 2026)](https://blog.cloudflare.com/clef-decision-models/) (2026)
- **Latenze mediane riportate: Clef-flash 38,8 ms e Clef 209,3 ms contro 524,1 ms di Jev (p95: 122,4 ms Clef-flash vs 536 ms Jev, su 43 valutazioni); Clef aggiunge un encoder visivo e una finestra di contesto di 64k dove Jev resta testuale a 32k — da considerare riportate dal fornitore e da rimisurare.** — [Cloudflare blog — Introducing Clef (ott 2026)](https://blog.cloudflare.com/clef-decision-models/) (2026)

## Scelga Jev (TypeSafe AI) quando...

- Le probabilità calibrate portano loro la logica: il codice agisce sopra una soglia, tutto il resto passa all'umano — senza inferenza in proprio.

## Scelga SemIF e DJev (clone open source) quando...

- Servono pesi aperti sul proprio hardware: compiti stretti (routing, classificazione) su un backbone Qwen3.5 già in esecuzione, con checkpoint riproducibile invece di API ospitata.

## La Nostra Raccomandazione

La classifica decide poco: gli scarti stanno sotto un punto, meno della risoluzione della maggior parte dei set interni. L'asse è il ruolo: Jev è l'originale calibrato con API ospitata, SemIF e DJev le repliche aperte per la propria inferenza.

Scegliete Jev quando sono le probabilità a portare la logica. La calibrazione rende automatiche le decisioni a soglia: una risposta al 95 % deve essere giusta circa il 95 % delle volte; il codice agisce sopra il valore, il resto all'umano. Con 70–500 ms, 42 $ per M di token in input e output gratuito, non serve un secondo livello di infrastruttura.

Un clone basta quando il compito è stretto e l'hardware c'è già. SemIF porta 4B e 35B come backbone Qwen3.5 con classificatore NLI a tre classi, DJev è nella stessa classe — chi già esegue Qwen3.5 ottiene il modello di decisione come sottoprodotto. In cambio: confidenza più grossolana e gestione propria.

Due note di igiene: JevBench viene dalla stessa mano del modello, e il prezzo è passato da 400× a 440× senza metodo spiegato. Numeri utili ma non finiti: rimisurate sul proprio set di compiti, poi migrata.

A inizio ottobre il campo si è di nuovo allargato: Clef e Clef-flash di Cloudflare (Apache 2.0, compatibili con l'API Jev, ospitati su Workers AI) sono entrati sopra Jev nel Jev Decision Index con latenze riportate di ~39–209 ms contro ~524 ms di Jev — l'onda dei cloni ha raggiunto il livello infrastrutturale. La logica dei ruoli decide ancora, ma trattate ogni numero cross-vendor come riportato dal fornitore e rimisuratelo sul vostro set di attività.

## Domande Frequenti

**Q: Cosa misura JevBench?**
A: Il primo benchmark costruito apposta per i modelli di decisione System One. È scritto da TypeSafe stessa, quindi il primo posto di Jev è atteso, non sorprendente — la scala resta utile perché la categoria non aveva una valutazione dedicata. Composizione dei compiti e rubrica di punteggio esistevano solo come numeri-titres.

**Q: Perché i punti non decidono?**
A: Gli scarti sono sotto un punto — meno di quanto molti set interni risolvano. Per la scelta di migrazione conta il ruolo: originale calibrato ospitato o pesi aperti in gestione propria.

**Q: Quando basta il clone?**
A: Quando il compito è stretto (routing, classificazione, booleani), il backbone Qwen3.5 gira già sul proprio hardware e una sfumatura di confidenza più grossolana basta alla logica.

**Q: Quando l'originale?**
A: Quando la calibrazione è il criterio, non si gestisce inferenza propria, o quando 70–500 ms di risposta contano nel loop dell'agente. Dettaglio di igiene: «fino a 400× più economico» al lancio, «440×» quattro giorni dopo, senza cambio di metodo spiegato — rimisurati sul proprio set di compiti.

**Q: Dove si colloca Cloudflare Clef in questo campo?**
A: Come risposta del livello infrastrutturale all'onda dei cloni: compatibile con l'API Jev, a pesi aperti (Apache 2.0), ospitato su Workers AI e con una propria piattaforma di fine-tuning RL. La tabella auto-misurata lo colloca sopra Jev in otto righe su dieci — ma sono numeri riportati dal fornitore: rimisurateli sul tuo set di attività, esattamente come per JevBench stesso.

