TL;DR : Trois vagues de mesures indépendantes donnent pour la première fois des chiffres concrets à la classe System One : 92–214 ms de latence par décision, moins de 1 centime pour huit requêtes et 75.3 points pour l'original sur le leaderboard JevBench. Une fois remesuré, le facteur marketing de 200x se réduit à environ 25x. Cet article présente les données, le piège et un test rapide en trois étapes pour mesurer vous-même n'importe quel routeur.
La classe System One en une phrase
Jev n'écrit pas — il décide. Au lieu de générer token après token, la classe des modèles System One délivre une classification ou une décision de routage en une seule passe extrêmement rapide. C'est exactement sa raison d'être : servir d'étape préalable au coûteux modèle autorégressif, qui n'intervient que lorsque la décision l'exige.
Les trois vagues de mesures en un coup d'œil
En l'espace de deux semaines, trois sources indépendantes ont instrumenté la même classe. Les chiffres tombent très près les uns des autres — c'est rare, et c'est ce qui les rend fiables.
| Source de mesure | Latence par décision | Coûts | Remarque |
|---|---|---|---|
| Première vague de mesures (blog principal) | 92–214 ms | < 1 centime / 8 requêtes | compté directement au gateway |
| Remesure d'Isenberg | ~200 ms / requête | 18 centimes pour des dizaines d'e-mails | workflow quotidien, reproductible |
| Kai (mesure publique) | 70–500 ms | 42 $/M en entrée, sortie gratuite | plage de latence la plus large, même ordre de grandeur |
La troisième colonne est l'essentiel : chaque source calcule différemment, mais toutes aboutissent à quelques millisecondes et des fractions de centime par tâche. La classe n'est donc plus une vague promesse, mais un protocole de mesure.
Le piège des 200x : après recalcul, il reste environ 25x
Le bond annoncé de 200x par rapport à un modèle autorégressif classique ne résiste pas entièrement à la contre-vérification. La raison : les 200x comparent généralement la passe de génération complète à la seule passe de décision — effets de préchauffage et de démarrage compris des deux côtés. Le chiffre recalculé, plus comparable à périmètre égal, se situe à environ 25x, mesuré sur des réimplémentations ouvertes de la même architecture. Cela reste un saut d'un ordre de grandeur, mais avec une note de bas de page.
Le mécanisme sous-jacent
Distillé, le mécanisme repose sur trois briques :
- Architecture centrée sur la décision : une passe compacte au lieu de boucles de décodeur itératives.
- Échantillonnage parallèle : plusieurs décisions candidates s'exécutent simultanément plutôt que successivement.
- Calibrage RLCD : la qualité de décision est ajustée directement sur la distribution des TÂCHES, et non sur la log-vraisemblance générique du prochain token.
Réserve issue de l'examen 7 : certaines parties du dispositif rappellent des architectures de classificateurs classiques, amplifiées par le marketing. La classe est réelle, les chiffres aussi — mais la manière de les mettre en perspective reste une question ouverte.
JevBench et la vague de clones
Avec JevBench, la classe dispose pour la première fois de son propre leaderboard. Le top trois au classement général :
| Modèle | Général |
|---|---|
| Jev | 75.3 |
| SemIF | 75.1 |
| DJev | 74.3 |
S'y ajoute un signe d'adoption remarquable : 20 à 30 réimplémentations ouvertes sont apparues en huit jours — un écosystème de clones qui croît à ce rythme est le signal le plus fort qu'une architecture comble un manque dans la pile de routage. Laya (non autorégressif) apparaît comme une deuxième mention indépendante de la classe et conforte ainsi la taxonomie à deux classes issue des premiers essais.
L'adoption comme quatrième point de données
Le Vercel AI Gateway annonce pour Jev l'adoption de modèle la plus rapide de son histoire : environ 13 % des équipes dès le premier jour, mesuré sur le nombre d'équipes actives. À titre de comparaison : la famille GPT-5.6 a mis deux fois plus de temps, Fable 5.1 six fois plus — Jev s'est donc imposé nettement plus vite.
Tableau du coût par tâche (à copier)
| Grandeur | Valeur | Source |
|---|---|---|
| Latence par décision | 92–214 ms | première vague de mesures |
| Coût pour 8 requêtes | < 1 centime | première vague de mesures |
| Latence, remesurée | ~200 ms / requête | Isenberg |
| Adoption jour 1 | ~13 % des équipes | Vercel AI Gateway |
| JevBench général | 75.3 (Jev), 75.1 (SemIF), 74.3 (DJev) | JevBench |
| Clones en 8 jours | 20–30 | décompte public |
Calcul minimal pour votre propre stack :
# Coût par tâche pour une passe de décision
delay_ms = (92 + 214) / 2 # ~153 ms de latence moyenne
cost_per_request = 0.01 / 8 # 8 requêtes par centime -> ~0.00125 EUR
print(f"1500 décisions : {1500 * cost_per_request:.3f} EUR, "
f"{1500 * delay_ms / 1000:.0f} s cumulées")
Le test rapide en 3 points pour votre propre routeur
- Point latence : Mesurez 50 requêtes sur votre gateway et prenez la médiane par décision. Si vous restez sous les 300 ms, la classe est pertinente pour vous.
- Point coûts : Divisez votre nombre mensuel de requêtes par 8 et multipliez par le prix au centime de votre région. En dessous de cinq fois le coût par appel de votre routeur actuel ? Passez au point 3.
- Point qualité : Comparez au niveau JevBench : à quelle fréquence le routeur décide-t-il autrement que le grand modèle a posteriori ? Des écarts inférieurs à 20 % sont considérés comme acceptables.
Si vous bouclez les trois points en une heure, vous avez vérifié le schéma par vous-même — sans vous appuyer sur le battage médiatique.
Ce que cela signifie pour les builders
- Couplage décideur : les tâches de routage (classification, intention, tri) passent à la classe rapide, la génération reste au grand modèle.
- Les chiffres avant les noms : chaque nouveau modèle cité n'obtient une place qu'une fois la latence et le coût par tâche documentés.
- Tirer parti de l'écosystème de clones : avec 20 à 30 réimplémentations ouvertes, SemIF et DJev méritent un coup d'œil comme alternatives locales au profil similaire.
FAQ
Quelle est la différence entre une décision System One et un appel de modèle classique ? Un appel de modèle classique génère token après token et produit ainsi du texte comme sous-produit de la chaîne de probabilités. Une passe System One, en revanche, délivre une décision finie en un seul passage compact — par exemple une classe ou un chemin de routage. On économise ainsi précisément les boucles d'itération qui causent l'essentiel de la latence dans les tâches de classification.
Comment interpréter la fourchette de 92–214 ms par décision ? La fourchette indique les bornes inférieure et supérieure des médianes mesurées sur plusieurs vagues indépendantes, à chaque fois par décision individuelle. La moyenne se situe autour de 150 ms, ce qui place une chaîne séquentielle de dix décisions à environ 1,5 seconde. Pour des pipelines interactifs, cela laisse assez de marge pour s'exécuter avant ou à côté de la première couche de modèle complet.
Pourquoi le facteur 25x est-il plus honnête que 200x ? Les 200x comparent des niveaux de préchauffage et des profondeurs de passe différents, si bien que les coûts de démarrage des deux côtés gonflent l'écart. En comparant directement une passe de génération complète à une passe de décision sur le même matériel, il reste environ 25x. Ce chiffre a été recalculé de manière reproductible et constitue donc la valeur de travail prudente.
Que m'apprend une adoption par 13 % des équipes dès le premier jour ? L'indicateur provient du Vercel AI Gateway et compte les équipes actives ayant appelé le modèle au moins une fois dans les 24 heures suivant sa sortie. Dans l'historique du gateway, c'est la progression la plus rapide jamais mesurée, devant les familles de modèles connues. Le chiffre mesure la curiosité et pas forcément la rétention — pour une estimation coûts-bénéfices, la médiane des semaines suivantes est plus parlante.
Comment intégrer concrètement le test rapide en 3 points dans mon pipeline ? Créez un compteur de requêtes par route, consignez la latence et le montant en centimes de chaque appel dans un log et calculez la médiane après 50 lignes. Comparez ensuite la décision au résultat du grand modèle et signalez les écarts. Avec ces trois valeurs, vous pouvez situer tout nouveau candidat routeur en une heure, sans avoir besoin d'une seconde source de référence.
Un clone comme SemIF ou DJev vaut-il la peine face à l'original ? La vague de clones a produit 20 à 30 réimplémentations ouvertes en huit jours, dont les deux meilleures atteignent respectivement 75.1 et 74.3 points JevBench — seulement 0.2 à 1.0 point derrière l'original. Pour des configurations locales aux limites matérielles fixes, elles sont donc pleinement exploitables. Le choix se fait généralement sur la licence et le nombre de paramètres disponible, pas sur le score lui-même.
Sources
- Blog principal sur la classe System One et Jev : https://typesafe.ai/blog/introducing-system-one-models-and-jev
- Laya, mention non autorégressive de la même classe : https://laya.convaiinnovations.com
- Vidéo Two Minute Papers sur le mécanisme (architecture de décision, échantillonnage parallèle, RLCD) : https://www.youtube.com/watch?v=53wDOI_7x8I
- Fils de discussion et de décompte sur Hacker News (lancement de Jev 86+36 commentaires, analyse d'Arcturus Labs 253, curation Awesome Jev 88) : https://news.ycombinator.com
- Leaderboard JevBench (scores généraux 75.3 / 75.1 / 74.3) et relevé d'adoption first-party du Vercel AI Gateway — cités d'après les mesures vérifiées quotidiennement du 19 au 23 septembre 2026