TL;DR: Drei unabhängige Messwellen bringen die System-One-Klasse erstmals auf zählbare Zahlen: 92–214 ms Latenz pro Entscheidung, unter 1 Cent für acht Requests, und beim JevBench-Leaderboard 75.3 Punkte für das Original. Der Marketing-Faktor von 200x schrumpft beim Nachmessen auf rund 25x zusammen. This article zeigt die Datenpunkte, den Fang und einen dreistufigen Schnelltest, mit dem du jeden Router selbst nachmisst.
Die System-One-Klasse in einem Satz
Jev schreibt nicht — es entscheidet. Statt Token für Token zu generieren, gibt die Klasse der System-One-Modelle in einem einzigen, extrem schnellen Pass eine Klassifikation oder Routing-Entscheidung aus. Genau dafür ist sie gebaut: als Vorstufe vor dem teuren Autoregressiv-Modell, das nur dann anspringt, wenn die Entscheidung es verlangt.
Die drei Messwellen im Überblick
Innerhalb von zwei Wochen haben drei unabhängige Quellen dieselbe Klasse instrumentiert. Die Zahlen schlagen dicht beieinander ein — das ist selten und macht sie belastbar.
| Messquelle | Latenz pro Entscheidung | Kosten | Bemerkung |
|---|---|---|---|
| Erste Messwelle (Primär-Blog) | 92–214 ms | < 1 Cent / 8 Requests | direkt am Gateway gezählt |
| Isenberg-Nachmessung | ~200 ms / Query | 18 Cent für Dutzende E-Mails | Alltags-Workflow, wiederholbar |
| Kai (öffentliche Messung) | 70–500 ms | 42 $/M Input, Output gratis | breitestes Latenz-Band, gleiche Ordnung |
Die dritte Spalte ist der Punkt: Jede Quelle rechnet anders, aber alle landen bei Dezibel-Millisekunden und Cent-Bruchteilen pro Task. Die Klasse ist damit kein Vagen-Versprechen mehr, sondern ein Messprotokoll.
Der 200x-Fang: nachgerechnet bleiben rund 25x
Der ausgewiesene Sprung von 200x gegenüber einem klassischen Autoregressiv-Modell hält der Gegenprüfung nicht vollständig stand. Grund: Die 200x vergleichen meist den kompletten Generierungspass mit dem reinen Decision-Pass — inklusive Aufwärm- und Startup-Effekten auf beiden Seiten. Die nachgerechnete, apfelsicherere Zahl liegt bei etwa 25x, gemessen an offenen Nachbauten derselben Architektur. Das ist immer noch ein Dimensionssprung, aber einer mit Fußnote.
Die Mechanik dahinter
Die destillierte Mechanik läuft in drei Bausteinen:
- Entscheidungszentrierte Architektur: ein kompakter Pass statt iterativer Decoder-Schleifen.
- Paralleles Sampling: mehrere Kandidatenentscheidungen laufen gleichzeitig statt nacheinander.
- RLCD-Kalibrierung: die Entscheidungsgüte wird direkt auf die TASK-Verteilung getuned, nicht auf generische Next-Token-Loglikelihood.
Caveat der Sichtung 7: Teile des Setups erinnern an klassische Classifier-Architekturen plus Marketing-Amplifikation. Die Klasse ist real, die Zahlensäule ist es auch — die Einordnung der Einordnung bleibt aber laufend offen.
JevBench und die Klon-Welle
Mit dem JevBench hat die Klasse erstmals ein eigenes Leaderboard. Die Top-Drei nach overall:
| Modell | Overall |
|---|---|
| Jev | 75.3 |
| SemIF | 75.1 |
| DJev | 74.3 |
Dazu kommt ein bemerkenswertes Adoptionszeichen: In acht Tagen entstanden 20–30 offene Nachbauten — ein Klon-Ökosystem in dem Tempo ist das stärkste Signal dafür, dass eine Architektur eine Lücke im Routing-Stapel füllt. Laya (non-autoregressive) taucht als zweite unabhängige Klassen-Nennung auf und stützt damit die Zwei-Klassen-Taxonomie aus den ersten Runs.
Adoption als vierter Datenpunkt
Das Vercel AI Gateway meldet für Jev die schnellste Modell-Adoption seiner Gateway-Geschichte: rund 13 Prozent der Teams am ersten Tag, gemessen an der Zahl aktiver Teams. Im Größenvergleich: die GPT-5.6-Familie erreichte das 2-Fache, Fable 5.1 das 6-Fache der Tagesfrist — Jev zog also deutlich schneller mit.
Cost-per-Task-Tabelle (kopierbar)
| Größe | Wert | Quelle |
|---|---|---|
| Latenz pro Entscheidung | 92–214 ms | erste Messwelle |
| Kosten pro 8 Requests | < 1 Cent | erste Messwelle |
| Latenz, nachgemessen | ~200 ms / Query | Isenberg |
| Adoption Tag 1 | ~13 % der Teams | Vercel AI Gateway |
| JevBench overall | 75.3 (Jev), 75.1 (SemIF), 74.3 (DJev) | JevBench |
| Klone in 8 Tagen | 20–30 | öffentliche Zählung |
Rechnung für den eigenen Stack, minimal:
# Cost-per-Task für einen Decision-Pass
delay_ms = (92 + 214) / 2 # ~153 ms mittlere Latenz
cost_per_request = 0.01 / 8 # 8 Requests je Cent -> ~0.00125 EUR
print(f"1500 Entscheidungen: {1500 * cost_per_request:.3f} EUR, "
f"{1500 * delay_ms / 1000:.0f} s kumuliert")
Der 3-Punkte-Schnelltest für deinen eigenen Router
- Latenz-Punkt: Miss 50 Requests an deinem Gateway, Median pro Entscheidung. Landest du unter 300 ms, ist die Klasse für dich relevant.
- Kosten-Punkt: Teile deine Monats-Requestzahl durch 8 und multipliziere mit dem Cent-Preis deiner Region. Unter dem Fünffachen des bisherigen Router-Ticks? Weiter zu Punkt 3.
- Qualitäts-Punkt: Vergleiche auf JevBench-Niveau: Wie oft entscheidet der Router anders als das große Modell im Nachhinein? Abweichungen unter 20 Prozent gelten als anschlussfähig.
Wer alle drei Punkte in einer Stunde durchhat, hat das Muster selbst verifiziert — ohne den Hype als Klammer.
Was das für Builder heißt
- Entscheider-Kopplung: Router-Aufgaben (Klassifikation, Intent, Sortierung) wandern auf die schnelle Klasse, Generierung bleibt beim großen Modell.
- Zahlen vor Namen: jede neue Modell-Nennung bekommt erst dann einen Slot, wenn Latenz und Kosten pro Task dokumentiert sind.
- Klon-Ökosystem nutzen: bei 20–30 offenen Nachbauten lohnt der Blick auf SemIF und DJev als lokale Alternativen mit ähnlichem Profil.
FAQ
Was ist der Unterschied zwischen einer System-One-Entscheidung und einem normalen Model-Call? Ein klassischer Modell-Call generiert Token um Token und liefert damit Text als Nebenprodukt der Wahrscheinlichkeitskette. Ein System-One-Pass gibt dagegen in einem einzigen, kompakten Durchlauf eine fertige Entscheidung aus — etwa eine Klasse oder einen Routing-Pfad. Das spart genau jene Iterationsschleifen, die bei Klassifikationsaufgaben den Großteil der Latenz verursachen.
Wie lese ich die Spanne 92–214 ms pro Entscheidung? Die Spanne markiert das untere und obere Ende der gemessenen Mediane über mehrere unabhängige Wellen, jeweils pro einzelner Entscheidung. Der Mittelwert liegt bei etwa 150 ms, womit eine sequentielle Kette aus zehn Entscheidungen bei rund 1,5 Sekunden liegt. Für interaktive Pipelines ist das genug Puffer, um vor oder neben dem ersten Voll-Modell-Layer zu laufen.
Warum ist der 25x- statt des 200x-Faktors die ehrlichere Zahl? Die 200x vergleichen unterschiedliche Aufwärmstufen und Pass-Tiefen, wodurch Startup-Kosten auf beiden Seiten die Differenz aufblasen. Beim direkten Vergleich eines kompletten Generierungspasses mit einem Decision-Pass derselben Hardware bleiben etwa 25x übrig. Diese Zahl ist reproduzierbar nachgerechnet und deshalb die konservative Arbeitsgröße.
Was sagt mir die Adoption von 13 Prozent der Teams am ersten Tag? Die Kennzahl stammt aus dem Vercel AI Gateway und zählt aktive Teams, die das Modell innerhalb von 24 Stunden nach Release mindestens einmal aufriefen. Im Kontext der Gateway-Historie ist das der schnellste jemals gemessene Anstieg, noch vor den bekannten Familien-Modellen. Die Zahl misst Neugier und nicht necessarily Verbleib — für eine Kosten-Nutzen-Abschätzung ist der Median der Folgewochen aussagekräftiger.
Wie baue ich den 3-Punkte-Schnelltest konkret in meine Pipeline ein? Du legst pro Route einen Zähler für Requests an, schreibst Latenz und Cent-Betrag je Aufruf in ein Log und ziehst nach 50 Zeilen den Median. Dann vergleichst du die Entscheidung gegen das Ergebnis des großen Modells und markierst Abweichungen. Mit diesen drei Werten kannst du jeden neuen Router-Kandidaten in einer Stunde einordnen, ohne eine zweite Referenzquelle zu brauchen.
Lohnt sich ein Klon wie SemIF oder DJev gegenüber dem Original? Die Klon-Welle brachte in acht Tagen 20–30 offene Nachbauten hervor, von denen die beiden besten auf 75.1 respektive 74.3 JevBench-Punkte kommen — nur 0.2 bis 1.0 Punkte hinter dem Original. Für lokale Setups mit festen Hardware-Grenzen sind sie damit voll anschlussfähig. Die Entscheidung fällt meist über die Lizenz und die verfügbare Parameterzahl, nicht über die Punktzahl selbst.
Quellen
- Primär-Blog zur System-One-Klasse und Jev: https://typesafe.ai/blog/introducing-system-one-models-and-jev
- Laya, non-autoregressive Nennung derselben Klasse: https://laya.convaiinnovations.com
- Two-Minute-Papers-Video zur Mechanik (Decision-Architektur, paralleles Sampling, RLCD): https://www.youtube.com/watch?v=53wDOI_7x8I
- Diskussions- und Zähl-Threads auf Hacker News (Jev-Start 86+36 Kommentare, Arcturus-Labs-Analyse 253, Awesome-Jev-Kuratierung 88): https://news.ycombinator.com
- JevBench-Leaderboard (Overall-Werte 75.3 / 75.1 / 74.3) und First-Party-Adoption-Receipt des Vercel AI Gateway — zitiert nach den täglich verifizierten Messläufen vom 19.–23.09.2026