---
type: "Comparison"
title: "Jev vs. SemIF vs. DJev: Das JevBench-Duell in 8 Tagen"
description: "Jev vs. SemIF vs. DJev auf JevBench: 75.3, 75.1, 74.3 — unter einem Punkt Abstand. Die Wechselentscheidung faellt ueber die Rolle: kalibriertes Original oder offene Weights."
resource: "https://www.contextstudios.ai/de/vergleich/jev-vs-semif-vs-djev"
language: "de"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:09:59.047Z"
status: "stable"
---

# Jev vs. SemIF vs. DJev: Das JevBench-Duell in 8 Tagen

Am 15.09.2026 hat TypeSafe AI Jev veröffentlicht — das erste System-One-Modell, das getypte Entscheidungen mit kalibrierten Wahrscheinlichkeiten liefert statt Text. Innerhalb von acht Tagen entstanden 20 bis 30 Nachbauten. Das herstellereigene JevBench zeigt aktuell: Jev 75.3, SemIF 75.1, DJev 74.3. Alle drei liegen unter einem Punkt auseinander — gerade deshalb ist die Rangliste nicht die Entscheidung. Es geht um Rollen: kalibriertes, gehostetes Original oder offene Weights für den eigenen Betrieb.

## Detaillierter Vergleich

| Faktor | Jev (TypeSafe AI) | SemIF & DJev (Open-Source-Nachbauten) | Gewinner |
|--------|------|------|--------|
| JevBench-Score | 75.3 — Spitze des ersten Benchmarks speziell für Entscheidungsmodelle, aus derselben Hand wie das Modell | SemIF 75.1, DJev 74.3 — alle Abstände unter einem Punkt, unterhalb der Auflösung der meisten eigenen Testsuiten | Jev (TypeSafe AI) |
| Latenz und Kosten | 70–500 ms pro Entscheidung; 42 $ pro 1M Input-Tokens, Output frei; kein eigener Inference-Betrieb nötig | läuft auf der eigenen Inference (4B/35B-Backbone); Kosten hängen von der eigenen Hardware ab, ohne Hosted-SLA | Jev (TypeSafe AI) |
| Kalibrierung | Ziel ist kalibrierte Wahrscheinlichkeit: eine 95-%-Antwort soll etwa 95 % richtig liegen — die Basis für automatische Schwellenwert-Entscheidungen | SemIF nutzt eine schlichte Drei-Klassen-NLI-Klassifikation auf dem letzten Token; die Confidence-Abstufung ist gröber | Jev (TypeSafe AI) |
| Offenheit und Betrieb | Hosted API, Start als Early Access; keine eigenen Weights | offene Checkpoints auf Hugging Face — SemIF als 4B- und 35B-Variante auf Qwen3.5-Backbone, DJev in derselben Klasse; reproduzierbar auf eigener Hardware | SemIF & DJev (Open-Source-Nachbauten) |
| Ökosystem und Adoption | schnellste Adoption in der Geschichte des Vercel AI Gateway: rund 13 % der Teams am ersten Tag; Playground und JevBench erscheinen aus derselben Hand | jüngere Linie, aber schnell: die Kev-Linie wuchs binnen Tagen von 0.5B auf 8B; Nachbauten sind meist direkt nach dem Original da | Jev (TypeSafe AI) |

## Wichtige Statistiken

- **75.3 · 75.1 · 74.3 — Jev, SemIF, DJev auf JevBench — eine Punktspanne über die ganze Klasse** — [JevBench-Meldungen, AI-Digest 19./20.09.2026](https://explainx.ai/blog/jev-playground-jevbench-launch-2026) (2026)
- **20–30 — Nachbauten der Jev-Linie in acht Tagen — allein sechs in den ersten zwei** — [Latent.Space AINews 17.–18.09.2026](https://www.latent.space/p/ainews-here-are-6-clones-of-jev-in) (2026)
- **≈13 % — der Teams nutzten Jev am ersten Tag über das Vercel AI Gateway — 2× GPT-5.6, 6× Fable 5.1** — [@vercel auf X, 18.09.2026](https://www.latent.space/p/ainews-here-are-6-clones-of-jev-in) (2026)
- **Cloudflare veröffentlichte Anfang Oktober 2026 Clef und Clef-flash (27B/9B, Qwen-Backbone, Apache 2.0) auf Workers AI — Jev-API-kompatibel und offen gewichtet; in Cloudflares selbst vermessener Tabelle schlägt Clef Jev auf acht von zehn Benchmark-Zeilen (z. B. API-Bank 93,11 vs 88,19; BANKING77 macro-F1 94,2 vs 79,74), Jev bleibt vorn bei When2Call und BRIGHT — alles herstellerberichtete Zahlen.** — [Cloudflare Blog — Introducing Clef (Okt 2026)](https://blog.cloudflare.com/clef-decision-models/) (2026)
- **Gemeldete Median-Latenzen: Clef-flash 38,8 ms und Clef 209,3 ms gegen 524,1 ms bei Jev (p95: 122,4 ms Clef-flash vs 536 ms Jev, 43 Evaluations); Clef bringt zusätzlich einen Vision-Encoder und ein 64k-Kontextfenster, Jev ist textuell bei 32k — als herstellerberichtet behandeln und selbst nachmessen.** — [Cloudflare Blog — Introducing Clef (Okt 2026)](https://blog.cloudflare.com/clef-decision-models/) (2026)

## Wählen Sie Jev (TypeSafe AI), wenn...

- Die kalibrierten Wahrscheinlichkeiten selbst sind Teil der Logik: Code entscheidet ab einem Schwellenwert, alles darunter geht an einen Menschen — ohne eigenen Inference-Betrieb.

## Wählen Sie SemIF & DJev (Open-Source-Nachbauten), wenn...

- Offene Weights auf eigener Hardware gebraucht werden: schmale Routing- oder Klassifikationsaufgaben auf einem bereits laufenden Qwen3.5-Backbone, mit reproduzierbaremCheckpoint statt Hosted API.

## Unsere Empfehlung

Die Rangliste entscheidet dieses Duell kaum — die Abstände liegen unter einem Punkt, und das ist weniger, als die meisten eigenen Testsuiten überhaupt auflösen. Die Achse ist die Rolle: Jev ist das kalibrierte Original mit Hosted API, SemIF und DJev sind die offenen Abbilder für den eigenen Betrieb.

Jev passt, wenn die Wahrscheinlichkeiten selbst die Logik tragen. Ziel der Kalibrierung ist, dass eine 95-%-Antwort auch 95 % richtig liegt — erst das macht Schwellenwert-Entscheidungen automatisch: Code handelt ab dem Wert, alles Darunter geht an einen Menschen. Mit 70–500 ms Antwortzeit, 42 $ pro 1M Input-Tokens und freiem Output ist dafür kein zweiter Infrastruktur-Layer nötig.

Ein Nachbau reicht, wenn die Aufgabe schmal und die Hardware schon da ist. SemIF stellt 4B und 35B als Qwen3.5-Backbone mit schlichter Drei-Klassen-NLI-Klassifikation; DJev liegt in derselben Klasse — wer Qwen3.5 im Stack hat, bekommt das Entscheidungsmodel als Nebenprodukt. Dafür bleibt die Confidence-Abstufung gröber und der Betrieb eigen.

Ein Hygiene-Hinweis zu den Zahlen: JevBench stammt aus derselben Hand wie das Modell, und die Preis-Fortschreibung von 400× auf 440× lief ohne erklärte Methodenänderung. Beide Zahlen sind brauchbar, aber nicht fertig — auf dem eigenen Task-Set nachmessen, dann wechseln.

Anfang Oktober wurde das Feld erneut weiter: Cloudflares Clef und Clef-flash (Apache 2.0, Jev-API-kompatibel, auf Workers AI gehostet) stiegen mit gemeldeten Latenzen von ~39–209 ms gegen ~524 ms bei Jev über Jev in den Jev Decision Index ein — die Klon-Welle hat die Infrastruktur-Ebene erreicht. Die Rollenlogik entscheidet weiter, aber jede herstellerübergreifende Zahl ist herstellerberichtet: auf dem eigenen Aufgabensatz nachmessen.

## Häufig gestellte Fragen

**Q: Was misst JevBench?**
A: Den ersten Benchmark, der speziell für Entscheidungsmodelle der System-One-Klasse gebaut wurde. Er stammt von TypeSafe selbst, deshalb ist Jevs Spitzenplatz erwartet, nicht überraschend — sinnvoll ist die Skala trotzdem, denn die Kategorie hatte zuvor keine eigene Auswertung. Aufgabenmix und Scoring-Rubric lagen zunächst nur als Headline-Zahlen vor.

**Q: Warum entscheiden die Punkte nicht?**
A: Weil der Abstand unter einem Punkt liegt — unterhalb dessen, was viele eigene Testsuiten überhaupt als Signal auflösen. Für die Wechselentscheidung zählt die Rolle: kalibriertes gehostetes Original oder offene Weights mit Selbstbetrieb.

**Q: Wann reicht der Nachbau?**
A: Wenn die Aufgabe schmal ist (Routing, Klassifikation, Booleans), der Qwen3.5-Backbone auf eigener Hardware schon läuft und eine gröbere Confidence-Abstufung für die eigene Logik genügt.

**Q: Wann das Original?**
A: Wenn die Kalibrierung selbst das Kriterium ist, kein eigener Inference-Betrieb läuft oder 70–500 ms Antwortzeit im Agent-Loop zählen. Hygiene-Detail: TypeSafe nannte „bis zu 400× günstiger“ zum Launch und „440×“ vier Tage später, ohne methodische Änderung — beide Zahlen auf dem eigenen Task-Set nachmessen.

**Q: Wo steht Cloudflare Clef in diesem Feld?**
A: Als Infrastruktur-Antwort auf die Klon-Welle: Jev-API-kompatibel, offen gewichtet (Apache 2.0), auf Workers AI gehostet und mit eigener RL-Fine-Tuning-Plattform. Die selbst vermessene Tabelle setzt Clef über Jev auf acht von zehn Zeilen — es sind aber herstellerberichtete Zahlen, also auf dem eigenen Aufgabensatz nachmessen, genau wie bei JevBench selbst.

