Eigene Evaluationsumgebung vs. veröffentlichte Benchmark-Werte: Was soll über Ihr Modell entscheiden?
GPT-5.6 Sol erreichte 7,8 % und 38,3 % bei denselben ARC-AGI-3-Aufgaben. Geändert hat sich nur die Umgebung. Wann Ranglisten tragen — und wann nicht.
Nutzen Sie veröffentlichte Benchmarks für die Vorauswahl, entscheiden Sie mit Ihrer eigenen Evaluationsumgebung — und tauschen Sie die beiden Rollen niemals. Der ARC-AGI-3-Streit vom Juli 2026 ist der bislang sauberste Beleg dafür. Die Position von OpenAI — ein Benchmark messe nie nur das Modell, sondern immer auch den technischen Aufbau darum herum — ist richtig. Die Position von ARC Prize — offizielle Werte müssten einem standardisierten Verfahren ohne anbieterspezifische Einstellungen folgen, damit der Vergleich zwischen Anbietern ehrlich bleibt — ist ebenfalls richtig. François Chollet hat die Linie gezogen, die den Widerspruch tatsächlich auflöst: Umgebungen, die eigens zum Lösen des Benchmarks gebaut sind oder Wissen über dessen Format enthalten, sind unzulässig; allgemeine API-Funktionen, die jeder Kundschaft offenstehen, sind zulässig — sofern Einstellungen und Kosten ausgewiesen werden. Diese Regel können Sie ab morgen auf Ihre eigenen Messungen anwenden. Für eine Beschaffungsentscheidung folgt daraus eine Reihenfolge, keine Alternative. Ranglisten sortieren schnell und kostenlos aus: Wer bei öffentlichen Reasoning- oder Coding-Benchmarks nicht mitspielt, wird auch durch die beste Ablaufsteuerung nicht gerettet. Sobald aber zwei oder drei Kandidaten nur noch wenige Punkte trennen, hört die veröffentlichte Zahl auf zu unterscheiden — und Ihre eigene Umgebung fängt damit an. Ein Ausschlag um rund das Fünffache durch zwei API-Schalter ist größer als nahezu jeder Abstand zwischen Spitzenmodellen in einer Rangliste. Die Entscheidung über die Ablaufsteuerung dominiert also die Entscheidung über das Modell — genau in dem Moment, in dem Teams aufhören, darüber nachzudenken. Die Betriebsdaten von Cursor weisen aus einer völlig anderen Richtung in dieselbe Richtung: Der Anteil der zusammengeführten Pull Requests, die von Cloud-Agenten stammen, stieg von rund einem Zehntel im Dezember auf über die Hälfte im Juli. Das Unternehmen führt das ausdrücklich auf die Umgebung zurück — eigene Maschinen für die Agenten und die Möglichkeit, ihr Setup selbst zu reparieren — und nicht auf ein besseres Modell. Zwei unabhängige Datenpunkte aus 2026, ein Schluss: Bewegt hat sich das System um das Modell herum. Es gibt einen Fall, in dem veröffentlichte Werte klar gewinnen, und er ist nicht technischer Natur. Wenn eine Zahl eine Vorlage für die Geschäftsführung, ein Vergabeverfahren oder eine Aufsichtsbehörde überstehen muss, trägt ein selbst berichtetes internes Ergebnis nicht. ARC Prize legt Finanzierung, Befangenheitsregeln und ein unabhängiges akademisches Gremium genau deshalb offen. Ihre eigene Umgebung hat davon nichts — und sollte es auch nicht vorgeben. Unsere Empfehlung: Vorauswahl an einem Nachmittag anhand öffentlicher Benchmarks, danach zwei Wochen Aufbau einer Umgebung mit 30 bis 50 echten Aufgaben aus Ihren eigenen Protokollen, mit Token- und Kostenerfassung je Aufgabe und mindestens einem umschaltbaren Parameter der Ablaufsteuerung. Wiederholen Sie den Lauf bei jedem Modellwechsel und jeder Änderung an der Schleife. Reicht das Budget nur für eines von beiden, bauen Sie die Umgebung — weisen Sie aber Einstellungen und Kosten neben dem Wert aus, also genau den Maßstab, den Sie auch von einem Anbieter verlangen würden.
Detaillierter Vergleich
Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.
| Faktor | Eigene EvaluationsumgebungEmpfohlen | Veröffentlichte Benchmark-Werte | Gewinner |
|---|---|---|---|
| Was die Zahl tatsächlich misst | Das Modell samt Ihrer Ablaufsteuerung als ein einziges System: Ihre Eingabetexte, Ihre Zustandsverwaltung, Ihre Werkzeuge, Ihre Wiederholungsregeln. | Das Modell in einem anbieterneutralen Aufbau, der anbieterspezifische API-Funktionen bewusst ausschließt. | |
| Vergleichbarkeit über Anbieter hinweg | Nur so fair wie Ihre eigene Hülle. OpenAI nutzte modellspezifische Einstellungen — genau das macht die 38,3 Prozent mit einem standardisierten Lauf unvergleichbar. | Der eigentliche Zweck. ARC Prize schickt jedes Modell durch ein standardisiertes Verfahren ohne anbieterspezifische Einstellungen. | |
| Sagt vorher, was Sie tatsächlich ausliefern | Hoch. Sol stieg bei denselben öffentlichen Aufgaben von 7,8 auf 38,3 Prozent, ohne jede Änderung an den Gewichten — allein durch erhaltene Denkspur und Verdichtung statt Abschneiden. | Gering bei agentischer Arbeit. In der offiziellen Umgebung wird die Denkspur nach jedem Handlungsschritt verworfen — so betreibt niemand einen Agenten im Produktivbetrieb. | |
| Aufwand bis zur ersten brauchbaren Zahl | Tage bis Wochen: Aufgabensatz, Bewertungslogik, Kostenerfassung und jemand, der das Ganze ehrlich hält, während sich die Codebasis bewegt. | Minuten. Ranglisten sind veröffentlicht, datiert und frei einsehbar. | |
| Macht sichtbar, wie stark Ihre Schleife wirkt | Unmittelbar. Zwei Einstellungen der Responses-API verschoben den Wert eines Modells um rund das Fünffache — und senkten gleichzeitig die Ausgabe-Tokens auf ein Sechstel. | Konstruktionsbedingt unsichtbar. Eine standardisierte Umgebung hält die Ablaufsteuerung fest, deshalb taucht der größte einzelne Hebel Ihres Aufbaus in der Zahl nie auf. | |
| Prüfbarkeit und Umgang mit Interessenkonflikten | Nur so streng, wie Sie es selbst durchsetzen. Interne Umgebungen werden selten gegengelesen und lassen sich — bewusst oder unbewusst — auf das ohnehin bevorzugte Modell hin justieren. | Veröffentlichte Richtlinie. ARC Prize legt die Finanzierung offen, verlangt den Rückzug von Mitarbeitenden mit Beteiligungen an geprüften Laboren und lässt die Methodik von einem unabhängigen akademischen Gremium prüfen. | |
| Nachvollziehbarkeit durch Dritte | Nur intern. Niemand außerhalb des Teams kann den Lauf wiederholen, und eine so gemessene Anbieteraussage bleibt selbst berichtet — die 38,3 Prozent wurden auf keinem geschlossenen Datensatz unabhängig bestätigt. | Vom Herausgeber wiederholbar, auf einem Datensatz und in einem vorab zugesagten Veröffentlichungsrhythmus. | |
| Sichtbarkeit der Kosten | Ihre tatsächliche Rechnung für Ihre tatsächlichen Aufgaben, samt Wiederholungen und der Tokens, die Ihre Schleife verschwendet. Sol zu 5 / 30 Dollar je Million und Opus 5 zu 5 / 25 unterscheiden sich weit weniger als die Tokenmengen zweier Umgebungen. | Veröffentlicht, aber allgemein. Die ARC-AGI-3-Rangliste stellt Kosten je Aufgabe dar und führt nur Systeme unter 10.000 Dollar Laufkosten — ein nützliches Signal, aber nicht Ihre Rechnung. | |
| Bezug zu Ihrer Arbeitslast | Sie wählen die Aufgaben, also misst der Wert Ihren Fachbereich, Ihre Dokumente und Ihre Fehlerbilder. | Konstruktionsbedingt abstrakt. ARC-AGI-3 prüft die Anpassung an neuartige interaktive Umgebungen im laufenden Betrieb; Testpersonen erreichen im Mittel 48 Prozent. | |
| Gesamtpunktzahl | 4/ 9 | 4/ 9 | 1 unentschieden |
Wichtige Statistiken
Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.
MLQ.ai
THE DECODER
MLQ.ai
MLQ.ai
Cursor Engineering Blog
ARC Prize
OpenRouter Models API
Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.
Wann Sie welche Option wählen sollten
Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.
Wählen Sie Eigene Evaluationsumgebung, wenn...
- Sie liefern einen Agenten aus und keine Chatoberfläche: Zustandsverwaltung, Verdichtung und Wiederholungen sind Teil Ihres Produkts, und ein ohne sie gemessener Wert sagt weder etwas über Ihre Antwortzeiten noch über Ihre Rechnung.
- Zwei Kandidatenmodelle liegen in öffentlichen Ranglisten nur wenige Punkte auseinander — auf dieser Distanz wirkt die Umgebung stärker als das Modell.
- Ihr Fachbereich ist eng zugeschnitten (Schadenbearbeitung, Vertragsprüfung, interne Werkzeuge) und kein öffentlicher Benchmark deckt die Arbeit ab, die Sie tatsächlich leisten.
- Sie brauchen belastbare Kosten je Aufgabe für ein Budget oder ein Kundenangebot, gemessen an Ihren eigenen Aufgaben statt an fremden.
Wählen Sie Veröffentlichte Benchmark-Werte, wenn...
- Sie stehen am Anfang der Vorauswahl und wollen offensichtlich ungeeignete Modelle aussortieren, bevor Sie Entwicklungszeit investieren.
- Sie brauchen eine zitierfähige Zahl aus dritter Hand für eine Geschäftsführungsvorlage, ein Vergabeverfahren oder eine aufsichtsrechtliche Meldung — selbst berichtete interne Werte halten dieser Prüfung nicht stand.
- Sie verfolgen den Fortschritt über Modellgenerationen hinweg, statt zu entscheiden, welches Modell Sie dieses Quartal betreiben.
- Im Team ist niemand für Evaluation zuständig: Eine ungepflegte interne Umgebung führt zu schlechteren Entscheidungen als eine veröffentlichte Rangliste.
Unsere Empfehlung
Nutzen Sie veröffentlichte Benchmarks für die Vorauswahl, entscheiden Sie mit Ihrer eigenen Evaluationsumgebung — und tauschen Sie die beiden Rollen niemals. Der ARC-AGI-3-Streit vom Juli 2026 ist der bislang sauberste Beleg dafür. Die Position von OpenAI — ein Benchmark messe nie nur das Modell, sondern immer auch den technischen Aufbau darum herum — ist richtig. Die Position von ARC Prize — offizielle Werte müssten einem standardisierten Verfahren ohne anbieterspezifische Einstellungen folgen, damit der Vergleich zwischen Anbietern ehrlich bleibt — ist ebenfalls richtig. François Chollet hat die Linie gezogen, die den Widerspruch tatsächlich auflöst: Umgebungen, die eigens zum Lösen des Benchmarks gebaut sind oder Wissen über dessen Format enthalten, sind unzulässig; allgemeine API-Funktionen, die jeder Kundschaft offenstehen, sind zulässig — sofern Einstellungen und Kosten ausgewiesen werden. Diese Regel können Sie ab morgen auf Ihre eigenen Messungen anwenden. Für eine Beschaffungsentscheidung folgt daraus eine Reihenfolge, keine Alternative. Ranglisten sortieren schnell und kostenlos aus: Wer bei öffentlichen Reasoning- oder Coding-Benchmarks nicht mitspielt, wird auch durch die beste Ablaufsteuerung nicht gerettet. Sobald aber zwei oder drei Kandidaten nur noch wenige Punkte trennen, hört die veröffentlichte Zahl auf zu unterscheiden — und Ihre eigene Umgebung fängt damit an. Ein Ausschlag um rund das Fünffache durch zwei API-Schalter ist größer als nahezu jeder Abstand zwischen Spitzenmodellen in einer Rangliste. Die Entscheidung über die Ablaufsteuerung dominiert also die Entscheidung über das Modell — genau in dem Moment, in dem Teams aufhören, darüber nachzudenken. Die Betriebsdaten von Cursor weisen aus einer völlig anderen Richtung in dieselbe Richtung: Der Anteil der zusammengeführten Pull Requests, die von Cloud-Agenten stammen, stieg von rund einem Zehntel im Dezember auf über die Hälfte im Juli. Das Unternehmen führt das ausdrücklich auf die Umgebung zurück — eigene Maschinen für die Agenten und die Möglichkeit, ihr Setup selbst zu reparieren — und nicht auf ein besseres Modell. Zwei unabhängige Datenpunkte aus 2026, ein Schluss: Bewegt hat sich das System um das Modell herum. Es gibt einen Fall, in dem veröffentlichte Werte klar gewinnen, und er ist nicht technischer Natur. Wenn eine Zahl eine Vorlage für die Geschäftsführung, ein Vergabeverfahren oder eine Aufsichtsbehörde überstehen muss, trägt ein selbst berichtetes internes Ergebnis nicht. ARC Prize legt Finanzierung, Befangenheitsregeln und ein unabhängiges akademisches Gremium genau deshalb offen. Ihre eigene Umgebung hat davon nichts — und sollte es auch nicht vorgeben. Unsere Empfehlung: Vorauswahl an einem Nachmittag anhand öffentlicher Benchmarks, danach zwei Wochen Aufbau einer Umgebung mit 30 bis 50 echten Aufgaben aus Ihren eigenen Protokollen, mit Token- und Kostenerfassung je Aufgabe und mindestens einem umschaltbaren Parameter der Ablaufsteuerung. Wiederholen Sie den Lauf bei jedem Modellwechsel und jeder Änderung an der Schleife. Reicht das Budget nur für eines von beiden, bauen Sie die Umgebung — weisen Sie aber Einstellungen und Kosten neben dem Wert aus, also genau den Maßstab, den Sie auch von einem Anbieter verlangen würden.
Häufig gestellte Fragen
Häufige Fragen zu diesem Vergleich beantwortet.
Brauchen Sie Hilfe bei der Entscheidung?
Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.