Entwicklungsansatz

Eigene Evaluationsumgebung vs. veröffentlichte Benchmark-Werte: Was soll über Ihr Modell entscheiden?

GPT-5.6 Sol erreichte 7,8 % und 38,3 % bei denselben ARC-AGI-3-Aufgaben. Geändert hat sich nur die Umgebung. Wann Ranglisten tragen — und wann nicht.

4
Eigene Evaluationsumgebung
vs
4
Veröffentlichte Benchmark-Werte
Schnellurteil

Nutzen Sie veröffentlichte Benchmarks für die Vorauswahl, entscheiden Sie mit Ihrer eigenen Evaluationsumgebung — und tauschen Sie die beiden Rollen niemals. Der ARC-AGI-3-Streit vom Juli 2026 ist der bislang sauberste Beleg dafür. Die Position von OpenAI — ein Benchmark messe nie nur das Modell, sondern immer auch den technischen Aufbau darum herum — ist richtig. Die Position von ARC Prize — offizielle Werte müssten einem standardisierten Verfahren ohne anbieterspezifische Einstellungen folgen, damit der Vergleich zwischen Anbietern ehrlich bleibt — ist ebenfalls richtig. François Chollet hat die Linie gezogen, die den Widerspruch tatsächlich auflöst: Umgebungen, die eigens zum Lösen des Benchmarks gebaut sind oder Wissen über dessen Format enthalten, sind unzulässig; allgemeine API-Funktionen, die jeder Kundschaft offenstehen, sind zulässig — sofern Einstellungen und Kosten ausgewiesen werden. Diese Regel können Sie ab morgen auf Ihre eigenen Messungen anwenden. Für eine Beschaffungsentscheidung folgt daraus eine Reihenfolge, keine Alternative. Ranglisten sortieren schnell und kostenlos aus: Wer bei öffentlichen Reasoning- oder Coding-Benchmarks nicht mitspielt, wird auch durch die beste Ablaufsteuerung nicht gerettet. Sobald aber zwei oder drei Kandidaten nur noch wenige Punkte trennen, hört die veröffentlichte Zahl auf zu unterscheiden — und Ihre eigene Umgebung fängt damit an. Ein Ausschlag um rund das Fünffache durch zwei API-Schalter ist größer als nahezu jeder Abstand zwischen Spitzenmodellen in einer Rangliste. Die Entscheidung über die Ablaufsteuerung dominiert also die Entscheidung über das Modell — genau in dem Moment, in dem Teams aufhören, darüber nachzudenken. Die Betriebsdaten von Cursor weisen aus einer völlig anderen Richtung in dieselbe Richtung: Der Anteil der zusammengeführten Pull Requests, die von Cloud-Agenten stammen, stieg von rund einem Zehntel im Dezember auf über die Hälfte im Juli. Das Unternehmen führt das ausdrücklich auf die Umgebung zurück — eigene Maschinen für die Agenten und die Möglichkeit, ihr Setup selbst zu reparieren — und nicht auf ein besseres Modell. Zwei unabhängige Datenpunkte aus 2026, ein Schluss: Bewegt hat sich das System um das Modell herum. Es gibt einen Fall, in dem veröffentlichte Werte klar gewinnen, und er ist nicht technischer Natur. Wenn eine Zahl eine Vorlage für die Geschäftsführung, ein Vergabeverfahren oder eine Aufsichtsbehörde überstehen muss, trägt ein selbst berichtetes internes Ergebnis nicht. ARC Prize legt Finanzierung, Befangenheitsregeln und ein unabhängiges akademisches Gremium genau deshalb offen. Ihre eigene Umgebung hat davon nichts — und sollte es auch nicht vorgeben. Unsere Empfehlung: Vorauswahl an einem Nachmittag anhand öffentlicher Benchmarks, danach zwei Wochen Aufbau einer Umgebung mit 30 bis 50 echten Aufgaben aus Ihren eigenen Protokollen, mit Token- und Kostenerfassung je Aufgabe und mindestens einem umschaltbaren Parameter der Ablaufsteuerung. Wiederholen Sie den Lauf bei jedem Modellwechsel und jeder Änderung an der Schleife. Reicht das Budget nur für eines von beiden, bauen Sie die Umgebung — weisen Sie aber Einstellungen und Kosten neben dem Wert aus, also genau den Maßstab, den Sie auch von einem Anbieter verlangen würden.

Detaillierter Vergleich

Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.

Faktor
Eigene EvaluationsumgebungEmpfohlen
Veröffentlichte Benchmark-WerteGewinner
Was die Zahl tatsächlich misst
Das Modell samt Ihrer Ablaufsteuerung als ein einziges System: Ihre Eingabetexte, Ihre Zustandsverwaltung, Ihre Werkzeuge, Ihre Wiederholungsregeln.
Das Modell in einem anbieterneutralen Aufbau, der anbieterspezifische API-Funktionen bewusst ausschließt.
Vergleichbarkeit über Anbieter hinweg
Nur so fair wie Ihre eigene Hülle. OpenAI nutzte modellspezifische Einstellungen — genau das macht die 38,3 Prozent mit einem standardisierten Lauf unvergleichbar.
Der eigentliche Zweck. ARC Prize schickt jedes Modell durch ein standardisiertes Verfahren ohne anbieterspezifische Einstellungen.
Sagt vorher, was Sie tatsächlich ausliefern
Hoch. Sol stieg bei denselben öffentlichen Aufgaben von 7,8 auf 38,3 Prozent, ohne jede Änderung an den Gewichten — allein durch erhaltene Denkspur und Verdichtung statt Abschneiden.
Gering bei agentischer Arbeit. In der offiziellen Umgebung wird die Denkspur nach jedem Handlungsschritt verworfen — so betreibt niemand einen Agenten im Produktivbetrieb.
Aufwand bis zur ersten brauchbaren Zahl
Tage bis Wochen: Aufgabensatz, Bewertungslogik, Kostenerfassung und jemand, der das Ganze ehrlich hält, während sich die Codebasis bewegt.
Minuten. Ranglisten sind veröffentlicht, datiert und frei einsehbar.
Macht sichtbar, wie stark Ihre Schleife wirkt
Unmittelbar. Zwei Einstellungen der Responses-API verschoben den Wert eines Modells um rund das Fünffache — und senkten gleichzeitig die Ausgabe-Tokens auf ein Sechstel.
Konstruktionsbedingt unsichtbar. Eine standardisierte Umgebung hält die Ablaufsteuerung fest, deshalb taucht der größte einzelne Hebel Ihres Aufbaus in der Zahl nie auf.
Prüfbarkeit und Umgang mit Interessenkonflikten
Nur so streng, wie Sie es selbst durchsetzen. Interne Umgebungen werden selten gegengelesen und lassen sich — bewusst oder unbewusst — auf das ohnehin bevorzugte Modell hin justieren.
Veröffentlichte Richtlinie. ARC Prize legt die Finanzierung offen, verlangt den Rückzug von Mitarbeitenden mit Beteiligungen an geprüften Laboren und lässt die Methodik von einem unabhängigen akademischen Gremium prüfen.
Nachvollziehbarkeit durch Dritte
Nur intern. Niemand außerhalb des Teams kann den Lauf wiederholen, und eine so gemessene Anbieteraussage bleibt selbst berichtet — die 38,3 Prozent wurden auf keinem geschlossenen Datensatz unabhängig bestätigt.
Vom Herausgeber wiederholbar, auf einem Datensatz und in einem vorab zugesagten Veröffentlichungsrhythmus.
Sichtbarkeit der Kosten
Ihre tatsächliche Rechnung für Ihre tatsächlichen Aufgaben, samt Wiederholungen und der Tokens, die Ihre Schleife verschwendet. Sol zu 5 / 30 Dollar je Million und Opus 5 zu 5 / 25 unterscheiden sich weit weniger als die Tokenmengen zweier Umgebungen.
Veröffentlicht, aber allgemein. Die ARC-AGI-3-Rangliste stellt Kosten je Aufgabe dar und führt nur Systeme unter 10.000 Dollar Laufkosten — ein nützliches Signal, aber nicht Ihre Rechnung.
Bezug zu Ihrer Arbeitslast
Sie wählen die Aufgaben, also misst der Wert Ihren Fachbereich, Ihre Dokumente und Ihre Fehlerbilder.
Konstruktionsbedingt abstrakt. ARC-AGI-3 prüft die Anpassung an neuartige interaktive Umgebungen im laufenden Betrieb; Testpersonen erreichen im Mittel 48 Prozent.
Gesamtpunktzahl4/ 94/ 91 unentschieden
Was die Zahl tatsächlich misst
Eigene Evaluationsumgebung
Das Modell samt Ihrer Ablaufsteuerung als ein einziges System: Ihre Eingabetexte, Ihre Zustandsverwaltung, Ihre Werkzeuge, Ihre Wiederholungsregeln.
Veröffentlichte Benchmark-Werte
Das Modell in einem anbieterneutralen Aufbau, der anbieterspezifische API-Funktionen bewusst ausschließt.
Vergleichbarkeit über Anbieter hinweg
Eigene Evaluationsumgebung
Nur so fair wie Ihre eigene Hülle. OpenAI nutzte modellspezifische Einstellungen — genau das macht die 38,3 Prozent mit einem standardisierten Lauf unvergleichbar.
Veröffentlichte Benchmark-Werte
Der eigentliche Zweck. ARC Prize schickt jedes Modell durch ein standardisiertes Verfahren ohne anbieterspezifische Einstellungen.
Sagt vorher, was Sie tatsächlich ausliefern
Eigene Evaluationsumgebung
Hoch. Sol stieg bei denselben öffentlichen Aufgaben von 7,8 auf 38,3 Prozent, ohne jede Änderung an den Gewichten — allein durch erhaltene Denkspur und Verdichtung statt Abschneiden.
Veröffentlichte Benchmark-Werte
Gering bei agentischer Arbeit. In der offiziellen Umgebung wird die Denkspur nach jedem Handlungsschritt verworfen — so betreibt niemand einen Agenten im Produktivbetrieb.
Aufwand bis zur ersten brauchbaren Zahl
Eigene Evaluationsumgebung
Tage bis Wochen: Aufgabensatz, Bewertungslogik, Kostenerfassung und jemand, der das Ganze ehrlich hält, während sich die Codebasis bewegt.
Veröffentlichte Benchmark-Werte
Minuten. Ranglisten sind veröffentlicht, datiert und frei einsehbar.
Macht sichtbar, wie stark Ihre Schleife wirkt
Eigene Evaluationsumgebung
Unmittelbar. Zwei Einstellungen der Responses-API verschoben den Wert eines Modells um rund das Fünffache — und senkten gleichzeitig die Ausgabe-Tokens auf ein Sechstel.
Veröffentlichte Benchmark-Werte
Konstruktionsbedingt unsichtbar. Eine standardisierte Umgebung hält die Ablaufsteuerung fest, deshalb taucht der größte einzelne Hebel Ihres Aufbaus in der Zahl nie auf.
Prüfbarkeit und Umgang mit Interessenkonflikten
Eigene Evaluationsumgebung
Nur so streng, wie Sie es selbst durchsetzen. Interne Umgebungen werden selten gegengelesen und lassen sich — bewusst oder unbewusst — auf das ohnehin bevorzugte Modell hin justieren.
Veröffentlichte Benchmark-Werte
Veröffentlichte Richtlinie. ARC Prize legt die Finanzierung offen, verlangt den Rückzug von Mitarbeitenden mit Beteiligungen an geprüften Laboren und lässt die Methodik von einem unabhängigen akademischen Gremium prüfen.
Nachvollziehbarkeit durch Dritte
Eigene Evaluationsumgebung
Nur intern. Niemand außerhalb des Teams kann den Lauf wiederholen, und eine so gemessene Anbieteraussage bleibt selbst berichtet — die 38,3 Prozent wurden auf keinem geschlossenen Datensatz unabhängig bestätigt.
Veröffentlichte Benchmark-Werte
Vom Herausgeber wiederholbar, auf einem Datensatz und in einem vorab zugesagten Veröffentlichungsrhythmus.
Sichtbarkeit der Kosten
Eigene Evaluationsumgebung
Ihre tatsächliche Rechnung für Ihre tatsächlichen Aufgaben, samt Wiederholungen und der Tokens, die Ihre Schleife verschwendet. Sol zu 5 / 30 Dollar je Million und Opus 5 zu 5 / 25 unterscheiden sich weit weniger als die Tokenmengen zweier Umgebungen.
Veröffentlichte Benchmark-Werte
Veröffentlicht, aber allgemein. Die ARC-AGI-3-Rangliste stellt Kosten je Aufgabe dar und führt nur Systeme unter 10.000 Dollar Laufkosten — ein nützliches Signal, aber nicht Ihre Rechnung.
Bezug zu Ihrer Arbeitslast
Eigene Evaluationsumgebung
Sie wählen die Aufgaben, also misst der Wert Ihren Fachbereich, Ihre Dokumente und Ihre Fehlerbilder.
Veröffentlichte Benchmark-Werte
Konstruktionsbedingt abstrakt. ARC-AGI-3 prüft die Anpassung an neuartige interaktive Umgebungen im laufenden Betrieb; Testpersonen erreichen im Mittel 48 Prozent.

Wichtige Statistiken

Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.

GPT-5.6 Sol erreichte im offiziellen Aufbau von ARC Prize 7,8 Prozent auf dem öffentlichen ARC-AGI-3-Aufgabensatz und über die Responses-API von OpenAI mit erhaltener Denkspur und Verdichtung 38,3 Prozent — identische Gewichte, andere Umgebung.

MLQ.ai

Claude Opus 5 erreichte auf demselben öffentlichen Aufgabensatz im standardisierten Aufbau 30,2 Prozent: vor den offiziellen 7,8 Prozent von Sol, hinter dessen selbst berichteten 38,3 Prozent.

THE DECODER

Erhaltene Denkspur und Verdichtung verdreifachten den Wert und senkten die Ausgabe-Tokens laut OpenAI auf ein Sechstel.

MLQ.ai

Testpersonen erreichen auf ARC-AGI-3 im Mittel 48 Prozent — beide Spitzenmodelle bleiben in jeder der beiden Umgebungen unter menschlicher Leistung.

MLQ.ai

Bei Cursor stammte im Dezember rund jeder zehnte zusammengeführte Pull Request von Cloud-Agenten, im Juli 2026 mehr als die Hälfte; das Unternehmen führt das auf die Umgebung zurück, nicht auf ein besseres Modell.

Cursor Engineering Blog

Die ARC-AGI-3-Rangliste stellt Kosten je Aufgabe dem erreichten Wert gegenüber und führt nur Systeme, deren Lauf unter 10.000 Dollar kostet.

ARC Prize

OpenRouter führt GPT-5.6 Sol mit 5 / 30 Dollar je Million Tokens und Claude Opus 5 mit 5 / 25 — wie viele dieser Tokens tatsächlich anfallen, entscheidet die Umgebung.

OpenRouter Models API

Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.

Wann Sie welche Option wählen sollten

Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.

Wählen Sie Eigene Evaluationsumgebung, wenn...

  • Sie liefern einen Agenten aus und keine Chatoberfläche: Zustandsverwaltung, Verdichtung und Wiederholungen sind Teil Ihres Produkts, und ein ohne sie gemessener Wert sagt weder etwas über Ihre Antwortzeiten noch über Ihre Rechnung.
  • Zwei Kandidatenmodelle liegen in öffentlichen Ranglisten nur wenige Punkte auseinander — auf dieser Distanz wirkt die Umgebung stärker als das Modell.
  • Ihr Fachbereich ist eng zugeschnitten (Schadenbearbeitung, Vertragsprüfung, interne Werkzeuge) und kein öffentlicher Benchmark deckt die Arbeit ab, die Sie tatsächlich leisten.
  • Sie brauchen belastbare Kosten je Aufgabe für ein Budget oder ein Kundenangebot, gemessen an Ihren eigenen Aufgaben statt an fremden.

Wählen Sie Veröffentlichte Benchmark-Werte, wenn...

  • Sie stehen am Anfang der Vorauswahl und wollen offensichtlich ungeeignete Modelle aussortieren, bevor Sie Entwicklungszeit investieren.
  • Sie brauchen eine zitierfähige Zahl aus dritter Hand für eine Geschäftsführungsvorlage, ein Vergabeverfahren oder eine aufsichtsrechtliche Meldung — selbst berichtete interne Werte halten dieser Prüfung nicht stand.
  • Sie verfolgen den Fortschritt über Modellgenerationen hinweg, statt zu entscheiden, welches Modell Sie dieses Quartal betreiben.
  • Im Team ist niemand für Evaluation zuständig: Eine ungepflegte interne Umgebung führt zu schlechteren Entscheidungen als eine veröffentlichte Rangliste.

Unsere Empfehlung

Nutzen Sie veröffentlichte Benchmarks für die Vorauswahl, entscheiden Sie mit Ihrer eigenen Evaluationsumgebung — und tauschen Sie die beiden Rollen niemals. Der ARC-AGI-3-Streit vom Juli 2026 ist der bislang sauberste Beleg dafür. Die Position von OpenAI — ein Benchmark messe nie nur das Modell, sondern immer auch den technischen Aufbau darum herum — ist richtig. Die Position von ARC Prize — offizielle Werte müssten einem standardisierten Verfahren ohne anbieterspezifische Einstellungen folgen, damit der Vergleich zwischen Anbietern ehrlich bleibt — ist ebenfalls richtig. François Chollet hat die Linie gezogen, die den Widerspruch tatsächlich auflöst: Umgebungen, die eigens zum Lösen des Benchmarks gebaut sind oder Wissen über dessen Format enthalten, sind unzulässig; allgemeine API-Funktionen, die jeder Kundschaft offenstehen, sind zulässig — sofern Einstellungen und Kosten ausgewiesen werden. Diese Regel können Sie ab morgen auf Ihre eigenen Messungen anwenden. Für eine Beschaffungsentscheidung folgt daraus eine Reihenfolge, keine Alternative. Ranglisten sortieren schnell und kostenlos aus: Wer bei öffentlichen Reasoning- oder Coding-Benchmarks nicht mitspielt, wird auch durch die beste Ablaufsteuerung nicht gerettet. Sobald aber zwei oder drei Kandidaten nur noch wenige Punkte trennen, hört die veröffentlichte Zahl auf zu unterscheiden — und Ihre eigene Umgebung fängt damit an. Ein Ausschlag um rund das Fünffache durch zwei API-Schalter ist größer als nahezu jeder Abstand zwischen Spitzenmodellen in einer Rangliste. Die Entscheidung über die Ablaufsteuerung dominiert also die Entscheidung über das Modell — genau in dem Moment, in dem Teams aufhören, darüber nachzudenken. Die Betriebsdaten von Cursor weisen aus einer völlig anderen Richtung in dieselbe Richtung: Der Anteil der zusammengeführten Pull Requests, die von Cloud-Agenten stammen, stieg von rund einem Zehntel im Dezember auf über die Hälfte im Juli. Das Unternehmen führt das ausdrücklich auf die Umgebung zurück — eigene Maschinen für die Agenten und die Möglichkeit, ihr Setup selbst zu reparieren — und nicht auf ein besseres Modell. Zwei unabhängige Datenpunkte aus 2026, ein Schluss: Bewegt hat sich das System um das Modell herum. Es gibt einen Fall, in dem veröffentlichte Werte klar gewinnen, und er ist nicht technischer Natur. Wenn eine Zahl eine Vorlage für die Geschäftsführung, ein Vergabeverfahren oder eine Aufsichtsbehörde überstehen muss, trägt ein selbst berichtetes internes Ergebnis nicht. ARC Prize legt Finanzierung, Befangenheitsregeln und ein unabhängiges akademisches Gremium genau deshalb offen. Ihre eigene Umgebung hat davon nichts — und sollte es auch nicht vorgeben. Unsere Empfehlung: Vorauswahl an einem Nachmittag anhand öffentlicher Benchmarks, danach zwei Wochen Aufbau einer Umgebung mit 30 bis 50 echten Aufgaben aus Ihren eigenen Protokollen, mit Token- und Kostenerfassung je Aufgabe und mindestens einem umschaltbaren Parameter der Ablaufsteuerung. Wiederholen Sie den Lauf bei jedem Modellwechsel und jeder Änderung an der Schleife. Reicht das Budget nur für eines von beiden, bauen Sie die Umgebung — weisen Sie aber Einstellungen und Kosten neben dem Wert aus, also genau den Maßstab, den Sie auch von einem Anbieter verlangen würden.

Häufig gestellte Fragen

Häufige Fragen zu diesem Vergleich beantwortet.

Nein. Sie messen etwas Bestimmtes und eng Umrissenes, und sie sagen das auch offen: das Modell in einem standardisierten Aufbau ohne anbieterspezifische Einstellungen, damit Zahlen verschiedener Anbieter in derselben Tabelle stehen können. François Chollet hat im Schlagabtausch vom Juli 2026 die brauchbare Linie gezogen: Umgebungen, die eigens zum Lösen eines Benchmarks gebaut sind oder Wissen über dessen Format enthalten, sind unzulässig; allgemeine API-Funktionen, die jeder Kundschaft offenstehen, sind zulässig, solange Einstellungen und Kosten klar ausgewiesen werden. Der Fehler liegt nicht darin, Ranglisten zu lesen — sondern darin, einen Ranglistenwert für eine Prognose Ihres Produktivbetriebs zu halten.
Stärker als der Abstand zwischen Spitzenmodellen. Auf dem öffentlichen ARC-AGI-3-Aufgabensatz lieferten dieselben Gewichte von GPT-5.6 Sol 7,8 Prozent in der offiziellen Umgebung und 38,3 Prozent über die Responses-API von OpenAI mit erhaltener Denkspur und Verdichtung — rund das Fünffache, und dabei mit einem Sechstel der Ausgabe-Tokens statt mit mehr. Zum Vergleich: Claude Opus 5 kommt auf demselben Satz offiziell auf 30,2 Prozent. Wenn Ihre Ablaufsteuerung die Denkspur zwischen den Schritten verwirft oder den Kontext bei vollem Fenster hart abschneidet, fahren Sie Ihr Modell mit angezogener Handbremse.
Beides, aber nacheinander — und die Reihenfolge zählt. Nutzen Sie öffentliche Benchmarks, um eine lange Liste an einem Nachmittag auf zwei oder drei Kandidaten zu kürzen; genau dafür taugen sie, und es kostet nichts. Entscheiden Sie zwischen den Verbliebenen dann mit Ihrer eigenen Umgebung, denn auf dieser Distanz unterscheiden die veröffentlichten Zahlen nicht mehr. Reicht das Geld nur für eines, nehmen Sie die eigene Umgebung: Sie ist die einzige der beiden, die misst, wofür Sie tatsächlich bezahlen.
Dreißig bis fünfzig echte Aufgaben aus Ihren eigenen Protokollen statt erfundener Fälle, eine Bewertung, der Sie trauen (in dieser Größenordnung genügt menschliche Durchsicht), eine Erfassung von Eingabe-Tokens, Ausgabe-Tokens und tatsächlichen Kosten je Aufgabe sowie mindestens ein umschaltbarer Parameter der Ablaufsteuerung — am stärksten wirkt das Bewahren des Zustands zwischen den Schritten. Wiederholen Sie den Lauf bei jedem Modellwechsel und jeder Änderung an der Schleife und halten Sie die Einstellungen neben dem Wert fest. Genau dieser letzte Schritt unterscheidet eine Messung von einer Anekdote — und es ist derselbe Maßstab, auf den der ARC-Prize-Streit am Ende hinauslief.

Brauchen Sie Hilfe bei der Entscheidung?

Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.

Kostenlose Beratung
Unverbindlich
Antwort innerhalb von 24h