Banc d'évaluation maison ou scores de référence publiés : sur quoi fonder le choix de votre modèle ?
GPT-5.6 Sol a obtenu 7,8 % puis 38,3 % sur les mêmes tâches ARC-AGI-3. Seul le banc d'essai avait changé. Quand se fier aux classements, quand non.
Servez-vous des références publiées pour présélectionner, de votre propre banc d'évaluation pour trancher, et n'inversez jamais les deux rôles. Le différend ARC-AGI-3 de juillet 2026 en est la démonstration la plus nette à ce jour. La position d'OpenAI — une référence ne mesure jamais le seul modèle, mais aussi le dispositif technique qui l'entoure — est juste. La position d'ARC Prize — les scores officiels doivent reposer sur une approche standardisée, sans réglage propre à un fournisseur, pour que la comparaison reste honnête — est juste également. François Chollet a tracé la ligne qui résout réellement la contradiction : les bancs d'essai conçus pour résoudre la référence, ou qui intègrent une connaissance de son format, sont exclus ; les fonctions d'API généralistes ouvertes à toute la clientèle sont admises, à condition que les réglages et le coût soient publiés. Vous pouvez appliquer cette règle à vos propres mesures dès demain. Pour une décision d'achat, il en découle un ordre, pas un choix. Les classements éliminent vite et sans frais : un modèle absent du débat sur les références publiques de raisonnement ou de code ne sera sauvé par aucune chaîne d'exécution. Mais dès que deux ou trois candidats ne sont plus séparés que par quelques points, le chiffre publié cesse de discriminer et votre banc d'essai prend le relais. Un écart d'environ un facteur cinq obtenu avec deux réglages d'API dépasse presque tous les écarts entre modèles de pointe dans un classement : la décision sur la chaîne d'exécution l'emporte donc sur la décision sur le modèle, précisément au moment où les équipes cessent d'y penser. Les données d'ingénierie de Cursor pointent dans la même direction depuis un tout autre angle : la part des demandes de fusion intégrées écrites par des agents infonuagiques est passée d'environ une sur dix en décembre à plus de la moitié en juillet, et l'entreprise l'attribue à l'environnement — donner aux agents leurs propres machines et les laisser réparer leur installation — non à un meilleur modèle. Deux données indépendantes de 2026, une seule conclusion : ce qui a bougé, c'est le système autour du modèle. Un cas fait clairement pencher la balance vers les scores publiés, et il n'est pas technique. Si un chiffre doit survivre à un dossier de direction, à un marché public ou à un régulateur, un résultat interne autodéclaré ne tiendra pas. Si ARC Prize publie son financement, ses règles de déport pour le personnel détenant des parts dans un laboratoire testé et la composition d'un comité académique indépendant, c'est précisément pour cela. Votre banc d'essai n'a rien de tout cela, et il ne doit pas prétendre le contraire. Notre recommandation : présélectionnez en une après-midi sur les références publiques, puis consacrez deux semaines à monter un banc de 30 à 50 tâches réelles tirées de vos propres journaux, avec relevé des jetons et du coût par tâche et au moins un réglage de chaîne d'exécution commutable. Relancez-le à chaque changement de modèle et à chaque changement de boucle. Si votre budget ne couvre qu'une des deux options, construisez le banc — mais publiez les réglages et le coût à côté du score, exactement l'exigence que vous poseriez à un fournisseur.
Comparaison Détaillée
Une analyse comparative des facteurs clés pour vous aider à faire le bon choix.
| Facteur | Banc d'évaluation maisonRecommandé | Scores de référence publiés | Gagnant |
|---|---|---|---|
| Ce que le chiffre mesure réellement | Le modèle et votre chaîne d'exécution comme un seul système : vos consignes, votre gestion d'état, vos outils, votre politique de reprise. | Le modèle dans un dispositif neutre vis-à-vis des fournisseurs, qui exclut délibérément les fonctions d'API propres à un fournisseur. | |
| Comparabilité entre fournisseurs | Aussi équitable que votre propre enveloppe, pas davantage. OpenAI a utilisé des réglages propres à son modèle, ce qui rend justement ses 38,3 pour cent incomparables à une exécution standardisée. | C'est tout l'objet. ARC Prize fait passer chaque modèle par une approche standardisée, sans réglage propre à un fournisseur. | |
| Prédit ce que vous allez réellement livrer | Élevé. Sol est passé de 7,8 à 38,3 pour cent sur les mêmes tâches publiques sans aucune modification des poids, par la seule conservation du raisonnement et la condensation au lieu de la troncature. | Faible pour le travail agentique. Dans le banc officiel, le raisonnement est jeté après chaque action — ce n'est pas ainsi que l'on exploite un agent en production. | |
| Effort avant d'obtenir un chiffre exploitable | De quelques jours à quelques semaines : jeu de tâches, correcteurs, instrumentation des coûts, et quelqu'un pour tenir l'ensemble honnête à mesure que le code évolue. | Quelques minutes. Les classements sont publiés, datés et consultables gratuitement. | |
| Révèle le poids réel de votre boucle | Directement. Deux réglages de l'API Responses ont déplacé le score d'un modèle d'environ un facteur cinq tout en divisant par six les jetons produits. | Invisible par construction. Un banc standardisé fige la chaîne d'exécution : le plus grand levier de votre dispositif n'apparaît jamais dans le chiffre. | |
| Auditabilité et gestion des conflits d'intérêts | Ce que vous imposez vous-même, rien de plus. Les bancs internes sont rarement relus et se règlent facilement, consciemment ou non, en faveur du modèle déjà préféré. | Politique publiée. ARC Prize déclare son financement, impose le déport du personnel détenant des parts dans un laboratoire testé et soumet sa méthodologie à un comité académique indépendant. | |
| Reproductibilité par un tiers | Interne uniquement. Personne hors de l'équipe ne peut relancer l'essai, et une affirmation de fournisseur mesurée ainsi reste autodéclarée — les 38,3 pour cent n'ont fait l'objet d'aucune vérification indépendante sur jeu fermé. | Reproductible par l'organisme qui publie, sur un jeu de données et selon un rythme de publication annoncés à l'avance. | |
| Visibilité des coûts | Votre facture réelle sur vos tâches réelles, reprises comprises, ainsi que les jetons que votre boucle gaspille. Sol à 5 / 30 dollars le million et Opus 5 à 5 / 25 diffèrent bien moins que les volumes de jetons produits par deux bancs d'essai. | Publiée mais générique. Le classement ARC-AGI-3 met en regard le coût par tâche et le score, et ne retient que les systèmes dont l'exécution coûte moins de 10 000 dollars — un signal utile, pas votre facture. | |
| Pertinence pour votre charge de travail | Vous choisissez les tâches : le score parle donc de votre métier, de vos documents et de vos modes de défaillance. | Abstraite par construction. ARC-AGI-3 évalue l'adaptation en temps réel à des environnements interactifs inédits ; les testeurs humains obtiennent 48 pour cent en moyenne. | |
| Score Total | 4/ 9 | 4/ 9 | 1 égalités |
Statistiques Clés
Données réelles provenant de sources vérifiées du secteur pour appuyer votre décision.
MLQ.ai
THE DECODER
MLQ.ai
MLQ.ai
Cursor Engineering Blog
ARC Prize
OpenRouter Models API
Toutes les statistiques proviennent de sources tierces vérifiées. La source, l'année et le lien direct sont affichés pour chaque chiffre.
Quand Choisir Chaque Option
Un guide clair basé sur votre situation spécifique et vos besoins.
Choisissez Banc d'évaluation maison quand...
- Vous livrez un agent et non une interface de conversation : gestion d'état, condensation et reprises font partie de votre produit, et un score mesuré sans elles ne dit rien de vos temps de réponse ni de votre facture.
- Deux modèles candidats ne sont séparés que par quelques points dans les classements publics : à cette distance, le banc d'essai pèse plus lourd que le modèle.
- Votre domaine est étroit (gestion de sinistres, revue de contrats, outils internes) et aucune référence publique ne couvre le travail que vous faites réellement.
- Vous avez besoin d'un coût par tâche défendable pour un budget ou une proposition client, mesuré sur vos propres tâches et non sur celles d'un autre.
Choisissez Scores de référence publiés quand...
- Vous en êtes à la présélection et devez écarter les modèles manifestement inadaptés avant d'y consacrer du temps d'ingénierie.
- Vous avez besoin d'un chiffre tiers citable pour un dossier de direction, un marché public ou une déclaration réglementaire : un résultat interne autodéclaré ne résiste pas à cet examen.
- Vous suivez les progrès d'une génération à l'autre plutôt que de choisir le modèle à exploiter ce trimestre.
- Personne dans l'équipe n'est responsable de l'évaluation : un banc interne mal entretenu produit de plus mauvaises décisions qu'un classement publié.
Notre Recommandation
Servez-vous des références publiées pour présélectionner, de votre propre banc d'évaluation pour trancher, et n'inversez jamais les deux rôles. Le différend ARC-AGI-3 de juillet 2026 en est la démonstration la plus nette à ce jour. La position d'OpenAI — une référence ne mesure jamais le seul modèle, mais aussi le dispositif technique qui l'entoure — est juste. La position d'ARC Prize — les scores officiels doivent reposer sur une approche standardisée, sans réglage propre à un fournisseur, pour que la comparaison reste honnête — est juste également. François Chollet a tracé la ligne qui résout réellement la contradiction : les bancs d'essai conçus pour résoudre la référence, ou qui intègrent une connaissance de son format, sont exclus ; les fonctions d'API généralistes ouvertes à toute la clientèle sont admises, à condition que les réglages et le coût soient publiés. Vous pouvez appliquer cette règle à vos propres mesures dès demain. Pour une décision d'achat, il en découle un ordre, pas un choix. Les classements éliminent vite et sans frais : un modèle absent du débat sur les références publiques de raisonnement ou de code ne sera sauvé par aucune chaîne d'exécution. Mais dès que deux ou trois candidats ne sont plus séparés que par quelques points, le chiffre publié cesse de discriminer et votre banc d'essai prend le relais. Un écart d'environ un facteur cinq obtenu avec deux réglages d'API dépasse presque tous les écarts entre modèles de pointe dans un classement : la décision sur la chaîne d'exécution l'emporte donc sur la décision sur le modèle, précisément au moment où les équipes cessent d'y penser. Les données d'ingénierie de Cursor pointent dans la même direction depuis un tout autre angle : la part des demandes de fusion intégrées écrites par des agents infonuagiques est passée d'environ une sur dix en décembre à plus de la moitié en juillet, et l'entreprise l'attribue à l'environnement — donner aux agents leurs propres machines et les laisser réparer leur installation — non à un meilleur modèle. Deux données indépendantes de 2026, une seule conclusion : ce qui a bougé, c'est le système autour du modèle. Un cas fait clairement pencher la balance vers les scores publiés, et il n'est pas technique. Si un chiffre doit survivre à un dossier de direction, à un marché public ou à un régulateur, un résultat interne autodéclaré ne tiendra pas. Si ARC Prize publie son financement, ses règles de déport pour le personnel détenant des parts dans un laboratoire testé et la composition d'un comité académique indépendant, c'est précisément pour cela. Votre banc d'essai n'a rien de tout cela, et il ne doit pas prétendre le contraire. Notre recommandation : présélectionnez en une après-midi sur les références publiques, puis consacrez deux semaines à monter un banc de 30 à 50 tâches réelles tirées de vos propres journaux, avec relevé des jetons et du coût par tâche et au moins un réglage de chaîne d'exécution commutable. Relancez-le à chaque changement de modèle et à chaque changement de boucle. Si votre budget ne couvre qu'une des deux options, construisez le banc — mais publiez les réglages et le coût à côté du score, exactement l'exigence que vous poseriez à un fournisseur.
Questions Fréquentes
Réponses aux questions courantes sur cette comparaison.
Besoin d'aide pour décider ?
Réservez une consultation gratuite de 30 minutes et nous vous aiderons à déterminer la meilleure approche pour votre projet spécifique.