Approche de Développement

Banc d'évaluation maison ou scores de référence publiés : sur quoi fonder le choix de votre modèle ?

GPT-5.6 Sol a obtenu 7,8 % puis 38,3 % sur les mêmes tâches ARC-AGI-3. Seul le banc d'essai avait changé. Quand se fier aux classements, quand non.

4
Banc d'évaluation maison
vs
4
Scores de référence publiés
Verdict Rapide

Servez-vous des références publiées pour présélectionner, de votre propre banc d'évaluation pour trancher, et n'inversez jamais les deux rôles. Le différend ARC-AGI-3 de juillet 2026 en est la démonstration la plus nette à ce jour. La position d'OpenAI — une référence ne mesure jamais le seul modèle, mais aussi le dispositif technique qui l'entoure — est juste. La position d'ARC Prize — les scores officiels doivent reposer sur une approche standardisée, sans réglage propre à un fournisseur, pour que la comparaison reste honnête — est juste également. François Chollet a tracé la ligne qui résout réellement la contradiction : les bancs d'essai conçus pour résoudre la référence, ou qui intègrent une connaissance de son format, sont exclus ; les fonctions d'API généralistes ouvertes à toute la clientèle sont admises, à condition que les réglages et le coût soient publiés. Vous pouvez appliquer cette règle à vos propres mesures dès demain. Pour une décision d'achat, il en découle un ordre, pas un choix. Les classements éliminent vite et sans frais : un modèle absent du débat sur les références publiques de raisonnement ou de code ne sera sauvé par aucune chaîne d'exécution. Mais dès que deux ou trois candidats ne sont plus séparés que par quelques points, le chiffre publié cesse de discriminer et votre banc d'essai prend le relais. Un écart d'environ un facteur cinq obtenu avec deux réglages d'API dépasse presque tous les écarts entre modèles de pointe dans un classement : la décision sur la chaîne d'exécution l'emporte donc sur la décision sur le modèle, précisément au moment où les équipes cessent d'y penser. Les données d'ingénierie de Cursor pointent dans la même direction depuis un tout autre angle : la part des demandes de fusion intégrées écrites par des agents infonuagiques est passée d'environ une sur dix en décembre à plus de la moitié en juillet, et l'entreprise l'attribue à l'environnement — donner aux agents leurs propres machines et les laisser réparer leur installation — non à un meilleur modèle. Deux données indépendantes de 2026, une seule conclusion : ce qui a bougé, c'est le système autour du modèle. Un cas fait clairement pencher la balance vers les scores publiés, et il n'est pas technique. Si un chiffre doit survivre à un dossier de direction, à un marché public ou à un régulateur, un résultat interne autodéclaré ne tiendra pas. Si ARC Prize publie son financement, ses règles de déport pour le personnel détenant des parts dans un laboratoire testé et la composition d'un comité académique indépendant, c'est précisément pour cela. Votre banc d'essai n'a rien de tout cela, et il ne doit pas prétendre le contraire. Notre recommandation : présélectionnez en une après-midi sur les références publiques, puis consacrez deux semaines à monter un banc de 30 à 50 tâches réelles tirées de vos propres journaux, avec relevé des jetons et du coût par tâche et au moins un réglage de chaîne d'exécution commutable. Relancez-le à chaque changement de modèle et à chaque changement de boucle. Si votre budget ne couvre qu'une des deux options, construisez le banc — mais publiez les réglages et le coût à côté du score, exactement l'exigence que vous poseriez à un fournisseur.

Comparaison Détaillée

Une analyse comparative des facteurs clés pour vous aider à faire le bon choix.

Facteur
Banc d'évaluation maisonRecommandé
Scores de référence publiésGagnant
Ce que le chiffre mesure réellement
Le modèle et votre chaîne d'exécution comme un seul système : vos consignes, votre gestion d'état, vos outils, votre politique de reprise.
Le modèle dans un dispositif neutre vis-à-vis des fournisseurs, qui exclut délibérément les fonctions d'API propres à un fournisseur.
Comparabilité entre fournisseurs
Aussi équitable que votre propre enveloppe, pas davantage. OpenAI a utilisé des réglages propres à son modèle, ce qui rend justement ses 38,3 pour cent incomparables à une exécution standardisée.
C'est tout l'objet. ARC Prize fait passer chaque modèle par une approche standardisée, sans réglage propre à un fournisseur.
Prédit ce que vous allez réellement livrer
Élevé. Sol est passé de 7,8 à 38,3 pour cent sur les mêmes tâches publiques sans aucune modification des poids, par la seule conservation du raisonnement et la condensation au lieu de la troncature.
Faible pour le travail agentique. Dans le banc officiel, le raisonnement est jeté après chaque action — ce n'est pas ainsi que l'on exploite un agent en production.
Effort avant d'obtenir un chiffre exploitable
De quelques jours à quelques semaines : jeu de tâches, correcteurs, instrumentation des coûts, et quelqu'un pour tenir l'ensemble honnête à mesure que le code évolue.
Quelques minutes. Les classements sont publiés, datés et consultables gratuitement.
Révèle le poids réel de votre boucle
Directement. Deux réglages de l'API Responses ont déplacé le score d'un modèle d'environ un facteur cinq tout en divisant par six les jetons produits.
Invisible par construction. Un banc standardisé fige la chaîne d'exécution : le plus grand levier de votre dispositif n'apparaît jamais dans le chiffre.
Auditabilité et gestion des conflits d'intérêts
Ce que vous imposez vous-même, rien de plus. Les bancs internes sont rarement relus et se règlent facilement, consciemment ou non, en faveur du modèle déjà préféré.
Politique publiée. ARC Prize déclare son financement, impose le déport du personnel détenant des parts dans un laboratoire testé et soumet sa méthodologie à un comité académique indépendant.
Reproductibilité par un tiers
Interne uniquement. Personne hors de l'équipe ne peut relancer l'essai, et une affirmation de fournisseur mesurée ainsi reste autodéclarée — les 38,3 pour cent n'ont fait l'objet d'aucune vérification indépendante sur jeu fermé.
Reproductible par l'organisme qui publie, sur un jeu de données et selon un rythme de publication annoncés à l'avance.
Visibilité des coûts
Votre facture réelle sur vos tâches réelles, reprises comprises, ainsi que les jetons que votre boucle gaspille. Sol à 5 / 30 dollars le million et Opus 5 à 5 / 25 diffèrent bien moins que les volumes de jetons produits par deux bancs d'essai.
Publiée mais générique. Le classement ARC-AGI-3 met en regard le coût par tâche et le score, et ne retient que les systèmes dont l'exécution coûte moins de 10 000 dollars — un signal utile, pas votre facture.
Pertinence pour votre charge de travail
Vous choisissez les tâches : le score parle donc de votre métier, de vos documents et de vos modes de défaillance.
Abstraite par construction. ARC-AGI-3 évalue l'adaptation en temps réel à des environnements interactifs inédits ; les testeurs humains obtiennent 48 pour cent en moyenne.
Score Total4/ 94/ 91 égalités
Ce que le chiffre mesure réellement
Banc d'évaluation maison
Le modèle et votre chaîne d'exécution comme un seul système : vos consignes, votre gestion d'état, vos outils, votre politique de reprise.
Scores de référence publiés
Le modèle dans un dispositif neutre vis-à-vis des fournisseurs, qui exclut délibérément les fonctions d'API propres à un fournisseur.
Comparabilité entre fournisseurs
Banc d'évaluation maison
Aussi équitable que votre propre enveloppe, pas davantage. OpenAI a utilisé des réglages propres à son modèle, ce qui rend justement ses 38,3 pour cent incomparables à une exécution standardisée.
Scores de référence publiés
C'est tout l'objet. ARC Prize fait passer chaque modèle par une approche standardisée, sans réglage propre à un fournisseur.
Prédit ce que vous allez réellement livrer
Banc d'évaluation maison
Élevé. Sol est passé de 7,8 à 38,3 pour cent sur les mêmes tâches publiques sans aucune modification des poids, par la seule conservation du raisonnement et la condensation au lieu de la troncature.
Scores de référence publiés
Faible pour le travail agentique. Dans le banc officiel, le raisonnement est jeté après chaque action — ce n'est pas ainsi que l'on exploite un agent en production.
Effort avant d'obtenir un chiffre exploitable
Banc d'évaluation maison
De quelques jours à quelques semaines : jeu de tâches, correcteurs, instrumentation des coûts, et quelqu'un pour tenir l'ensemble honnête à mesure que le code évolue.
Scores de référence publiés
Quelques minutes. Les classements sont publiés, datés et consultables gratuitement.
Révèle le poids réel de votre boucle
Banc d'évaluation maison
Directement. Deux réglages de l'API Responses ont déplacé le score d'un modèle d'environ un facteur cinq tout en divisant par six les jetons produits.
Scores de référence publiés
Invisible par construction. Un banc standardisé fige la chaîne d'exécution : le plus grand levier de votre dispositif n'apparaît jamais dans le chiffre.
Auditabilité et gestion des conflits d'intérêts
Banc d'évaluation maison
Ce que vous imposez vous-même, rien de plus. Les bancs internes sont rarement relus et se règlent facilement, consciemment ou non, en faveur du modèle déjà préféré.
Scores de référence publiés
Politique publiée. ARC Prize déclare son financement, impose le déport du personnel détenant des parts dans un laboratoire testé et soumet sa méthodologie à un comité académique indépendant.
Reproductibilité par un tiers
Banc d'évaluation maison
Interne uniquement. Personne hors de l'équipe ne peut relancer l'essai, et une affirmation de fournisseur mesurée ainsi reste autodéclarée — les 38,3 pour cent n'ont fait l'objet d'aucune vérification indépendante sur jeu fermé.
Scores de référence publiés
Reproductible par l'organisme qui publie, sur un jeu de données et selon un rythme de publication annoncés à l'avance.
Visibilité des coûts
Banc d'évaluation maison
Votre facture réelle sur vos tâches réelles, reprises comprises, ainsi que les jetons que votre boucle gaspille. Sol à 5 / 30 dollars le million et Opus 5 à 5 / 25 diffèrent bien moins que les volumes de jetons produits par deux bancs d'essai.
Scores de référence publiés
Publiée mais générique. Le classement ARC-AGI-3 met en regard le coût par tâche et le score, et ne retient que les systèmes dont l'exécution coûte moins de 10 000 dollars — un signal utile, pas votre facture.
Pertinence pour votre charge de travail
Banc d'évaluation maison
Vous choisissez les tâches : le score parle donc de votre métier, de vos documents et de vos modes de défaillance.
Scores de référence publiés
Abstraite par construction. ARC-AGI-3 évalue l'adaptation en temps réel à des environnements interactifs inédits ; les testeurs humains obtiennent 48 pour cent en moyenne.

Statistiques Clés

Données réelles provenant de sources vérifiées du secteur pour appuyer votre décision.

GPT-5.6 Sol a obtenu 7,8 pour cent sur le jeu public ARC-AGI-3 dans le banc officiel d'ARC Prize et 38,3 pour cent via l'API Responses d'OpenAI avec conservation du raisonnement et condensation — poids identiques, banc différent.

MLQ.ai

Claude Opus 5 a obtenu 30,2 pour cent sur le même jeu de tâches publiques dans le banc standardisé : devant les 7,8 pour cent officiels de Sol, derrière ses 38,3 pour cent autodéclarés.

THE DECODER

La conservation du raisonnement et la condensation ont triplé le score tout en divisant par six les jetons produits, selon OpenAI.

MLQ.ai

Les testeurs humains obtiennent 48 pour cent en moyenne sur ARC-AGI-3 : les deux modèles de pointe restent sous la performance humaine, quel que soit le banc d'essai.

MLQ.ai

Chez Cursor, environ une demande de fusion intégrée sur dix était écrite par des agents infonuagiques en décembre, contre plus de la moitié en juillet 2026 ; l'entreprise l'attribue à l'environnement, non à un meilleur modèle.

Cursor Engineering Blog

Le classement ARC-AGI-3 met en regard le coût par tâche et le score, et ne retient que les systèmes dont l'exécution coûte moins de 10 000 dollars.

ARC Prize

OpenRouter affiche GPT-5.6 Sol à 5 / 30 dollars le million de jetons et Claude Opus 5 à 5 / 25 — c'est le banc d'essai qui décide du nombre de jetons réellement dépensés.

OpenRouter Models API

Toutes les statistiques proviennent de sources tierces vérifiées. La source, l'année et le lien direct sont affichés pour chaque chiffre.

Quand Choisir Chaque Option

Un guide clair basé sur votre situation spécifique et vos besoins.

Choisissez Banc d'évaluation maison quand...

  • Vous livrez un agent et non une interface de conversation : gestion d'état, condensation et reprises font partie de votre produit, et un score mesuré sans elles ne dit rien de vos temps de réponse ni de votre facture.
  • Deux modèles candidats ne sont séparés que par quelques points dans les classements publics : à cette distance, le banc d'essai pèse plus lourd que le modèle.
  • Votre domaine est étroit (gestion de sinistres, revue de contrats, outils internes) et aucune référence publique ne couvre le travail que vous faites réellement.
  • Vous avez besoin d'un coût par tâche défendable pour un budget ou une proposition client, mesuré sur vos propres tâches et non sur celles d'un autre.

Choisissez Scores de référence publiés quand...

  • Vous en êtes à la présélection et devez écarter les modèles manifestement inadaptés avant d'y consacrer du temps d'ingénierie.
  • Vous avez besoin d'un chiffre tiers citable pour un dossier de direction, un marché public ou une déclaration réglementaire : un résultat interne autodéclaré ne résiste pas à cet examen.
  • Vous suivez les progrès d'une génération à l'autre plutôt que de choisir le modèle à exploiter ce trimestre.
  • Personne dans l'équipe n'est responsable de l'évaluation : un banc interne mal entretenu produit de plus mauvaises décisions qu'un classement publié.

Notre Recommandation

Servez-vous des références publiées pour présélectionner, de votre propre banc d'évaluation pour trancher, et n'inversez jamais les deux rôles. Le différend ARC-AGI-3 de juillet 2026 en est la démonstration la plus nette à ce jour. La position d'OpenAI — une référence ne mesure jamais le seul modèle, mais aussi le dispositif technique qui l'entoure — est juste. La position d'ARC Prize — les scores officiels doivent reposer sur une approche standardisée, sans réglage propre à un fournisseur, pour que la comparaison reste honnête — est juste également. François Chollet a tracé la ligne qui résout réellement la contradiction : les bancs d'essai conçus pour résoudre la référence, ou qui intègrent une connaissance de son format, sont exclus ; les fonctions d'API généralistes ouvertes à toute la clientèle sont admises, à condition que les réglages et le coût soient publiés. Vous pouvez appliquer cette règle à vos propres mesures dès demain. Pour une décision d'achat, il en découle un ordre, pas un choix. Les classements éliminent vite et sans frais : un modèle absent du débat sur les références publiques de raisonnement ou de code ne sera sauvé par aucune chaîne d'exécution. Mais dès que deux ou trois candidats ne sont plus séparés que par quelques points, le chiffre publié cesse de discriminer et votre banc d'essai prend le relais. Un écart d'environ un facteur cinq obtenu avec deux réglages d'API dépasse presque tous les écarts entre modèles de pointe dans un classement : la décision sur la chaîne d'exécution l'emporte donc sur la décision sur le modèle, précisément au moment où les équipes cessent d'y penser. Les données d'ingénierie de Cursor pointent dans la même direction depuis un tout autre angle : la part des demandes de fusion intégrées écrites par des agents infonuagiques est passée d'environ une sur dix en décembre à plus de la moitié en juillet, et l'entreprise l'attribue à l'environnement — donner aux agents leurs propres machines et les laisser réparer leur installation — non à un meilleur modèle. Deux données indépendantes de 2026, une seule conclusion : ce qui a bougé, c'est le système autour du modèle. Un cas fait clairement pencher la balance vers les scores publiés, et il n'est pas technique. Si un chiffre doit survivre à un dossier de direction, à un marché public ou à un régulateur, un résultat interne autodéclaré ne tiendra pas. Si ARC Prize publie son financement, ses règles de déport pour le personnel détenant des parts dans un laboratoire testé et la composition d'un comité académique indépendant, c'est précisément pour cela. Votre banc d'essai n'a rien de tout cela, et il ne doit pas prétendre le contraire. Notre recommandation : présélectionnez en une après-midi sur les références publiques, puis consacrez deux semaines à monter un banc de 30 à 50 tâches réelles tirées de vos propres journaux, avec relevé des jetons et du coût par tâche et au moins un réglage de chaîne d'exécution commutable. Relancez-le à chaque changement de modèle et à chaque changement de boucle. Si votre budget ne couvre qu'une des deux options, construisez le banc — mais publiez les réglages et le coût à côté du score, exactement l'exigence que vous poseriez à un fournisseur.

Questions Fréquentes

Réponses aux questions courantes sur cette comparaison.

Non. Ils mesurent quelque chose de précis et de délimité, et l'annoncent clairement : le modèle dans un dispositif standardisé, sans réglage propre à un fournisseur, afin que des chiffres issus de fournisseurs différents puissent figurer dans le même tableau. Lors de l'échange de juillet 2026, François Chollet a tracé la ligne utile : les bancs conçus pour résoudre une référence, ou qui intègrent une connaissance de son format, sont exclus ; les fonctions d'API généralistes ouvertes à toute la clientèle sont admises tant que les réglages et le coût sont clairement publiés. L'erreur n'est pas de lire les classements, mais de prendre un chiffre de classement pour une prévision de votre exploitation.
Davantage que l'écart entre modèles de pointe. Sur le jeu public ARC-AGI-3, les mêmes poids de GPT-5.6 Sol ont donné 7,8 pour cent dans le banc officiel et 38,3 pour cent via l'API Responses d'OpenAI avec conservation du raisonnement et condensation — environ un facteur cinq, et avec six fois moins de jetons produits, non davantage. À titre de comparaison, Claude Opus 5 obtient 30,2 pour cent sur ce même jeu selon la mesure officielle. Si votre chaîne d'exécution jette le raisonnement entre les étapes ou tronque brutalement le contexte quand la fenêtre se remplit, vous faites tourner votre modèle frein à main serré.
Les deux, mais l'un après l'autre, et l'ordre compte. Servez-vous des références publiques pour ramener une longue liste à deux ou trois candidats en une après-midi : c'est ce qu'elles font bien, et cela ne coûte rien. Tranchez ensuite entre les finalistes avec votre propre banc, car à cette distance les chiffres publiés ne discriminent plus. Si vous ne pouvez financer qu'une seule des deux démarches, financez le banc : c'est la seule qui mesure ce que vous payez réellement.
Trente à cinquante tâches réelles tirées de vos propres journaux plutôt que des cas inventés, une correction à laquelle vous faites confiance (à cette échelle, une relecture humaine suffit), un relevé par tâche des jetons d'entrée, des jetons de sortie et du coût réel, et au moins un réglage de chaîne d'exécution commutable — la conservation de l'état entre les étapes est celui qui déplace le plus les chiffres. Relancez-le à chaque changement de modèle et de boucle, et consignez les réglages à côté du score. C'est ce dernier point qui distingue une mesure d'une anecdote, et c'est exactement l'exigence à laquelle a abouti le différend ARC Prize.

Besoin d'aide pour décider ?

Réservez une consultation gratuite de 30 minutes et nous vous aiderons à déterminer la meilleure approche pour votre projet spécifique.

Consultation gratuite
Sans engagement
Réponse sous 24h