Claude Fable 5.1 : mêmes prix, moins de tokens — ce que ce lancement signifie pour les coûts des agents

Claude Fable 5.1 conserve la même grille tarifaire que son prédécesseur, mais bouleverse la facture finale. Avec des lectures en cache réduites de 75 % et une baisse de 25 à 50 % de la consommation de tokens par tâche, découvrez comment optimiser les coûts de vos agents IA et réalisez votre propre audit.

Claude Fable 5.1 : mêmes prix, moins de tokens — ce que ce lancement signifie pour les coûts des agents

TL;DR : Claude Fable 5.1 coûte exactement le même prix que Fable 5 : 10 dollars par million de tokens en entrée (input), 50 par million en sortie (output). L'étiquette de prix est restée la même — mais pas la facture. Le coût des lectures en cache (Cache-Reads) chute de 1 à 0,25 dollar par million de tokens, la fenêtre de contexte s'élargit à 1 million de tokens, et Anthropic chiffre la baisse de la consommation de tokens par tâche entre 25 et 50 %. Pour tous ceux qui font tourner des agents, la question des coûts passe donc de « quel modèle ? » à « combien de tokens par tâche ? ». Cet article détaille ce que cela implique, calculs à l'appui — et fournit un audit de coût par tâche (Cost-per-Task) prêt à être copié pour votre propre stack.

Ce qui a vraiment été déployé

Début septembre, Anthropic a activé Claude Fable 5.1 — pas de nouveau prix, pas de nouveau modèle de tarification, mais un successeur avec la même grille tarifaire et un comportement différent. Voici les changements qui comptent pour la mise en production :

ParamètreFable 5Fable 5.1
Input par M de tokens10 USD10 USD (inchangé)
Output par M de tokens50 USD50 USD (inchangé)
Cache-Reads par M de tokens1 USD0,25 USD (−75 %)
Fenêtre de contexte< 1 M de tokens1 M de tokens
Consommation de tokens par tâcheRéférence−25 à −50 % (donnée Anthropic)

Le premier regard se tourne toujours vers les benchmarks : sur Terminal-Bench 4.0, il atteint 55,8 % contre 42 % pour Fable 5 et 52,3 % pour Opus 5 ; sur le Research-Benchmark, 52,6 % contre 24,7 %. Sur CursorBench 3.2, avec un niveau d'effort « Max », Cursor qualifie Fable 5.1 de « modèle le plus performant que nous ayons jamais testé » (73,4 %). Artificial Analysis place Fable 5.1 à 61 points dans son Intelligence Index — cinq points devant GPT-6 Astra et GPT-5.6 Sol.

Cependant, pour votre facture mensuelle, c'est le mauvais chiffre au mauvais endroit. La ligne pertinente ne figure dans aucun tableau de benchmark : moins de tokens par tâche accomplie à un tarif inchangé.

Même grille tarifaire, calcul différent

Dans l'exploitation d'agents, les coûts découlent de la multiplication de deux variables : le tarif par token et la quantité de tokens consommée par une tâche. Jusqu'à présent, la réduction des coûts passait presque toujours par la première variable : choisir un modèle plus petit, un tarif moins cher, au détriment de la qualité. Fable 5.1 s'attaque à la seconde variable.

Concrètement : si une tâche qui coûtait 80 000 tokens en sortie et 400 000 tokens en entrée sous Fable 5 n'en nécessite plus que 55 000 et 280 000 sous 5.1, la facture passe de 8 à environ 5,50 dollars — soit une baisse d'environ un tiers — sans que vous n'ayez souscrit à un modèle moins cher, raccourci vos prompts ou sacrifié la qualité. Anthropic annonce une fourchette de 25 à 50 % d'économie, selon la charge de travail (workload). C'est une déclaration du fabricant, pas une mesure universelle — mais la mécanique sous-jacente est vérifiable, et ce, directement dans vos propres logs.

La deuxième variable de coût est le Prompt Cache. Les exécutions (runs) d'agents sont des machines à lire : le prompt système, le contexte du repo et les descriptions d'outils (tools) repassent par la fenêtre à chaque étape. Avec Fable 5, la relecture de ces blocs coûtait 1 dollar par million de tokens. Sur un run de 30 étapes avec 150 000 tokens relus à chaque étape, ces seules requêtes répétées s'élevaient à 4,50 dollars par tâche. À 0,25 dollar, cela ne coûte plus que 1,13 dollar. Les premiers tests sur des workloads orientés agents font état de coûts totaux réduits jusqu'à 45 % — non pas parce que le modèle calcule moins, mais parce qu'il ingère les mêmes connaissances pour beaucoup moins cher.

Le levier que presque personne n'utilise : les niveaux d'effort (Effort-Levels)

Anthropic livre Fable 5.1 avec des niveaux d'effort (Effort-Stufen) — allant de Low (Faible), Medium (Moyen) et High (Élevé) jusqu'à X-High et Max, plus un mode Ultra pour le code. Le standard est High. Et c'est précisément là que se cache l'argent : la documentation d'Anthropic montre que Fable 5.1 en Low équivaut à peu près à Fable 5 en Medium ou High — pour une consommation de tokens nettement inférieure par tâche accomplie. Les praticiens comparent déjà le 5.1 en mode Low au niveau de réflexion des anciens modèles premium.

Trois détails issus de la documentation officielle sur le prompting sont décisifs pour la facture :

  • Un objectif plutôt que des tâches : Fable 5.1 travaille plus proprement si vous définissez l'objectif et la condition d'arrêt plutôt qu'une liste d'étapes. Moins de malentendus signifie moins de répétitions, donc moins de tokens.
  • L'effort est modifiable par message — et le Prompt Cache est conservé. Vous pouvez lancer les tours de recherche en High, puis les tours de résumé en Low, sans perdre le cache. Sur d'autres modèles, un changement d'effort vide le cache.
  • Low signifie aussi : moins d'appels d'outils (Tool-Calls). Avec un effort faible, 5.1 appelle moins souvent les outils de recherche et de récupération (retrieval) et répond davantage à partir de son contexte. C'est idéal pour le brainstorming et la structuration, mais inadapté pour la recherche de faits précis.

Si vous laissez tout tourner en High, vous payez pour un effort de réflexion que la tâche n'a jamais exigé. À tarif égal, c'est le poste de dépense le plus important sur lequel vous avez un contrôle direct.

Ce que recommande Anthropic — et ce que ça coûte

La documentation de prompting pour Fable 5.1 se lit comme un guide de réduction des coûts. Anthropic trace quatre lignes directrices, avec leur impact financier :

  1. Faire le ménage dans les anciens skills. Les compétences (skills) et prompts issus de la génération de modèles précédente sont « souvent trop prescriptifs » pour Fable 5/5.1. Trop d'instructions brident le modèle et génèrent des détours plutôt que de l'efficacité. Peter Yang recommande de lancer un audit de prompts sur tous les skills après la migration et de supprimer les redondances.
  2. Faire prouver le travail. La doc suggère explicitement de laisser le modèle vérifier sa propre sortie par rapport aux spécifications — via des sous-agents vérificateurs (Verifier) et un audit par affirmation. Cela coûte des tokens au départ, mais permet d'économiser le type de token le plus cher : la retouche due à de mauvais premiers jets.
  3. Paralléliser et déléguer. Fable 5.1 distribue de manière fiable les sous-agents parallèles et regroupe les appels d'outils indépendants. Anthropic le souligne : les sous-agents parallèles font gagner du temps et réduisent les coûts via les Cache-Reads, car le contexte partagé est réutilisé à moindre coût au lieu d'être refacturé à chaque séquence.
  4. Des tâches longues sans dictat méthodologique. Avec un objectif clair, 5.1 peut travailler sur de longues durées sans guidage méthodologique. Chaque « fais d'abord A, puis B » superflu est une instruction que le modèle construira de toute façon lui-même, et ce sont des tokens que vous payez.

La démonstration la plus radicale de cette architecture vient du terrain : Teknium a laissé l'agent Hermes tourner avec un seul objectif en utilisant 1 320 sous-agents récursifs pendant environ 15 heures — 375 000 lignes de code supprimées d'un repo, sur un simple ordinateur de bureau, avec la mention : « le modèle, c'est Fable 5.1 au fait ». Ce n'est pas un exemple de coût, mais une preuve d'architecture : l'orchestrateur conserve le contexte, les travailleurs (workers) le récupèrent à bas prix depuis le cache.

Premiers chiffres indépendants — et leurs limites

Outre Cursor, WorldofAI rapporte ses propres tests sur Fable 5.1 (Terminal-Bench, Research-Bench), et Artificial Analysis confirme sa position au sommet de l'Intelligence Index. Trois points à garder à l'esprit lors de vos calculs :

  • Score de benchmark ≠ votre prix par tâche accomplie. Artificial Analysis place Astra devant Fable 5 sur la courbe de coût des agents de codage — même résultat, mais pour la moitié du prix. Acheter en se basant sur un classement, c'est ignorer la réalité de sa propre stack.
  • L'environnement de test (harness) fait partie du chiffre. L'énigme d'Astra, passant de 62,7 % à 99,9 % sur ARC-AGI-3 selon l'adaptateur utilisé, a prouvé une fois de plus (une semaine après le lancement de 5.1) que ce qu'un modèle « sait faire » dépend de la façon dont le runner traite le contexte et l'état de raisonnement (reasoning-state). La même règle s'applique à vos budgets de tokens.
  • Les 25 à 50 % sont une affirmation. Elle est plausible et vérifiable — mais elle doit être vérifiée sur vos propres exécutions. C'est précisément l'objet de la section suivante.

Contexte du marché : deux navires amiraux, un seul tarif

Quatre jours après Fable 5.1, GPT-6 Astra a débarqué — au prix de 10/50, en copiant ouvertement la grille tarifaire de Fable. C'est la première fois qu'une parité de prix s'installe au sommet entre les deux principaux laboratoires. La vieille règle empirique du « modèle plus petit = économies » meurt dans le segment premium : si deux modèles phares coûtent le même prix par token, le choix du modèle n'est plus une décision financière. La décision financière réside désormais dans le nombre de tokens consommé par une tâche — ce qui relève à la fois du comportement du modèle et de votre configuration (setup).

Prêt à copier : votre audit de coût par tâche (Cost-per-Task)

La seule preuve qui compte provient de vos logs. Au lieu de croire les benchmarks, mesurez les tokens. Voici deux blocs de construction.

Premièrement : comptabiliser les champs d'usage (usage) par appel et les convertir en dollars — avec les prix de Fable :

import json

PRICES = {"input": 10/1e6, "output": 50/1e6, "cache_read": 0.25/1e6}

def task_cost_usd(usages):
    """usages : Liste des objets response.usage d'une tâche."""
    return sum(
        u["input_tokens"] * PRICES["input"]
        + u["output_tokens"] * PRICES["output"]
        + u.get("cache_read_input_tokens", 0) * PRICES["cache_read"]
        for u in usages
    )

Deuxièmement : l'audit lui-même — sous forme de mission confiée à un agent de codage, à réaliser chaque trimestre ou après le lancement de chaque modèle majeur :

Audit de modèle, étape par étape :
1. Lister chaque appel IA automatique : agents, tâches cron, hooks, valeurs par défaut.
2. Par appel : Modèle, niveau d'effort, prix par M de tokens selon la liste du jour,
   volume mensuel et coût par tâche tiré du log d'usage (valeur 'Avant' !).
3. Marquer d'un '?' les cas où le modèle et l'effort n'ont jamais été choisis consciemment.
4. Pour chaque entrée avec un '?' : tester Medium et Low contre le même
   test fonctionnel. Conserver le niveau le moins cher qui réussit le test.
5. Documenter le coût par tâche 'Après' pour chaque entrée.
Déclencheur : après chaque lancement de modèle, sinon trimestriellement.

Le but n'est pas « d'économiser plus » — le but est d'obtenir un chiffre par tâche là où il n'en existait aucun. Le comparatif Avant/Après sur une même tâche est le seul benchmark qui fera vraiment bouger votre facture.

En toute franchise

Loin de la hype, en trois phrases : Fable 5.1 est et reste un modèle premium. 10/50 dollars par million de tokens, c'est beaucoup d'argent pour toute application qui pourrait coûter moins cher. L'économie de 25 à 50 % est une donnée d'Anthropic qui ne deviendra vraie (ou non) que dans vos propres logs. De plus, l'astuce des sous-agents déplace les tokens, elle ne les élimine pas : un orchestrateur mal conçu brûlera plus de tokens qu'il n'en sauvera. Ce lancement ne fait pas le travail à votre place — il vous donne simplement accès à la variable sur laquelle vous pouvez agir.

FAQ

Dois-je migrer tous mes workloads vers Fable 5.1 immédiatement ?

Non — et « tous » est de toute façon la mauvaise échelle. Selon Anthropic, les prompts existants pour Fable 5 continueront de fonctionner sans modification, il n'y a donc aucune obligation de migrer. La transition est pertinente là où les agents réutilisent beaucoup de contexte : boucles de codage, tâches cron avec un prompt système fixe, systèmes multi-agents. Pour des applications ponctuelles (one-shot) avec un petit contexte, les économies de cache sont trop faibles pour justifier à elles seules le passage.

Comment mesurer le Cost-per-Task sans plonger trop profondément dans l'API ?

Presque toutes les interfaces d'agents incluent les champs d'usage (input_tokens, output_tokens, cache_read_input_tokens) dans la réponse, que ce soit via le SDK Python, la CLI ou les fichiers de log. Il vous suffit de les exporter (par exemple au format .jsonl) et de les additionner par tâche. Pour les outils sans export propre, noter les compteurs de début et de fin de tâche suffit. La conversion n'est qu'une règle de trois avec la grille tarifaire ; le snippet Python ci-dessus ne fait rien d'autre.

Que signifie concrètement le niveau d'effort (Effort-Stufe) pour ma facture ?

L'effort contrôle la quantité de tokens de « réflexion » que le modèle investit par réponse — au même tarif par token. High est la valeur par défaut d'Anthropic et c'est souvent excessif pour les tâches de routine ; Medium ou Low fournissent le même travail pour les résumés, le formatage et les refontes de code simples (refactors), mais pour une fraction des tokens. Le piège du mode Low : le modèle appelle moins souvent les outils de recherche, ce qui est inadapté pour les tâches de documentation poussées. Règle empirique : démarrer en High, tester un niveau plus bas avec le même test, et conserver le niveau le moins cher qui soit suffisant.

Au bout du compte, Fable 5.1 est-il vraiment moins cher que Fable 5 ?

Globalement, c'est presque certain, mais à grille tarifaire égale, ce n'est pas garanti en soi, car les tarifs de base sont identiques. Cela devient moins cher via trois voies secondaires : moins de tokens par tâche (25 à 50 % selon Anthropic), des lectures en cache facturées au quart de l'ancien prix, et une granularité de l'effort qui permet pour la première fois de facturer la réflexion au plus juste. Ceux qui faisaient déjà tout tourner au niveau le plus bas possible et utilisaient le cache économiseront moins que la moyenne — où les économies proviennent souvent de valeurs par défaut non optimisées.

Qu'implique la parité de prix avec GPT-6 Astra pour le choix de mon fournisseur ?

Cela signifie que la question du prix disparaît du processus de décision au profit de la question de l'adéquation. Artificial Analysis place Astra cinq points derrière Fable 5.1 dans l'Intelligence Index, mais devant lui sur la courbe des coûts des agents de codage. Selon la tâche, le couple capacité/prix optimal change. La conséquence pratique : l'interchangeabilité des fournisseurs doit désormais être évaluée sur la base d'un audit de coût par tâche, et non plus sur la seule marque du modèle. Sans rupture de prix, changer de modèle n'est plus qu'une question d'environnement (harness) et d'effort.

Devrions-nous réécrire nos prompts et skills immédiatement ?

Pas les réécrire, mais les désencombrer. Anthropic avertit expressément que les skills conçus pour d'anciens modèles sont trop prescriptifs pour Fable 5/5.1, ce qui nuit à l'efficacité. Un audit de prompts (comme le suggère Peter Yang : exécuter une commande d'audit de prompts sur tous les skills) permet de trouver les redondances en quelques minutes. Tout ce qui fonctionne et est objectivement vérifiable reste ; tout ce qui relève de la micro-gestion du processus doit être supprimé.

Sources

Remarque : Les benchmarks et les données de consommation sont des chiffres fournis par les fabricants ou des tiers, valables au 04.09.2026. Les calculs Avant/Après présentés dans l'article sont des exemples chiffrés destinés à illustrer la logique de tarification.

Partager l'article

Share: