Retour à la Bibliothèque
Stratégie

30 % moins cher par tâche, 7x plus de tokens : au cœur du piège d'efficacité de Sonnet 5.5

Dernière mise à jour : 2026年9月27日

Points clés

  • L'accroche de Sonnet 5.5, « jusqu'à 30 % de moins par tâche », tient à effort faible et moyen mais s'inverse à effort maximal : Anthropic a facturé la même grille tarifaire de 2 $/10 $ pendant que le modèle dépensait ~193 000 tokens de sortie par tâche de l'index — la consommation de tokens la plus lourde jamais mesurée par Artificial Analysis — pour un coût mesuré de 7,60 $ par tâche, soit environ 50 % de plus que Sonnet 5 et ~27 % de plus que les 5,98 $ d'Opus 5.5 (Anthropic, 28 sept ; Artificial Analysis, 28 sept).
  • La même fenêtre de lancement a produit deux stratégies opposées : OpenAI a réduit de 50 % les prix de GPT-6 Sol/Luna à 2 $/10 $ et 0,10 $/0,50 $ par million de tokens le 22 septembre — GPT-6 Sol au maximum coûte 1,06 $ par tâche de l'Intelligence Index, soit ~50 % de moins que son prédécesseur — tandis qu'Anthropic gardait la grille tarifaire de Sonnet intacte et laissait la facture de tokens grimper (OpenAI ; Artificial Analysis).
  • Opus 5.5 (22 septembre) a pris un troisième chemin : 20 % de remise sur le prix affiché et 60 % de remise sur les lectures de cache (0,50 $ → 0,20 $ le million), visant la ligne qui domine les charges agentiques — c'est pourquoi son coût mesuré de 5,98 $ par tâche sous coupe son propre cadet à effort maximal (Anthropic ; Finout).
  • À effort élevé à maximal, Sonnet 5.5 se situe hors de la frontière coût-efficacité : GPT-6 Sol délivre une intelligence quasi équivalente à « pratiquement le même coût par tâche », et GPT-6 Luna au maximum fait un travail d'intelligence équivalente pour 0,07 $ par tâche — environ un centième de la facture de Sonnet 5.5 au maximum (Artificial Analysis, 28 sept).
  • Environ 180 des 672 modèles suivis ont subi un changement de prix en septembre — la grille tarifaire est désormais un risque mensuel, et un agent dont le contrat ne cite que la tarification au token n'a aucune défense contre un remplacement qu'il n'a jamais approuvé (pricepertoken, 28 sept ; le renversement d'auto-routage de DeepSeek en est l'exemple travaillé).

Anthropic a lancé Claude Sonnet 5.5 le 28 septembre avec la revendication de coût la plus nette du marché : « C'est une nette progression par rapport à Claude Sonnet 5, ça tourne 30 % plus vite et ça coûte jusqu'à 30 % de moins pour la plupart des travaux. » Chaque mot est défendable — et le mécanisme n'est pas celui que le titre sous-entend. La grille tarifaire n'a pas bougé : 2 $ par million de tokens d'entrée, 10 $ en sortie, 0,20 $ pour les lectures de cache, identique à Sonnet 5. Ce qui a changé, c'est la facture de tokens, et elle a bougé dans le sens inverse de la revendication, au niveau d'effort où le travail agentique s'exécute réellement. Artificial Analysis a fait tourner le modèle le jour même : à effort maximal, Sonnet 5.5 a dépensé ~193 000 tokens de sortie par tâche de l'Intelligence Index — le plus haut jamais enregistré par ses tests, environ 60 % au-dessus d'Opus 5.5 au maximum et près de sept fois GPT-6 Astra — pour un coût mesuré de 7,60 $ par tâche (Artificial Analysis, 28 sept ; enregistré en premier par l'équipe de kingy.ai : « Sonnet 5.5 est bon marché au token mais peut s'avérer coûteux par tâche »).

Pris isolément, c'est la singularité d'un modèle. Lu contre la même fenêtre de deux semaines, c'est le carrefour de l'industrie. Le 22 septembre, OpenAI a réduit de moitié les prix de GPT-6 Sol et Luna (OpenAI) et Anthropic a réduit de 60 % les lectures de cache d'Opus 5.5 (Anthropic). Six jours plus tard, l'entrée d'Anthropic « 30 % moins cher » facture le même volume de tokens au prix plein là où les concurrents le vendent à moitié — et achète la place n° 2 de l'index en dépensant des tokens plutôt qu'en les achetant plus bas. Trois stratégies de lancement s'affrontent désormais sur la même métrique, le coût par tâche, et elles divergent le plus précisément là où vit la doctrine d'achat d'inférence. Cet article mappe les trois stratégies contre les chiffres mesurés d'Artificial Analysis, déroule l'arithmétique d'efficacité des tokens qu'une grille tarifaire au token dissimule, et se clôt sur les quatre clauses de contrat qui empêchent le prochain changement de modèle de repriceer silencieusement la facture de votre agent.

La revendication, le mécanisme et la mesure

La revendication d'Anthropic porte sur l'efficacité, et la page de lancement est explicite sur le mécanisme : le modèle « n'a généralement besoin que de beaucoup moins de tokens pour faire le même travail. Dans nos tests, il coûte jusqu'à 30 % de moins par tâche que son prédécesseur. » C'est vrai sur la distribution de tests d'Anthropic, avec les réglages choisis par Anthropic — l'entreprise rapporte que Sonnet 5.5 dépasse les meilleurs scores de Sonnet 5 « pour environ un dixième du coût par tâche » à effort faible et moyen (comme synthétisé par kingy.ai). Si votre charge de travail tourne légère et à la façon d'Anthropic — ébauches courtes, classification, requêtes bornées — la revendication tiendra probablement sur votre facture.

Les charges agentiques ne sont pas cette distribution. L'Intelligence Index d'Artificial Analysis fait tourner des tâches multi-étapes sur cinq niveaux d'effort, et le raisonnement adaptatif du modèle escalade l'effort sur les tâches difficiles. Au sommet de cette plage, la facture de tokens explose : 193k tokens de sortie par tâche au maximum, contre ~120k pour Sonnet 5 au maximum et Opus 5.5 au maximum (+60 %) et 27k pour GPT-6 Astra au maximum (7x). Le volume de tokens est le point — Sonnet 5.5 (maximum) marque 56 sur l'index, 2 points derrière les 58 d'Opus 5.5, avec Terminal-Bench 4.0 à 64 %, légèrement au-dessus d'Opus 5.5 et GPT-6 Astra. Il atteint cette capacité en réfléchissant plus longuement par étape, et les tokens de sortie sont facturés à 10 $ le million quels que soient la défendabilité de chacun. Une note de bas de page sur le fallback complète la mécanique : le routage adaptatif par défaut d'Anthropic « replie dans ~0,1 % des tâches... en se repliant sur Sonnet 5 dans tous les cas » — une autre substitution neutre pour la grille tarifaire que l'opérateur ne voit que sur la facture (Artificial Analysis).

Le coût par tâche est la seule métrique qui survive au contact de cette structure, car elle compose la grille tarifaire avec la facture de tokens. Les mesures du jour même, toutes en coût par tâche sur l'Intelligence Index à effort maximal :

Modèle (maximum) Prix affiché ($/M entrée/sortie) Tokens de sortie/tâche Coût mesuré/tâche Stratégie de lancement
Claude Sonnet 5.5 2 $ / 10 $ ~193k 7,60 $ Orientée capacité : grille intacte, facture de tokens en hausse
Claude Opus 5.5 4 $ / 20 $ (cache 0,20 $) ~120k 5,98 $ Orientée cache : affiché −20 %, ligne agentique −60 %
Claude Sonnet 5 2 $ / 10 $ ~120k ~5,00 $ Baseline
GPT-6 Sol 2 $ / 10 $ ~31k 1,06 $ Orientée prix : affiché −50 %
GPT-6 Luna 0,10 $ / 0,50 $ ~51k 0,07 $ Orientée prix : tarif plancher

(Scores AA Intelligence Index v4.x : Sonnet 5.5 56 à la 2e place ; Opus 5.5 58 à la 1re ; GPT-6 Sol équivalent de classe ~56 sur le travail d'agents de codage. Les scores portent un avertissement de lignée — AA a rebasé son index deux fois cette année ; citez les scores uniquement entre publications de même source.)

Le piège est à la première et à la troisième ligne : prix affichés identiques, 7,6x d'écart sur le coût mesuré. Une décision d'achat prise sur la grille tarifaire — « Sonnet 5.5 égale le prix de Sonnet 5, c'est donc la mise à niveau économique » — produit l'inverse exact de la facture. Et le classement mesuré inverse l'intuition une seconde fois : le prix affiché le plus élevé de la table (Opus 5.5 à 4 $/20 $) est la tâche la plus économique, car sa baisse des lectures de cache attaque la ligne que les charges agentiques dominent réellement — la relecture de longs contextes des milliers de fois par tâche (Anthropic : « Les lectures de cache (qui constituent la majorité des coûts de travail agentique et de codage) sont à 0,20 $ le million de tokens »).

Trois stratégies de lancement, un champ de bataille

La fenêtre de septembre a formalisé ce que la guerre des prix laissait entendre depuis juin : le prix au token n'est plus là où les fournisseurs se battent, car le prix au token est devenu presque gratuit. Le champ de bataille s'est déplacé vers le coût par tâche, et chaque laboratoire a choisi une arme différente.

Orientée capacité (Anthropic, ligne Sonnet). Expédier un modèle quasi frontière sur l'ancienne grille et gagner la table des benchmarks. Sonnet 5.5 à la 2e place avec une facture de tokens 60 % plus lourde est la forme la plus pure : le gain d'intelligence est réel (+18 points d'index sur Sonnet 5 au maximum), et son coût se pose sur la ligne de tokens de la facture, où « 30 % moins cher » et « 7,60 $ » restent tous deux techniquement vrais. La stratégie parie que les acheteurs lisent les titres et les benchmarks et traitent le volume de tokens comme un bien gratuit — et si l'on croit la prévision de Gartner du 16 septembre (dépense mondiale en IA de +49,5 % en 2026 jusqu'à 2,7 T$, avec le segment agents et assistants sur une trajectoire 16,5 → 29,2 → 65,5 G$), le pari a un vrai public.

Orientée prix (OpenAI, ligne Sol/Luna). Couper l'affiché de moitié et publier soi-même l'arithmétique par tâche. La table de lancement d'OpenAI est prête pour l'achat d'une manière qu'aucun lancement de modèle n'avait été : GPT-6 Sol (xhigh) marque 33,2 % à 0,27 $ par tâche contre Claude Opus 5 (maximum) à 26,9 % pour 11,1x le coût. Du côté d'Artificial Analysis, GPT-6 Sol au maximum a réduit de moitié les 1,99 $ de son propre prédécesseur à 1,06 $ tout en gagnant 2 points sur le Coding Agent Index (Artificial Analysis). La stratégie parie que le coût par tâche mesuré et publié est la métrique d'achat de l'avenir — et qu'un fournisseur confiant dans son efficacité gagne l'achat en rendant la comparaison des coûts sans effort.

Orientée cache (Anthropic, ligne Opus). Garder le prix affiché frontière, vider le moteur de coût agentique. La baisse des lectures de cache d'Opus 5.5 de 0,50 $ à 0,20 $ cible exactement la forme de charge où vivent les tokens agentiques — les relectures répétées d'un contexte volumineux et stable. Anthropic estime ~40 % de coût total en moins sur un travail typique (Fello AI résumant les revendications du lancement), et les 5,98 $ mesurés par tâche contre 7,60 $ confirment la direction de manière indépendante.

Même métrique. Trois stratégies opposées. Coût par tâche de l'Intelligence Index à effort maximal, mesuré — lancements de sept. 2026 · Artificial Analysis COÛT MESURÉ PAR TÂCHE (EFFORT MAXIMAL) 7,60 $ Sonnet 5.5 193k tokens de sortie/tâche 5,98 $ Opus 5.5 lectures de cache −60 % ~5,00 $ Sonnet 5 la ligne de base « prédécesseur » 1,06 $ GPT-6 Sol affiché −50 % 0,07 $ GPT-6 Luna palier plancher Sonnet 5.5 au maximum coûte 7,2x GPT-6 Sol au maximum — sur une grille tarifaire identique de 2 $/10 $ TROIS STRATÉGIES DE LANCEMENT, SEPTEMBRE 2026 Orientée capacité — Anthropic Sonnet 5.5 Grille intacte à 2 $/10 $. Gagner l'index (2e, score 56) en réfléchissant plus : 193k tokens/tâche, la facture la plus lourde que AA ait mesurée. Le coût se pose sur la ligne de tokens de la facture. Le benchmark achète le titre Orientée prix — OpenAI Sol / Luna Réduire l'affiché de moitié (22 sept) et publier l'arithmétique par tâche dans le billet : Sol xhigh à 0,27 $/tâche vs Opus 5 maximum à 11,1x le coût. Luna : 96 % de moins par tâche que Fable 5. Achat sur chiffres publiés Orientée cache — Anthropic (Opus) Opus 5.5 Affiché −20 %, lectures de cache −60 % (0,50 $ → 0,20 $). Vise la ligne que dominent les charges agentiques : « les lectures de cache... constituent la majorité des coûts de travail agentique et de codage » L'aîné sous-cote le cadet L'ARITHMÉTIQUE DISSIMULÉE PAR LA GRILLE — CHARGE DE 200 ÉTAPES, 1 000 ÉTAPES/JOUR Sonnet 5.5 max : 1 200 étapes/semaine x 193k tokens de sortie = 231,6 M tokens de sortie/semaine x 10 $/M = 2 316 $/semaine La même charge sur GPT-6 Sol max : 31k tokens → 121 $/semaine. Sur Sonnet 5 max : 120k tokens → 1 200 $/semaine. Sur ce profil, le modèle « 30 % moins cher » coûte 1,9x son propre prédécesseur — la grille n'a jamais bougé ; la colonne tokens, si. Les niveaux d'effort font varier la facture de 30x — contractez pour le plafond Le prix au token est la mauvaise métrique d'achat. Contractez au coût par tâche, ou le swap choisit la facture. Épinglez les IDs de modèle par étape · plafonnez les tokens par tâche avec un circuit breaker · journalisez le modèle servi, pas le demandé · exigez les prix par tâche publiés Le renversement en 45 heures de DeepSeek prouve que les quatre sont nécessaires — et qu'aucun n'est suffisant seul. Sonnet 5.5 max 7,60 $/tâche · Opus 5.5 5,98 $ · Sonnet 5 ~5,00 $ · GPT-6 Sol 1,06 $ · GPT-6 Luna 0,07 $ Sources : Artificial Analysis (22 + 28 sept) · Anthropic · OpenAI — ideabosque.com

Le point du diagramme est l'encadré d'arithmétique, pas les barres : une grille tarifaire est un prix par million ; un contrat au coût par tâche est un prix par résultat. Sur une charge de 200 étapes exécutée 1 200 fois par semaine, Sonnet 5.5 au maximum dépense 193k tokens de sortie par étape et facture environ 2 316 $ par semaine là où GPT-6 Sol facture 121 $ pour une intelligence mesurée quasi équivalente (les deux marquent dans le milieu des 50 sur l'index ; l'économie d'agent de codage de Sol à 2,99 $/tâche est sur la frontière de Pareto selon l'analyse de l'index de codage d'AA). Le delta hebdomadaire entre le modèle « 30 % moins cher » et son propre prédécesseur est d'environ 1 100 $ — la revendication « jusqu'à 30 % de moins » et une hausse de coût de 2x sont simultanément vraies, distinguées uniquement par la distribution d'effort. C'est pourquoi le contrat importe plus que le billet de lancement.

Le problème d'achat que septembre vient de rendre plus difficile

Deux faits structurels transforment cela d'un commentaire en langage de contrat. D'abord, le risque de grille tarifaire est désormais mensuel : pricepertoken relève environ 180 des 672 modèles suivis avec un changement de prix en septembre (la dérive du compteur sur le mois : 178/672 → 181/671), et la chronologie de LLM Gateway liste 23 nouveaux modèles de 15 fournisseurs ce mois-ci — la facture que votre agent a fait courir en août n'est pas celle qu'il fait courir en octobre. Ensuite, la couche de substitution est déjà livrée en tant que produit : Smart Route de LLM Gateway publié le 25 septembre fait du routage côté fournisseur une fonctionnalité achetable, et la repli adaptatif d'Anthropic (« replie dans ~0,1 % des tâches, principalement dans Terminal-Bench, en se repliant sur Sonnet 5 dans tous les cas » selon les tests d'AA) est le même mécanisme à l'intérieur de l'appel du modèle. Ni l'un ni l'autre n'est une faute — l'épisode DeepSeek a montré qu'un fournisseur peut même annoncer une substitution de modèle à l'échelle de la flotte et la renverser 45 heures plus tard sous la pression des utilisateurs. La décision de routage est réelle et elle appartient à celui qui tient le runtime.

Dans ce contexte, acheter sur la grille tarifaire comporte trois modes de défaillance précis :

  1. L'échec titre-benchmark. Sonnet 5.5 domine à la fois le récit de capacité (index n° 2, Terminal-Bench 4.0 à 64 %) et l'histoire du coût (30 % de moins par tâche) dans le même lancement — les deux sont vrais, composés contre des baselines différentes. Un passage d'achat qui lit le billet de lancement et la table des benchmarks mais pas la colonne des tokens approuve la configuration de coût par tâche la plus chère de la table.
  2. La prévision aveugle au niveau d'effort. La plupart des calculs de coûts publiés supposent des réglages publiés. Le balayage d'AA montre que la facture de Sonnet 5.5 oscille selon l'effort (maximum 7,60 $ contre ~5,00 $ pour Sonnet 5 ; réglages faible/moyen où vit la revendication « 30 % moins cher ») ; une prévision bâtie sur le réglage par défaut de l'API hérite du niveau que la logique d'escalade du SDK du fournisseur choisit par tâche.
  3. Le prix unitaire aveugle au cache. Deux modèles d'Anthropic à 30 jours d'intervalle ont choisi des axes opposés — Sonnet 5.5 a laissé les tokens coûteux, Opus 5.5 a rendu la lecture en cache bon marché. Le taux de hits de cache réel d'une charge agentique (prompts système longs et stables ; schémas d'outils répétés ; volumineux contexte récupéré) est désormais le plus grand déterminant unique de lequel des deux est le moins cher — un nombre que la plupart des processus de RFQ ne demandent jamais.

Aucune de ces situations n'est une tromperie du fournisseur. Les trois sont la production normale d'un marché dont l'économie unitaire s'est déplacée sous son propre langage de tarification — la même conclusion qu'AA a atteinte en une ligne : « Sonnet 5.5 est bon marché au token mais peut être cher par tâche. »

Le contrat : quatre clauses qui survivent au prochain lancement

La solution n'est pas de choisir le laboratoire gagnant ; sur le coût par tâche, le gagnant change chaque semaine (le compteur de pricepertoken bouge chaque mois). C'est d'instrumenter la décision pour que le prochain changement soit un changement de configuration mesuré plutôt qu'une surprise sur la facture. Les quatre clauses mappent sur le même runtime que ce site construit dans chaque agent :

1. Épinglez les IDs de modèle par étape et journalisez le modèle servi, pas le demandé. La couche de routage est une infrastructure d'opérateur. Les champs model vivent dans la configuration de votre agent — dans notre runtime de référence, les agents référencent des ressources de modèle enregistrées par provider + nom, et changer de modèle est une opération de données, pas un redéploiement. La piste d'audit enregistre le modèle effectivement servi à chaque appel d'outil (l'article DeepSeek couvre le schéma d'incident complet). Un fournisseur qui échange votre modèle en silence produit désormais un diff visible.

2. Contractez au coût par tâche avec un plafond hebdomadaire, pas au token avec une facture mensuelle. La tarification par tâche devient une métrique de premier parti publiée (OpenAI la publie dans ses tables de lancement ; AA mesure tout le monde sur les mêmes tâches). Un contrat cadré nomme la charge de travail (étapes, forme du contexte, taux de hits de cache attendu), le modèle et le niveau d'effort par classe d'étape, et un plafond mesuré par tâche — avec le prix par tâche publié du fournisseur comme ligne de référence. Le cadre des six vecteurs de coût fournit la liste d'audit ; le cinquième vecteur (risque de substitution de fournisseur) est la clause que cette section opérationnalise.

3. Budgétez les tokens avec le cadran d'effort comme surface d'achat, pas comme un réglage de développeur. L'oscillation de 30x de la facture de Sonnet 5.5 entre niveaux d'effort est le cas concret. La couche de routage doit traiter l'effort de raisonnement comme un champ de configuration typé par classe d'étape — seuils d'escalade explicites, plafonds arrêtés durement au runtime (le motif de plafond de coûts des agents longue durée), et la politique d'escalade visible dans la piste d'audit. Un défaut « effort maximal » sur 1 200 étapes quotidiennes est une décision d'achat jamais prise.

4. Testez l'efficacité revendiquée sur votre charge avant d'engager une flotte. Le « jusqu'à 30 % de moins » d'Anthropic est honnête, cadré et conditionnel à la charge — et la contre-mesure de 7,60 $ d'AA est elle aussi honnête, cadrée et conditionnelle à la charge. Ni l'un ni l'autre ne vous dit votre facture. Le pilote de 30 minutes : prenez une semaine d'exécutions réelles de l'agent, rejouez-les contre le modèle candidat à chaque niveau d'effort, mesurez tokens et taux de hits de cache par étape, et placez les trois chiffres (grille tarifaire, facture de tokens, coût mesuré par tâche) dans le document d'achat. Le stack à trois couches de TypeSafe Jev rend cela continu — un classifieur de couche de décision calibré surveille la facture par classe d'étape, car le surveillant est presque gratuit par appel.

Un marqueur d'honnêteté s'applique à tout ce qui précède, encadré d'arithmétique compris : tous les chiffres mesurés par tâche proviennent de deux sources de test indépendantes du même jour (AA, kingy.ai) plus les tables publiées par les fournisseurs, et ce sur des tâches de benchmark, pas votre charge. L'Intelligence Index d'AA a aussi été rebasé deux fois cette année ; les scores et coûts cités ici sont des comparaisons à même date de publication et peuvent bouger au prochain rebasage. Traitez tout cela comme la baseline de départ qu'un pilote remplace — la direction (grille ≠ facture ; les tokens sont la variable) est stable, les constantes exactes ne le sont pas.

Le résultat, sur un profil réel

Exécutez les chiffres sur le profil de build mi-marché autour duquel ce site écrit : l'agent de devis d'un distributeur, 200 RFQ par semaine, environ 1 200 étapes de modèle par semaine sur la recherche de catalogue, la tarification par paliers, les substituts du graphe de connaissances et la génération de brouillons. À Sonnet 5.5 au maximum, ce profil facture environ 2 300 $ par semaine. Routé délibérément — effort frontière uniquement sur les étapes pertinentes pour la négociation, un modèle de milieu de gamme sur les requêtes, un modèle quasi plancher sur la classification, le contexte gourmand en cache partagé entre les étapes — la même charge facture moins de 300 $ par semaine, la qualité concentrée là où vit réellement le résultat métier : le devis que voit le client. La différence de 87 % n'est pas du talent de sélection de modèle ; c'est le runtime qui fait respecter une décision de coût que le billet de lancement n'a jamais prise pour vous. À ces volumes, la couche d'intégration — modules MCP, politique de routage, piste d'audit — reste le 90 % du build qu'une grille tarifaire au token ne peut pas fixer ; la facture du modèle est le bruit, et le motif ci-dessus est la façon de la garder bruit plutôt que signal.

Lecture connexe


Un distributeur de mi-marché exploitant NetSuite et BigCommerce devise 200 RFQ par semaine à travers une pile d'agents gouvernée : modules MCP pour l'ERP et trois catalogues de fournisseurs, un graphe de connaissances pour les substituts de pièces, un moteur RFQ gérant les holds de disponibilité — et une couche de routage qui épingle les IDs de modèle par classe d'étape, plafonne les tokens par tâche et journalise le modèle servi à chaque appel. Quand le prochain billet de lancement revendiquera « 30 % de moins », la couche fera tourner un pilote de rejeu d'une semaine et le document d'achat recevra trois chiffres au lieu d'un adjectif. Premier agent en production en 5–8 semaines.

Demandez un build cadré. Une semaine de découverte. Vous obtenez un inventaire de systèmes, une carte des flux et un périmètre fixe — que vous construisiez avec nous ou non.

Vous voulez cela construit pour vos systèmes ?

Chaque document ici provient d'un travail réel en production. Si vous avez un système cible et un flux en tête, nous pouvons cadrer une construction en une semaine.

Demander un projet cadré

Découverte d'une semaine. Vous obtenez un inventaire des systèmes, une cartographie des flux et un périmètre fixe — que vous construisiez avec nous ou non.