Retour à la Bibliothèque
Stratégie

Le sous-agent à 0,10 $ : Claude Haiku 5.5 effondre l'écart de coût entre modèles fermés et poids ouverts

Dernière mise à jour : 2026年10月7日

Points clés

  • Claude Haiku 5.5 est tarifé à 0,10/0,50 $ par million de tokens pour les prompts de moins de 100K — 90 % sous Haiku 4.5 et au prix exact de GPT-6 Luna — rendant le niveau de sous-agents effectivement gratuit pour 90 % des requêtes chez trois fournisseurs (Anthropic, 7 oct).
  • OSWorld 2.1 est passé de 15,7 % (Haiku 4.5) à 72,4 % (Haiku 5.5) — une amélioration de 4,6× qui place le modèle bon marché à moins de 12 points du 83,9 % de Sonnet 5.5 (Anthropic, 7 oct).
  • Les lectures de cache de Sonnet 5.5 ont été divisées par deux, de 0,20 à 0,10 $ par million de tokens, réduisant le coût agentique de Sonnet 5.5 d'environ 20 % — le modèle de niveau intermédiaire est devenu moins cher le jour même du lancement du niveau de sous-agents (Anthropic, 7 oct).
  • GLM-5.3-Flash à 0,15/0,50 $ et GPT-6 Luna à 0,10/0,50 $ signifient que l'écart de coût d'entrée entre fermé-frontière et poids ouverts au niveau des petits modèles est désormais de 0,05 $/M — un chiffre qui s'arrondit à zéro pour la plupart des charges de travail (Z.AI ; Anthropic).
  • L'axe concurrentiel s'est déplacé du prix vers la capacité, la posture de sécurité et l'intégration à l'écosystème — le niveau de sous-agents n'est plus une décision de coût, c'est une décision d'architecture (Yahoo Finance, 7 oct).

Cet article prolonge 30 % moins cher par tâche coûte 7 fois plus de tokens : la trappe d'efficacité de Sonnet 5.5, qui cartographiait les trois stratégies de lancement s'affrontant sur le coût par tâche au niveau flagship. Ici, on descend d'une couche : le niveau des sous-agents — le modèle qui gère compaction, classification, requêtes en base et travail d'assistant de code — vient d'atteindre un plancher de prix impensable il y a six mois. La division par deux des lectures de cache de Sonnet 5.5 — publiée dans la même annonce — est la donnée complémentaire directe : la thèse d'efficacité en tokens de l'article gagne un changement de prix qui rend le modèle intermédiaire 20 % moins cher sur les charges agentiques où les lectures de cache dominent.

Le niveau des sous-agents est désormais un marché à trois fournisseurs à un seul prix

La grille tarifaire du niveau des petits modèles au 8 octobre 2026 :

Modèle Entrée $/M Sortie $/M Type Fournisseur
GPT-6 Luna $0.10 $0.50 Fermé-frontière OpenAI
Claude Haiku 5.5 $0.10 $0.50 Fermé-frontière Anthropic
GLM-5.3-Flash $0.15 $0.50 Poids ouverts Z.ai

Le prix de sortie est identique chez les trois. L'écart d'entrée entre le duo fermé-frontière et le modèle à poids ouverts est de 0,05 $ par million de tokens — pour un sous-agent qui compacte un contexte de conversation de 50 000 tokens, cela fait 0,0025 $. Le coût du choix d'un mauvais sous-agent se mesure désormais en fractions de centime par tâche, non en dollars par jour.

La configuration des prix du niveau des sous-agents au 8 octobre 2026 :

Le niveau de sous-agents à 0,10 $ Trois fournisseurs. Un prix. L'écart de coût d'entrée fermé-frontière vs poids ouverts est désormais de 0,05 $/M. L GPT-6 Luna OpenAI · Fermé-frontière $0.10 /M entrée $0.50 /M sortie OSWorld 2.1: 48.9% H Claude Haiku 5.5 Anthropic · Fermé-frontière · NOUVEAU $0.10 /M input $0.50 /M output OSWorld 2.1 : 72,4 % (avant 15,7 %) G GLM-5.3-Flash Z.ai · Poids ouverts $0.15 /M input $0.50 /M output 320B/18B MoE · MIT-weight Écart de coût d'entrée fermé-frontière vs poids ouverts : 0,05 $/M tokens Pour une compaction de 50K tokens : 0,0025 $ d'écart. Le niveau de sous-agents n'est plus une décision de coût. Le ratio 10:1 tient 10 $ d'intégration + gouvernance pour chaque 1 $ de modèle $1 Modèle $10 Intégration Modules MCP, graphes de connaissances, pistes d'audit, gouvernance Lectures de cache Sonnet 5.5 divisées par deux Même annonce · travail agentique ~20 % moins cher 0,20 $/M lectures de cache 0,10 $/M lectures de cache Les lectures de cache dominent la consommation agentique de tokens — la ligne qui croît à chaque tour Le modèle est devenu 90 % moins cher. La couche d'intégration, non. Sources : Anthropic (7 oct 2026) · Z.AI · Yahoo Finance · IdeaBosque ideabosque.com/library/haiku-5-5-subagent-tier-cost-collapse

Yahoo Finance a présenté le lancement de Haiku 5.5 comme « la guerre des prix de l'IA s'intensifie » (Yahoo Finance, 7 oct). Le cadrage est exact mais sous-estime ce qui s'est produit. Une guerre des prix suppose des marges qui se compriment sur un même produit. Ce qui s'est réellement produit : le niveau des sous-agents — la couche où se produit la majeure partie de la consommation agentique de tokens — s'est effondré vers un prix auparavant réservé au modèle à poids ouverts le moins cher. Le modèle fermé-frontière et le modèle à poids ouverts se tiennent désormais au même point de prix sur les tokens de sortie. La question « faut-il un sous-agent frontière ou à poids ouverts ? » n'est plus une question de coût.

Ce qui a changé : le sous-agent est devenu capable

Le prix n'est que la moitié de l'histoire. Le saut de benchmarks de Haiku 5.5 est ce qui change les décisions d'architecture :

  • OSWorld 2.1 (sous-ensemble hors ligne) : 72,4 % — contre 15,7 % pour Haiku 4.5, une amélioration de 4,6×. GPT-6 Luna est à 48,9 %. Le sous-agent peut désormais piloter un ordinateur pour mener à bien des tâches multi-étapes à un niveau qui était celui du flagship il y a douze mois (Anthropic).
  • Terminal-Bench 4.0 : 39,2 % — contre 0,0 % pour Haiku 4.5. GPT-6 Luna est à 16,4 %. Le sous-agent peut accomplir des tâches complexes en ligne de commande que la génération précédente ne pouvait même pas tenter (Anthropic).
  • FrontierCode 1.1 (Main) : 46,4 % — au-dessus des 42,4 % de GPT-6 Luna, en dessous des 52,1 % de Sonnet 5.5 à xhigh. Le sous-agent écrit du code de production assez fiable pour servir d'assistant de codage — Cognition l'intègre comme sidekick dans Devin Fusion, tenant un score FrontierCode de premier plan de 66,2 à coût et latence réduits (Anthropic).
  • Suite de tâches CRM de HubSpot : 92,8 % — le meilleur score mesuré par HubSpot sur son évaluation CRM à portail simulé. Le sous-agent identifie les enregistrements obsolètes mais ambigus avec le meilleur taux de réussite et le plus faible taux de faux positifs de tous les modèles testés (Anthropic).

La donnée HubSpot compte au-delà du benchmark. HubSpot est une plateforme CRM majeure qui évalue des petits modèles frontière pour des tâches d'automatisation CRM — exactement le cas d'usage visé par un module MCP personnalisé. Quand le niveau des sous-agents peut identifier des enregistrements CRM obsolètes avec 92,8 % de précision à 0,10 $/M d'entrée, le coût d'exécution d'un agent qui surveille un pipeline commercial 24/7 passe de poste budgétaire à erreur d'arrondi.

Effort réglable : le même modèle, cinq points de prix

Haiku 5.5 est le premier modèle de classe Haiku avec des niveaux d'effort réglables : low, medium, high, xhigh, max. C'est le même schéma de coût configurable que l'analyse de l'auto-routage DeepSeek signalait comme risque d'achat quand le routage est invisible — mais ici la commande est entre les mains de l'opérateur. Un sous-agent qui compacte le contexte de conversation peut tourner à effort low pour 0,002 $ par tâche ; le même modèle peut tourner à effort max pour une requête en base plus difficile. La courbe de coût par tâche est désormais un cadran, pas un tarif fixe.

L'implication pour l'achat d'inférence est directe : un contrat qui ne nomme que le modèle et la grille tarifaire n'a aucun contrôle sur le niveau d'effort. Un agent à effort max brûle plus de tokens que le même agent à medium — et l'opérateur ne voit que la facture. Les quatre clauses contractuelles recommandées par l'article Sonnet 5.5 (verrouillage du niveau d'effort, divulgation de substitution, planchers de prix des lectures de cache, plafonds de volume de tokens) s'appliquent désormais telles quelles au niveau des sous-agents — puisque le cadran d'effort y existe aussi.

La division par deux des lectures de cache de Sonnet 5.5 : l'intermédiaire est devenu moins cher aussi

La même annonce a divisé par deux les lectures de cache de Sonnet 5.5, de 0,20 à 0,10 $ par million de tokens. Les lectures de cache constituent une grande part de la consommation agentique de tokens — un agent qui relit à chaque tour le même prompt système, les définitions d'outils et l'historique de conversation frappe la ligne de lectures de cache plus que les lignes d'entrée ou de sortie. Une coupe de 50 % sur la ligne qui domine les dépenses agentiques équivaut à ~20 % de réduction du coût agentique total de Sonnet 5.5 (Anthropic).

Cela compte pour la décision d'architecture de l'agent. Le niveau des sous-agents à 0,10/0,50 $ gère compaction, classification et travail d'assistant. Le niveau intermédiaire à 2/10 $ — désormais avec lectures de cache divisées par deux — gère le codage agentique complexe et le raisonnement multi-étapes. Le niveau flagship à 4/20 $ gère les tâches les plus dures. La pile à trois niveaux est désormais proprement tarifée : sous-agent bon marché, intermédiaire capable avec cache bon marché, flagship puissant. Le coût d'exécution de la pile complète pour un agent de production always-on a baissé de manière significative le 7 octobre.

Ce que cela signifie pour la construction

L'analyse d'économie de l'inférence a établi le ratio 10:1 : 10 $ de travail de processus, de gouvernance et d'intégration pour chaque 1 $ de dépense modèle. Le lancement de Haiku 5.5 élargit encore ce ratio. Le modèle est devenu 90 % moins cher ; la couche d'intégration, non. Un module MCP qui connecte un agent à NetSuite, un graphe de connaissances qui résout les pièces de substitution, une piste d'audit qui journalise chaque appel d'outil — ces coûts ne changent pas. Le modèle est désormais une fraction plus faible du coût total de construction qu'il y a une semaine.

C'est l'insight d'achat. L'effondrement des prix du niveau des sous-agents ne rend pas les systèmes d'agents moins chers à construire. Il les rend moins chers à exécuter — ce qui signifie que les équipes qui ont déjà construit la couche d'intégration obtiennent une réduction plus importante que celles qui ne l'ont pas fait. Une équipe qui fait tourner un agent RFQ de production avec modules MCP typés, graphe de connaissances et points de contrôle humains voit sa facture mensuelle d'inférence chuter de 75 % du jour au lendemain. Une équipe qui n'a pas construit la couche d'intégration ne voit aucun changement — parce que le coût réside dans la couche d'intégration.

Lectures complémentaires

Un distributeur régional exploitant NetSuite, BigCommerce et trois catalogues de fournisseurs traite 200 RFQ par semaine. L'agent de devis exécute Haiku 5.5 comme sous-agent pour la recherche catalogue et la classification des niveaux de prix, Sonnet 5.5 avec lectures de cache divisées par deux pour l'étape de rédaction des devis, et un graphe de connaissances pour la résolution des pièces de substitution. Le coût mensuel d'inférence de la pile complète a chuté de 75 % le 7 octobre — d'environ 4 000 $ à moins de 1 000 $ — sans modifier une seule ligne de code d'intégration. Les modules MCP, le graphe de connaissances et la piste d'audit sont ce qui rend la réduction de coût réelle. Le prix du modèle, c'est la partie facile.

Demander une réalisation à périmètre défini

Une semaine de discovery. Vous obtenez un inventaire des systèmes, une carte des flux de travail et un périmètre fixe — que vous construisiez avec nous ou non.

Vous voulez cela construit pour vos systèmes ?

Chaque document ici provient d'un travail réel en production. Si vous avez un système cible et un flux en tête, nous pouvons cadrer une construction en une semaine.

Demander un projet cadré

Découverte d'une semaine. Vous obtenez un inventaire des systèmes, une cartographie des flux et un périmètre fixe — que vous construisiez avec nous ou non.