0.10 ドルのサブエージェント:Claude Haiku 5.5 がフロンティアとオープンウェイトのコスト差を崩す
重要なポイント
- Claude Haiku 5.5 は 100K 未満のプロンプトに対して 100 万トークンあたり 0.10/0.50 ドルで価格設定されました——Haiku 4.5 より 90% 安く、GPT-6 Luna の価格と完全に一致します——これにより、サブエージェント階層は 3 プロバイダーでリクエストの 90% が実質的にほぼ無料になります(Anthropic、10月7日)。
- OSWorld 2.1 は Haiku 4.5 の 15.7% から 72.4% へ跳ね上がりました——4.6 倍の改善で、この低価格モデルが Sonnet 5.5 の 83.9% との差 12 ポイント未満に接近しました(Anthropic、10月7日)。
- Sonnet 5.5 のキャッシュ読み取りは 100 万トークンあたり 0.20 ドルから 0.10 ドルへ半額になり、Sonnet 5.5 のエージェントコストを約 20% 削減します——サブエージェント階層が登場したのと同じ日にミッドティアも安価になりました(Anthropic、10月7日)。
- GLM-5.3-Flash(0.15/0.50 ドル)と GPT-6 Luna(0.10/0.50 ドル)により、小模型ティアにおける frontier closed とオープンウェイトの入力コスト差は 0.05 ドル/M まで縮まりました——大半のワークロードではゼロに丸められる数字です(Z.AI、Anthropic)。
- 競争の軸は価格から能力・安全の姿勢・エコシステム統合へ移りました——サブエージェント階層はもはやコストの決定ではなく、アーキテクチャの決定です(Yahoo Finance、10月7日)。
本稿は 30% 安いタスク単価は 7 倍のトークンを消費:Sonnet 5.5 の効率の罠 を受けた分析です。あの記事はフラッグシップティアでタスク単価をめぐって競合する 3 つのリリース戦略を整理しました。ここでは一つ下の層、サブエージェント階層——圧縮・分類・DB クエリ・コーディング補助を担うモデル——が、6 か月前には想像もできなかった価格の下限に達したところを扱います。同じ発表で同時に実施された Sonnet 5.5 のキャッシュ読み取り半額は、直接的な姉妹データポイントです。トークン効率のテーマに、キャッシュ読み取りが支配的なエージェントワークロードでミッドティアを 20% 安くする価格変更が加わりました。
サブエージェント階層は同一価格の 3 プロバイダー市場になった
2026 年 10 月 8 日時点の小模型ティアの価格表:
| モデル | 入力 $/M | 出力 $/M | タイプ | プロバイダー |
|---|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.50 | frontier closed | OpenAI |
| Claude Haiku 5.5 | $0.10 | $0.50 | frontier closed | Anthropic |
| GLM-5.3-Flash | $0.15 | $0.50 | オープンウェイト | Z.ai |
出力価格は 3 社とも同一です。frontier closed の 2 モデルとオープンウェイトモデルの入力差は 100 万トークンあたり 0.05 ドル——5 万トークンの会話コンテキストを圧縮するサブエージェントでは 0.0025 ドルの差にすぎません。誤ったサブエージェントを選択するコストは、1 日あたりドル単位ではなく、タスクあたり数セント未満で測定される水準になりました。
2026 年 10 月 8 日時点のサブエージェント階層の価格環境:
Yahoo Finance は Haiku 5.5 の公開を「AI 価格戦争の激化」と位置づけました(Yahoo Finance、10月7日)。この表現は正確ですが、実際に起きたことを過小評価しています。価格戦争は、同じ製品上でのマージン圧縮を意味します。実際に起きたのは、サブエージェント階層——エージェントのトークン消費の大半が発生する層——が、以前は最も安いオープンウェイトモデルだけが提供していた価格水準まで崩れたということです。frontier closed モデルとオープンウェイトモデルは、出力トークンについて同一の価格点に並びました。「frontier のサブエージェントを使うべきか、オープンウェイトのサブエージェントか」は、もはやコストの問いではありません。
変わったこと:サブエージェントが有能になった
価格は話の半分にすぎません。アーキテクチャ決定を変えるのは、Haiku 5.5 のベンチマーク躍進のほうです:
- OSWorld 2.1(オフラインサブセット): 72.4% — Haiku 4.5 の 15.7% から 4.6 倍の改善。GPT-6 Luna は 48.9%。サブエージェントは、12 か月前にはフラッグシップティアだった水準で、コンピュータを操作してマルチステップのタスクを完遂できるようになりました(Anthropic)。
- Terminal-Bench 4.0: 39.2% — Haiku 4.5 の 0.0% から躍進。GPT-6 Luna は 16.4%。サブエージェントは、前世代が着手すらできなかった複雑なコマンドラインタスクを完遂できるようになりました(Anthropic)。
- FrontierCode 1.1(Main): 46.4% — GPT-6 Luna の 42.4% を上回り、xhigh の Sonnet 5.5(52.1%)には及びません。サブエージェントは、コーディングの補助役として運用できる水準のプロダクションコードを書きます——Cognition は Devin Fusion の sidekick としてこのモデルを出荷し、低コスト・低レイテンシでトップティアの FrontierCode スコア 66.2 を維持しています(Anthropic)。
- HubSpot CRM タスクスイート: 92.8% — HubSpot がシミュレートされたポータル型 CRM 評価で測定した中で最高のスコア。サブエージェントは、陳腐化しているが曖昧なレコードを、テストしたすべてのモデルの中で最も高い命中率と最も低い偽陽性率で特定します(Anthropic)。
HubSpot のデータポイントはベンチマークを超えて重要です。HubSpot は、CRM 自動化タスク向けに frontier の小模型を評価している主要 CRM プラットフォームです——これはカスタム MCP モジュールが対象とするまさにそのユースケースです。サブエージェント階層が 0.10 ドル/M 入力のコストで、92.8% の精度で陳腐化した CRM レコードを特定できるとき、商談パイプラインを 24/7 監視するエージェントの運用コストは、予算科目から丸め誤差へと落ちます。
調整可能な effort:同じモデルで 5 つの価格点
Haiku 5.5 は、effort 設定を調整できる最初の Haiku クラスのモデルです。low・medium・high・xhigh・max の 5 段階。これは、DeepSeek の自動ルーティング分析が、ルーティングが不可視のときの調達リスクとして指摘したのと同じ、設定可能コストのパターンです——ただしここでは制御がオペレーター側にあります。会話コンテキストを圧縮するサブエージェントは low effort でタスクあたり 0.002 ドルで実行できます。同じモデルが、より難しいデータベースクエリのために max effort で実行することもできます。タスク単価の曲線は、固定レートではなくダイヤルになりました。
推論調達への含意は直接的です。モデルとレートカードだけを名指しする契約には、effort 設定を制御する手段がありません。max effort で動くエージェントは、同じエージェントが medium で動くときより多くのトークンを消費します——そしてオペレーターが目にするのは請求書だけです。Sonnet 5.5 の記事が推奨した 4 つの契約条項(effort レベルの固定、代替モデルの disclosure、キャッシュ読み取りの価格フロア、トークン量の上限)は、effort のダイヤルがサブエージェント階層にも存在する以上、ここにもそのまま適用されます。
Sonnet 5.5 のキャッシュ読み取り半額:ミッドティアも安くなった
同じ発表で、Sonnet 5.5 のキャッシュ読み取りが 100 万トークンあたり 0.20 ドルから 0.10 ドルに半額になりました。キャッシュ読み取りは、エージェントのトークン消費の大きな割合を占めます——毎ターン同じシステムプロンプト、ツール定義、会話履歴を再読み込みするエージェントは、入力や出力の項目よりもキャッシュ読み取りの項目を多く叩きます。エージェント支出を支配する項目の 50% カットは、Sonnet 5.5 の総エージェントコストの約 20% 削減に相当します(Anthropic)。
これはエージェントのアーキテクチャ決定にも関係します。0.10/0.50 ドルのサブエージェント階層が圧縮・分類・補助作業を担い、2/10 ドルのミッドティア(キャッシュ読み取り半額済み)が複雑なエージェントコーディングとマルチステップ推論を担い、4/20 ドルのフラッグシップティアが最も難しいタスクを担います。3 層スタックは、安価なサブエージェント、安いキャッシュを持つ有能なミッドティア、強力なフラッグシップと、きれいに価格が並びました。always-on の本番エージェント向けにスタック全体を稼働させるコストは、10 月 7 日に大きく下がりました。
これがビルドに何を意味するか
推論経済学の分析が確立したのは 10:1 の比率です。モデル支出 1 ドルにつき、プロセス・ガバナンス・統合の作業に 10 ドル。Haiku 5.5 の公開はこの比率をさらに広げます。モデルは 90% 安くなりました。統合レイヤーは安くなっていません。エージェントを NetSuite に接続する MCP モジュール、代替部品を解決するナレッジグラフ、すべてのツール呼び出しを記録する監査ログ——これらのコストは変わっていません。モデルが総ビルドコストに占める割合は、1 週間前より小さくなりました。
これが調達の洞察です。サブエージェント階層の価格崩壊は、エージェントシステムの構築を安くするのではありません。運用を安くするのです。つまり、統合レイヤーをすでに構築済みのチームは、未構築のチームより大きなコスト削減を得ます。型付き MCP モジュール、ナレッジグラフ、human-in-the-loop のチェックポイントを備えた本番 RFQ エージェントを運用するチームは、月次推論請求が一夜にして 75% 下がります。統合レイヤーを構築していないチームには変化が見えません——コストが住んでいるのは統合レイヤーだからです。
関連記事
- 30% 安いタスク単価は 7 倍のトークンを消費:Sonnet 5.5 の効率の罠 — タスク単価をめぐって競合する 3 つのリリース戦略を整理した親記事。キャッシュ読み取り半額は直接的な姉妹データポイント
- 推論経済学:always-on の本番エージェントが今や手頃な理由 — 統合コストとモデルコストの 10:1 比率。サブエージェント階層の崩壊は差をさらに広げる
- GLM-5.3-Flash:フラッグシップ価格の 10 分の 1 で Claude Opus 4.8 に迫る 320B オープンウェイトモデル — コスト崩壊テーマのオープンウェイト側。0.15/0.50 ドルの GLM-5.3-Flash は 3 プロバイダーのサブエージェント階層における第 3 のベンダー
NetSuite・BigCommerce・3 のサプライヤーカタログを運用する地域ディストリビューターは、週 200 件の RFQ を処理しています。見積もりエージェントは、カタログ検索と価格ティア分類のサブエージェントとして Haiku 5.5 を、見積もり起草のステップとしてキャッシュ読み取り半額の Sonnet 5.5 を、代替部品の解決としてナレッジグラフを活用します。10 月 7 日、スタック全体の月次推論コストは 75% 下がりました——約 4,000 ドルから 1,000 ドル未満へ——統合コードは 1 行も変更せずに。コスト削減を現実にしているのは、MCP モジュール、ナレッジグラフ、監査ログです。モデル価格は、簡単な部分です。
スコープを限定したビルドのご依頼
1 週間のディスカバリー。システムインベントリ、ワークフローマップ、固定スコープをお渡しします。私どもでビルドするかどうかは問いません。
あなたのシステムのためにこれを構築したいですか?
ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。
スコープ付き構築を依頼1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。