ライブラリに戻る
戦略

タスクあたり30%安いのに7倍のトークン消費:Sonnet 5.5の効率の罠

最終更新:2026年9月27日

ポイント

  • Sonnet 5.5の「タスクあたり最大30%安い」という見出しは、低・中エフォートでは成立しますが、最大エフォートで逆転します:Anthropicは同じ$2/$10の価格表を請求しながら、モデルはインデックスタスクあたり約193,000出力トークンを消費——Artificial Analysisが測定した中で最も重いトークン請求——実測コストは1タスク$7.60で、Sonnet 5より約50%、Opus 5.5の$5.98より約27%高くなりました(Anthropic、9月28日;Artificial Analysis、9月28日)。
  • 同じリリース期間に正反対の2つの戦略が登場しました:OpenAIは9月22日、GPT-6 Sol/Lunaの価格を50%引き下げて$2/$10および$0.10/$0.50(百万トークンあたり)としました——GPT-6 Solの最大エフォートはIntelligence Indexタスクあたり$1.06で、前世代より約50%安い——一方AnthropicはSonnetの価格表を据え置き、トークン請求の増加を放置しました(OpenAI;Artificial Analysis)。
  • Opus 5.5(9月22日)は3つ目の道を選びました:定価20%引き、キャッシュ読み取り60%引き($0.50 → $0.20/百万)で、エージェントワークロードが支配する勘定項目を狙った——だからこそ実測$5.98/タスクは、最大エフォートでは自社の弟分を下回るのです(Anthropic;Finout)。
  • 高〜最大エフォートでは、Sonnet 5.5はコスト効率フロンティアから外れます:GPT-6 Solは「実質同じタスクあたりコスト」でほぼ同等の知能を提供し、GPT-6 Lunaの最大エフォートは同等の知能の仕事を$0.07/タスクで行います——Sonnet 5.5最大の請求の約100分の1です(Artificial Analysis、9月28日)。
  • 追跡対象672モデルのうち9月に約180モデルで価格変更がありました——価格表は今や月次のリスクであり、トークン単価しか契約に書いていないエージェントには、承認していないモデル交換に対する防御がありません(pricepertoken、9月28日;DeepSeekの自動ルーティング撤回が実例です)。

Anthropicは9月28日、市場で最もクリーンなコスト主張とともにClaude Sonnet 5.5をリリースしました:「Claude Sonnet 5に対する明確なアップグレードであり、30%以上速く、ほとんどの作業で最大30%安い。」すべての言葉が正当化できます——しかし、そのメカニズムは見出しが示唆するものではありません。価格表は動きませんでした:入力$2/百万トークン、出力$10、キャッシュ読み込み$0.20で、Sonnet 5と同一です。変わったのはトークン請求であり、エージェントワークが実際に使うエフォートレベルにおいて、主張とは逆方向に動きました。Artificial Analysisはリリース当日にモデルを実行しました:最大エフォートで、Sonnet 5.5はIntelligence Indexタスクあたり約193,000出力トークンを消費——同社のテスト史上最高で、Opus 5.5最大の約60%増、GPT-6 Astraの約7倍——実測コストは$7.60/タスクとなりました(Artificial Analysis、9月28日;kingy.aiチームが最初に記録:「Sonnet 5.5はトークン単価では安いが、タスク単価では高くつくことがある」)。

それ自体は1つのモデルの特異性です。しかし同じ2週間の期間に照らして読むなら、それは業界の分岐点です。9月22日、OpenAIはGPT-6 SolとLunaの価格を50%下げ(OpenAI)、AnthropicはOpus 5.5のキャッシュ読み込みを60%引き下げました(Anthropic)。その6日後、Anthropicの「30%安い」という参入は、競合が半額で売るのと同じトークン量を定価でpricingしました——トークンを安く買うのではなく、トークンを多く消費してインデックス第2位の能力を買ったのです。3つのリリース戦略が今、同じ指標——タスクあたりコスト——で競合しており、それぞれが最も乖離する箇所は、まさに推論調達ガイドの存在する場所です。本記事では、Artificial Analysisの実測数値に照らして3つの戦略をマッピングし、トークン単価の価格表が隠すトークン効率の算術を計算し、次のモデル交換がエージェントの請求を静かに再価格付けする前に必要な4つの契約条項で締めくくります。

主張、メカニズム、測定

Anthropicの主張は効率性に関するものであり、リリースページはメカニズムを明示しています:モデルは「同じ作業をするのに通常はるかに少ないトークンで済む。我々のテストでは、前代比でタスクあたり最大30%安い」とされています。これはAnthropic自身のテスト分布、Anthropic自身が選んだ設定において真です——同社は、Sonnet 5.5が低・中エフォートにおいて「タスクあたり約10分の1のコストで」Sonnet 5の最高ベンチマークスコアを上回ると報告しています(kingy.aiによる要約)。ワークロードが軽量でAnthropic型——短い草稿、分類、限定された検索——であれば、この主張はあなたの請求書でも成立する可能性が高いでしょう。

エージェントのワークロードはその分布ではありません。Artificial Analysis Intelligence Indexは5つのエフォート設定で多段階タスクを実行し、モデルのアダプティブ推論は難しいタスクでエフォートを引き上げます。その範囲の頂点でトークン請求は爆発します:最大エフォートでタスクあたり約193k出力トークン。これはSonnet 5最大・Opus 5.5最大の約120k(約+60%)、GPT-6 Astra最大の約27k(約7倍)に対するものです。トークンの量こそがポイントです——Sonnet 5.5(最大)はインデックスで56点、Opus 5.5の58点に2点差、Terminal-Bench 4.0は64%でOpus 5.5とGPT-6 Astraをわずかに上回ります。より長く考えることでこの能力に到達し、出力トークンはひとつひとつがどれほど正当化されようと、一律$10/百万で課金されます。フォールバックの脚注がメカニズムを補完します:Anthropicのデフォルトのアダプティブルーティングは「タスクの約0.1%でフォールバックする……すべての場合においてSonnet 5へフォールバックする」——価格表に中立なもう一つの置換であり、オペレーターがそれを目にするのは請求書の上だけです(Artificial Analysis)。

タスクあたりコストは、この構造との接触に耐える唯一の指標です。なぜなら価格表とトークン請求を合成するからです。同日測定、いずれもIntelligence Index最大エフォートでのタスクあたりコスト:

モデル(最大エフォート) 定価($/M、入力/出力) 出力トークン/タスク 実測コスト/タスク リリース戦略
Claude Sonnet 5.5 $2 / $10 ~193k $7.60 能力主導:価格表据え置き、トークン請求増
Claude Opus 5.5 $4 / $20(キャッシュ $0.20) ~120k $5.98 キャッシュ主導:定価−20%、エージェント項目−60%
Claude Sonnet 5 $2 / $10 ~120k ~$5.00 基準
GPT-6 Sol $2 / $10 ~31k $1.06 価格主導:定価−50%
GPT-6 Luna $0.10 / $0.50 ~51k $0.07 価格主導:フロアレート

(AA Intelligence Index v4.xのスコア:Sonnet 5.5が56で第2位;Opus 5.5が58で第1位;GPT-6 Solはコーディングエージェント作業で約56クラス相当。スコアには系統の注意書きが付きます——AAは今年すでに2回インデックスをリベースしているため、スコアは同一ソースの公開間でのみ引用すること。)

罠は1行目と3行目にあります:定価は同じ、実測コストは7.6倍離れています。価格表に基づく調達判断——「Sonnet 5.5はSonnet 5と同価格だから経済的なアップグレードだ」——は、請求書の正反対を生みます。そして実測ランキングは直感を2度目に逆転させます:テーブル上で最も定価の高いもの(Opus 5.5、$4/$20)が、より安いタスクなのです。そのキャッシュ読み込みの引き下げが、エージェントワークロードが実際に支配する勘定項目——タスクあたり何千回もの長いコンテキストの再読み込み——を狙い撃ちにしたからです(Anthropic:「キャッシュ読み込み(エージェントおよびコーディング作業コストの大部分を占める)は$0.20/百万トークン」)。

3つのリリース戦略、1つの戦場

9月の期間は、6月以来価格戦争が示唆してきたことを定型化しました:トークン単価はもはやベンダーが競争する場所ではありません。トークン単価はほぼ無料になったからです。戦場はタスクあたりコストへ移り、各ラボはそれぞれ異なる武器を選びました。

能力主導(Anthropic、Sonnetライン)。 旧価格表のままフロンティア近傍のモデルを出荷し、ベンチマーク表で勝つ。トークン請求が60%重いSonnet 5.5の第2位は、この戦略の最も純粋な形です:知能の向上は本物(最大エフォートでSonnet 5比+18インデックスポイント)であり、そのコストは請求書のトークン行に着地します。そこでは「30%安い」と「$7.60」が技術的には両方とも真です。この戦略は、買い手が見出しとベンチマークを読み、トークン量を無料財として扱うことに賭けています——そしてガートナーの9月16日予測が、2026年の世界AI支出が49.5%増の$2.7Tになると予測し、エージェント・アシスタントセグメントが$16.5B → $29.2B → $65.5Bの軌道を描くとするなら、この賭けには現実の観客がいます。

価格主導(OpenAI、Sol/Lunaライン)。 定価を半額にし、タスクあたりの算術を自分で公開する。OpenAIのリリース表は、どのモデルリリースよりも調達可能な形になっています:GPT-6 Sol(xhigh)は33.2%のスコアを$0.27/タスクで達成し、Claude Opus 5(最大)は26.9%で11.1倍のコスト。Artificial Analysis側では、GPT-6 Sol最大は自前の前代の$1.99を半減させて$1.06にし、コーディングエージェントインデックスで2ポイント獲得しました(Artificial Analysis)。この戦略は、測定・公開されたタスクあたりコストが未来の調達指標になると賭けています——そして効率に自信のあるベンダーは、コスト比較を労力なしにすることで調達に勝つと考えています。

キャッシュ主導(Anthropic、Opusライン)。 フロンティア価格を維持し、エージェントコストの駆動要因を空にする。Opus 5.5の$0.50から$0.20へのキャッシュ読み込み引き下げは、エージェントのトークンが存在するワークロードの形状——大きく安定したコンテキストの反復読み込み——を正確に狙っています。Anthropicは典型的な作業で総コスト約40%減と見積もっており(Fello AIによるリリース主張の要約)、実測の$5.98/タスク対$7.60がその方向を独立に裏付けています。

同じ指標、正反対の3つの戦略。 2026年9月リリースの実測タスクあたりコスト(最大エフォート)· Artificial Analysis 実測タスクあたりコスト(最大エフォート) $7.60 Sonnet 5.5 タスクあたり193k出力トークン $5.98 Opus 5.5 キャッシュ読み込み60%引き ~$5.00 Sonnet 5 「前代」の基準 $1.06 GPT-6 Sol 定価50%引き $0.07 GPT-6 Luna フロアティア 最大エフォートのSonnet 5.5はGPT-6 Sol最大の7.2倍のコスト——同一の$2/$10価格表で 3つのリリース戦略、2026年9月 能力主導 — Anthropic Sonnet 5.5 価格表は$2/$10で据え置き。長く考えることで インデックスを獲得(第2位、スコア56): タスクあたり193kトークン、AAが測定した中で 最も重い。コストは請求書の トークン行に着地する。 ベンチマークが見出しを買う 価格主導 — OpenAI Sol / Luna 定価を半減(9/22)、リリース投稿で タスクあたり算術を公開: Sol xhighは$0.27/タスク、Opus 5最大の 11.1倍のコストに対し。Luna:Fable 5より タスクあたり96%安い。 公開数字による調達 キャッシュ主導 — Anthropic(Opus) Opus 5.5 定価−20%、キャッシュ読み込み−60% ($0.50 → $0.20)。エージェントワークロードが 支配する勘定項目を狙う: 「キャッシュ読み込み……エージェントおよび コーディング作業コストの大部分を占める」 兄が弟を逆転で下回る 価格表が隠す算術 — 200ステップのワークロード、1日1,000ステップ Sonnet 5.5最大:週1,200ステップ x 193k出力トークン = 週231.6M出力トークン x $10/M = 週$2,316 同じワークロードをGPT-6 Sol最大で:31kトークン → 週$121。Sonnet 5最大:120kトークン → 週$1,200。 このプロファイルでは「30%安い」モデルは自前の前代比1.9倍のコスト —— 価格表は決して変わらず、トークン列が変わった。 エフォート設定は請求を30倍動かす — 上限で契約する トークン単価は誤った調達指標です。タスクあたりコストで契約するか、交換があなたの請求を選びます。 ステップごとにモデルIDを固定 · サーキットブレーカーでタスクあたりトークンを上限化 · 要求モデルではなく提供モデルを記録 · 公開されたタスクあたり価格を要求 DeepSeekの45時間での撤回は、4つのすべてが必要——しかし単独ではどれも十分でない——ことを証明しています。 Sonnet 5.5最大 $7.60/タスク · Opus 5.5 $5.98 · Sonnet 5 ~$5.00 · GPT-6 Sol $1.06 · GPT-6 Luna $0.07 出典:Artificial Analysis(9/22 + 9/28)· Anthropic · OpenAI — ideabosque.com

図のポイントは棒グラフではなく算術ボックスです:価格表は百万あたりの価格であり、タスクあたりコスト契約は産出あたりの価格です。週1,200回実行される200ステップのワークロードでは、Sonnet 5.5最大はステップあたり193k出力トークンを消費し、週約$2,316を請求します。一方GPT-6 Solはほぼ同等の実測知能で$121です(両者ともインデックスで55前半のスコア;Solのコーディングエージェント経済性は$2.99/タスクで、AAのコーディング指数分析によればパレートフロンティア上にあります)。「30%安い」モデルとその前代の週次差額は約$1,100——「最大30%安い」という主張と2倍のコスト増が同時に真であるのは、エフォート分布だけで区別されます。だからこそ契約がリリース投稿より重要なのです。

9月がさらに難しくした調達問題

2つの構造的事実が、これを論評から契約言語へ変えます。第一に、価格表のリスクは今や月次です:pricepertokenは9月に追跡対象672モデルのうち約180モデルの価格変更を読み取り(カウンターの月内ドリフト:178/672 → 181/671)、LLM Gatewayのタイムラインは今月15プロバイダーの23新モデルを列挙しています——エージェントが8月に実行した請求は、10月に実行する請求ではありません。第二に、置換レイヤーはすでに製品として出荷されています:LLM GatewayのSmart Routeが9月25日にリリースされ、ベンダー側のルーティングが購入可能な機能になりました。そしてAnthropicのアダプティブフォールバック(「タスクの約0.1%でフォールバック、主にTerminal-Benchにおいて、すべての場合でSonnet 5にフォールバックする」AAのテストによる)は、モデル呼び出し内部の同じメカニズムです。どちらも不正行為ではありません——DeepSeekの一件が示したのは、ベンダーはフリート全体のモデル置換を宣言し、ユーザーの圧力を受けて45時間後に撤回することさえできるということです。ルーティングの決定は現実のものであり、ランタイムを握る者のものです。

そのような背景の下で、価格表に基づく購買には3つの具体的な失敗モードがあります:

  1. ベンチマーク見出しの失敗。 Sonnet 5.5は、能力ストーリー(インデックス第2位、Terminal-Bench 4.0で64%)とコストの物語(タスクあたり30%安い)の両方で同じリリースの首位に立ちます——どちらも真であり、しかし異なる基準に対して構成されています。リリース投稿とベンチマーク表は読むがトークン列を読まない調達プロセスは、テーブル上で最も高価なタスクあたりコストの構成を承認してしまいます。
  2. エフォート・ブラインドな予測。 公表されているコスト算術の大半は、公表された設定を想定しています。AAの掃き測定は、Sonnet 5.5の請求がエフォートによってスイングすること(最大$7.60対Sonnet 5の約$5.00;「30%安い」という主張が存在する低・中設定)を示しています。APIデフォルトに基づく予測は、ベンダーのSDKエスカレーションロジックがタスクごとに選ぶ設定をそのまま引き継ぎます。
  3. キャッシュ・ブラインドな単価。 30日違いの2つのAnthropicモデルは逆の軸を選びました——Sonnet 5.5はトークンを高価なままにし、Opus 5.5はキャッシュされた読み込みを安くしました。エージェントワークロードの実際のキャッシュヒット率(長く安定したシステムプロンプト;繰り返されるツールスキーマ;大きな取得コンテキスト)が、どちらが安いかの最大の単一決定要因になっています——ほとんどのRFQプロセスが決して尋ねない数字です。

どれもベンダーの欺瞞ではありません。3つすべてが、単位経済が自らの価格言語の下で移動した市場の通常の産出です——AAが一行で到達した同じ結論です:「Sonnet 5.5はトークン単価では安いが、タスク単価では高くつくことがある。」

契約:次のリリースを生き延びる4つの条項

解決策は勝つラボを選ぶことではありません。タスクあたりコストでは勝者は週ごとに変わります(pricepertokenのカウンターは月ごとに動きます)。解決策は決定を計装して、次の交換を請求書の驚きではなく測定された構成変更にすることです。4つの条項は、このサイトがすべてのエージェントに組み込むのと同じランタイムに対応します:

1. ステップごとにモデルIDを固定し、要求されたモデルではなく提供されたモデルを記録する。 ルーティングレイヤーはオペレーターインフラです。modelフィールドはあなたのエージェント構成内に存在します——私たちの参照ランタイムでは、エージェントはprovider + nameで登録済みモデルリソースを参照し、モデル変更は再デプロイではなくデータ操作です。監査証跡はツール呼び出しごとに実際に提供されたモデルを記録します(DeepSeekの記事が事件パターン全体をカバーしています)。あなたのモデルを静かに交換するベンダーは、今や見える差分を生み出します。

2. 月次請求のトークン単価ではなく、週次上限つきのタスクあたりコストで契約する。 タスクあたり価格は公開された一次指標になりつつあります(OpenAIはリリース表で公開し、AAは同じタスクで全員を測定します)。スコープされた契約は、ワークロード(ステップ数、コンテキスト形状、期待キャッシュヒット率)、ステップクラスごとのモデルとエフォートティア、実測のタスクあたり上限を明示します——ベンダーの公開タスクあたり価格をベンチマーク行として。 6コストベクトルのフレームワークが監査チェックリストを提供します。第5ベクトル(ベンダー置換リスク)こそ、このセクションが運用化する条項です。

3. エフォートダイヤルを開発者設定ではなく調達面として、トークンを予算化する。 エフォートレベルを横断するSonnet 5.5の30倍の請求スイングは具体例です。ルーティングレイヤーは推論エフォートを、ステップクラスごとの型付き構成フィールドとして扱うべきです——エスカレーション閾値は明示し、上限はランタイムでハードストップ(長時間実行エージェントのコスト上限パターン)、エスカレーションポリシーを監査証跡に可視化します。日1,200ステップにわたる「最大エフォート」のデフォルトは、なされたことのない調達決定です。

4. フリートを委ねる前に、自分のワークロードで主張された効率をテストする。 Anthropicの「最大30%安い」は誠実で、スコープされ、ワークロード条件付きです——そしてAAの対抗測定$7.60もまた誠実で、スコープされ、ワークロード条件付きです。どちらもあなたの請求書を教えてはくれません。30分のパイロット:実際のエージェント実行の1週間を取り、候補モデルに対して各エフォートティアで再生し、ステップごとにトークンとキャッシュヒット率を測定し、3つの数字(価格表、トークン請求、実測タスクあたり)を調達の1ページ資料に載せるのです。TypeSafe Jevの3層スタックはこれを継続的にします——較正された決定層分類器がステップクラスごとの請求を見張ります。監視者はコールあたりほぼ無料だからです。

上記のすべて——算術ボックスを含めて——に適用される誠実さのマーカーがあります:実測タスクあたり数値はすべて、2つの独立した同日テストソース(AA、kingy.ai)とベンダー公開表に基づき、ベンチマークタスク上のものであって、あなたのワークロードではありません。AAのIntelligence Indexは今年すでに2回リベースされています。ここで引用したスコアとコストは同一公開日内の比較であり、次のリベースで変わり得ます。これをすべて、パイロットが置き換える出発基準として扱ってください——方向(価格表≠請求、トークンこそが変数)は安定していますが、正確な定数は違います。

実プロファイルでの結果

このサイトが書いてきたミッドマーケットのビルドプロファイルで数字を実行します:ディストリビュータの見積もりエージェント、週200件のRFQ、カタログ検索、ティア価格付け、ナレッジグラフ代替品、ドラフト生成を横断する週約1,200モデルステップ。Sonnet 5.5最大では、このプロファイルは週約$2,300を請求します。意図的にルーティングすれば——ネゴシエーション関連ステップにのみフロンティアエフォート、検索にミッドティアモデル、分類にフロア近傍モデル、キャッシュヘビーなコンテキストをステップ間で共有——同じワークロードは週$300未満となり、品質はビジネス成果が実際に存在する場所に集中します:顧客が目にする見積もりです。87%の差はモデル選定の腕ではありません。ランタイムが、リリース投稿があなたのために決めたことのないコスト決定を強制した結果です。これらのボリュームでは、統合レイヤー——MCPモジュール、ルーティングポリシー、監査証跡——がトークン単価の価格表では価格付けできないビルドの90%であり続けます。モデル請求はノイズであり、上記のパターンがそれをシグナルではなくノイズであり続けさせる方法です。

関連記事


NetSuiteとBigCommerceを運用する中堅ディストリビュータが、ガバナンスされたエージェントスタックで週200件のRFQを見積もります:ERPと3つのサプライヤカタログのためのMCPモジュール、部品代替品のナレッジグラフ、アベイラビリティホールドを扱うRFQエンジン——そしてステップクラスごとにモデルIDを固定し、タスクあたりトークンを上限化し、すべてのコールで提供モデルを記録するルーティングレイヤー。次のリリース投稿が「30%安い」と主張したとき、このレイヤーは1週間のリプレイパイロットを実行し、調達の1ページ資料は形容詞ではなく3つの数字を得ます。最初のエージェントは5〜8週間で稼働します。

スコープされたビルドを依頼する。 1週間のディスカバリー。当社と構築するかどうかにかかわらず、システムインベントリ、ワークフローマップ、固定スコープを入手できます。

あなたのシステムのためにこれを構築したいですか?

ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。

スコープ付き構築を依頼

1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。