號稱每任務便宜 30%,卻多花 7 倍 Token:深入 Sonnet 5.5 的效率陷阱
要點
- Sonnet 5.5 的「每任務最多便宜 30%」在低與中努力等級成立,但在最高等級反轉:Anthropic 收同樣的 $2/$10 價目表,而模型每個索引任務消耗約 193,000 輸出 Token——Artificial Analysis 測過的最重 Token 用量——實測成本 $7.60 每任務,比 Sonnet 5 高約 50%,比 Opus 5.5 的 $5.98 高約 27%(Anthropic,9/28;Artificial Analysis,9/28)。
- 同一發布窗口出現了兩種相反的策略:OpenAI 於 9 月 22 日將 GPT-6 Sol/Luna 價格下調 50% 至 $2/$10 與 $0.10/$0.50 每百萬 Token——GPT-6 Sol 最高檔每 Intelligence Index 任務 $1.06,比前代低約 50%——而 Anthropic 保持 Sonnet 價目表不動,任由 Token 帳單上漲(OpenAI;Artificial Analysis)。
- Opus 5.5(9 月 22 日)走了第三條路:標價打 8 折、快取讀取降 60%($0.50 → $0.20 每百萬),瞄準代理工作負載佔主導的那一項——這正是它實測每任務 $5.98 在最高檔反而低於自家後輩的原因(Anthropic;Finout)。
- 在高到最高檔,Sonnet 5.5 偏離成本效率前緣:GPT-6 Sol 以「實質相同的每任務成本」提供接近的智能,GPT-6 Luna 最高檔以每任務 $0.07 做等智能的工作——約為 Sonnet 5.5 最高檔帳單的百分之一(Artificial Analysis,9/28)。
- 672 個被追蹤的模型中,9 月約有 180 個發生價格變動——價目表已成為月度風險,而一份只按 Token 定價簽約的 Agent,對未經它同意的替換毫無防禦(pricepertoken,9/28;DeepSeek 自動路由反轉是完整案例)。
Anthropic 於 9 月 28 日發布 Claude Sonnet 5.5,帶著市場上最乾淨的成本主張:「相比 Claude Sonnet 5 是一次清晰升級,快 30% 以上,大多數工作最多便宜 30%。」每個字都站得住——但其機制並非標題所暗示的那樣。價目表沒有動:輸入 $2/百萬 Token,輸出 $10,快取讀取 $0.20,與 Sonnet 5 完全相同。變的是 Token 帳單,而且在該代理工作實際使用的努力等級上,它朝主張的反方向移動。Artificial Analysis 在發布當天就執行了該模型:最高努力等級下,Sonnet 5.5 每個 Intelligence Index 任務消耗約 193,000 輸出 Token——他們測試史上最高,比 Opus 5.5 最高檔高約 60%,約為 GPT-6 Astra 的 7 倍——實測成本 $7.60 每任務(Artificial Analysis,9/28;kingy.ai 團隊率先記錄:「Sonnet 5.5 按 Token 便宜,但按任務可能很貴」)。
孤立地看,這是單一模型的怪癖。放到同一兩週窗口裡讀,這就是產業的岔路口。9 月 22 日,OpenAI 將 GPT-6 Sol 與 Luna 價格砍半(OpenAI),Anthropic 將 Opus 5.5 快取讀取降 60%(Anthropic)。六天後,Anthropic 以「便宜 30%」的姿態入場,對同一 Token 量的定價是競爭對手以半價出售的水平——它用花錢買 Token 的方式換取索引第 2 的能力,而不是把 Token 買便宜。三種發布策略現在在同一個指標上競爭——每任務成本——而它們分歧最大的地方,恰好是推理採購指南所在之處。本文將三種策略對照 Artificial Analysis 的實測數字逐一拆解,算清按 Token 價目表所隱藏的 Token 效率算術,並以四條合約條款收尾,讓下一次模型替換無法靜默重定價你的 Agent 帳單。
主張、機制與測量
Anthropic 的主張是關於效率的,而且發布會頁面明確說明了機制:模型「通常只需少得多的 Token 即可完成同樣的工作。在我們的測試中,每任務成本比前代最多低 30%。」這在 Anthropic 自己的測試分佈、Anthropic 自選的設定上是真的——該公司報告 Sonnet 5.5 在低與中努力等級下「以約十分之一的每任務成本」超越 Sonnet 5 的最佳基準分數(據 kingy.ai 概述)。如果你的工作負載是輕量且 Anthropic 形狀的——短草稿、分類、有界查詢——這個主張大概率會在你的帳單上成立。
代理式工作負載不是那個分佈。Artificial Analysis Intelligence Index 在五個努力等級下執行多步任務,模型的自適應推理會在難題上升級努力等級。在那個範圍頂端,Token 帳單爆炸:最高檔約每任務 193k 輸出 Token,對比 Sonnet 5 最高檔與 Opus 5.5 最高檔的約 120k(約 +60%)、GPT-6 Astra 最高檔的約 27k(約 7 倍)。Token 量正是要點——Sonnet 5.5(最高檔)在索引上得 56 分,落後 Opus 5.5 的 58 分 2 分,Terminal-Bench 4.0 為 64%,略高於 Opus 5.5 與 GPT-6 Astra。它透過每一步想得更久來達到該能力,而輸出 Token 一律按每百萬 $10 計費,不管每一個有多站得住腳。一條回退腳注補全了機制:Anthropic 預設的自適應路由「在約 0.1% 的任務中回退……所有情況均回退至 Sonnet 5」——又一次對價目表中立的替換,操作者只能在發票上看到它(Artificial Analysis)。
每任務成本是唯一能經受住這一結構檢驗的指標,因為它把價目表與 Token 帳單合成到一起。同日實測,全部為 Intelligence Index 最高檔的每任務成本:
| 模型(最高檔) | 標價($/M 輸入/輸出) | 輸出 Token/任務 | 實測成本/任務 | 發布策略 |
|---|---|---|---|---|
| Claude Sonnet 5.5 | $2 / $10 | ~193k | $7.60 | 能力主導:價目表不動,Token 帳單上行 |
| Claude Opus 5.5 | $4 / $20(快取 $0.20) | ~120k | $5.98 | 快取主導:標價 −20%,代理項 −60% |
| Claude Sonnet 5 | $2 / $10 | ~120k | ~$5.00 | 基線 |
| GPT-6 Sol | $2 / $10 | ~31k | $1.06 | 價格主導:標價 −50% |
| GPT-6 Luna | $0.10 / $0.50 | ~51k | $0.07 | 價格主導:地板價 |
(AA Intelligence Index v4.x 得分:Sonnet 5.5 得 56 排名第 2;Opus 5.5 得 58 排名第 1;GPT-6 Sol 在編碼代理工作上約等於 56 檔。得分帶有譜系警示——AA 今年已兩次重定索引基線,僅在同一來源的發布之間引用得分。)
陷阱在第一行與第三行:標價相同,實測成本相差 7.6 倍。一項基於價目表的採購決策——「Sonnet 5.5 與 Sonnet 5 同價,所以是經濟的升級」——得出與帳單完全相反的結論。而實測排名第二次反轉了直覺:桌上標價更貴的那個(Opus 5.5,$4/$20)反而是更便宜的任務,因為它的快取讀取降價打擊了代理式工作負載真正主導的科目——每個任務數千次重讀長上下文(Anthropic:「快取讀取(佔代理與編碼工作成本的大頭)為 $0.20 每百萬 Token」)。
三種發布策略,同一個戰場
9 月的窗口把價格戰從 6 月以來的暗示變成了明文:每 Token 價格不再是供應商競爭的地方,因為每 Token 價格已近乎免費。戰場移到每任務成本,各家實驗室選了不同的武器。
能力主導(Anthropic,Sonnet 線)。 用舊的價目表發一個接近前沿的模型,贏下基準表。Sonnet 5.5 排第 2、Token 帳單重 60%,是這一策略最純粹的形式:智能提升是真實的(最高檔比 Sonnet 5 高 +18 個索引點),而它的成本落在發票的 Token 一欄,在那裡「便宜 30%」和「$7.60」在技術上同時為真。該策略賭的是買家看標題和基準、把 Token 量當贈品——而據蓋特納 9 月 16 日預測,2026 年全球 AI 支出增長 49.5% 至 $2.7T,agents-and-assistants 細分沿 $16.5B → $29.2B → $65.5B 的路徑增長,這個賭注有真實受眾。
價格主導(OpenAI,Sol/Luna 線)。 標價砍半,自己公布每任務算術。OpenAI 的發布表格是歷次模型發布中最具採購可用性的:GPT-6 Sol(xhigh)得分 33.2%、每任務 $0.27,對比 Claude Opus 5(最高檔)的 26.9%、貴 11.1 倍。在 Artificial Analysis 一側,GPT-6 Sol 最高檔把上一代的 $1.99 減半到 $1.06,同時在 Coding Agent Index 上漲 2 分(Artificial Analysis)。該策略賭的是實測並公開的每任務成本是未來的採購指標——而且一個對自己的效率有信心的供應商,透過讓成本比較毫不費力來贏得採購。
快取主導(Anthropic,Opus 線)。 保留前沿標價,掏空代理成本驅動項。Opus 5.5 把快取讀取從 $0.50 降到 $0.20,正中代理 Token 所在的工作負載形狀——對大而穩定的上下文反覆讀取。Anthropic 估計典型工作總成本約低 40%(Fello AI 概述發布主張),實測 $5.98 對 $7.60 每任務獨立地印證了方向。
這張圖的要點是算術框,不是柱子:價目表是每百萬的價格;每任務成本合約是每個產出的價格。在一個每週執行 1,200 次的 200 步負載上,Sonnet 5.5 最高檔每步花 193k 輸出 Token,每週帳單約 $2,316,而 GPT-6 Sol 以近似相同的實測智能只花 $121(兩者索引得分都在 55 上下;Sol 的編碼代理經濟性為每任務 $2.99,按 AA 編碼指數分析處於帕累托前緣)。「便宜 30%」的模型與它自己的上一代之間每週差約 $1,100——「最多便宜 30%」與成本翻倍同時為真,區別只在努力分佈。這就是為什麼合約比發布帖更重要。
九月讓採購問題變得更難了
兩個結構性事實使它從評論變成合約語言。首先,價目表風險已成月度常態:pricepertoken 讀到 9 月672 個被追蹤模型中約 180 個價格變動(該計數器全月的漂移:178/672 → 181/671),LLM Gateway 時間線列出本月 15 家供應商的 23 個新模型——你的 Agent 八月跑的帳單不是十月跑的帳單。其次,替換層已作為產品交付:LLM Gateway 的 Smart Route 於 9 月 25 日發布,把供應商側路由做成可購買的功能,而 Anthropic 的自適應回退(「在約 0.1% 的任務中回退,主要在 Terminal-Bench,一律回退至 Sonnet 5」,據 AA 測試)是模型呼叫內部的同一機制。兩者都不是不當行為——DeepSeek 事件表明供應商甚至可以宣布一次全艦隊模型替換、再在使用者壓力下 45 小時後撤回。路由決策是真實的,而且屬於握著執行環境的人。
在這個背景下,按價目表採購有三種具體失敗模式:
- 基準標題失敗。 Sonnet 5.5 在同一次發布中同時領跑能力故事(索引第 2,Terminal-Bench 4.0 64%)與成本故事(每任務便宜 30%)——兩者都真,但對照不同基線。讀了發布帖與基準表、卻沒讀 Token 那一欄的採購審批,會通過桌上最貴的每任務成本配置。
- 對努力等級失明的預測。 大多數公開的成本算術假設公開的設定。AA 的掃測顯示 Sonnet 5.5 的帳單隨 effort 擺動(最高 $7.60 對 Sonnet 5 約 $5.00;「便宜 30%」所在的低/中檔);建立在 API 預設值上的預測,只會繼承供應商 SDK 升級邏輯為每個任務挑中的檔位。
- 對快取失明的單價。 相隔 30 天的兩個 Anthropic 模型選擇了相反的軸——Sonnet 5.5 讓 Token 保持昂貴,Opus 5.5 把快取讀取做便宜。一個代理工作負載的實際快取命中率(長而穩定的系統提示;重複的工具 schema;大塊檢索上下文)現在是兩者誰更便宜的最大單一決定因素——而大多數 RFQ 流程從不詢問這個數字。
這些都不是供應商欺騙。三者都是一個市場的正常輸出——它的單位經濟在自家定價語言之下發生了位移。AA 用一句話給出了同樣的結論:「Sonnet 5.5 按 Token 便宜,但按任務可能很貴。」
合約:能活過下一次發布的四條條款
解法不是挑出贏的那家實驗室;在每任務成本上,贏家每週都變(pricepertoken 計數器每月移動)。解法是把決策儀表化,讓下一次替換成為一次有實測數據的設定變更,而不是發票上的驚嚇。四條條款對應本站在每個代理中建構的同一個執行環境:
1. 按步固定模型 ID,並記錄服務模型而非請求模型。 路由層是營運者基礎設施。model 欄位存在於你的 Agent 設定中——在我們的參考執行環境裡,Agent 以 provider + name 引用註冊的模型資源,更換模型是資料操作而非重新部署。稽核軌跡記錄每次工具呼叫實際服務的模型(DeepSeek 文章覆蓋完整事件模式)。靜默換掉你模型的供應商,現在會留下一個看得見的 diff。
2. 按每任務成本加每週上限簽約,而不是按 Token 加每月發票。 每任務定價正在成為公開發布的第一方指標(OpenAI 在發布表格中公布;AA 用同樣的任務測所有人)。一份範圍明確的合約會寫明工作負載(步數、上下文形狀、預期快取命中率)、每步類別的模型與努力檔,以及每任務的實測上限——以供應商公布的每任務價格為基準列。六成本向量框架提供稽核清單;第五個向量(供應商替換風險)就是本節操作化的條款。
3. 把努力旋鈕當作採購面來預算 Token,而不是開發者設定。 Sonnet 5.5 橫跨 effort 檔位 30 倍的帳單擺動是具體案例。路由層應把推理努力當作每步類別的型別化設定欄位——升級閾值顯式、上限在執行環境硬停(長時執行代理的成本上限模式),升級策略在稽核軌跡中可見。在每天 1,200 步上預設「最高努力」,是一個從未被做出的採購決策。
4. 在把一支艦隊押上去之前,先在自己的負載上測試所聲稱的效率。 Anthropic 的「最多低 30%」是誠實的、有範圍的、且依賴工作負載——AA 的反測 $7.60 同樣誠實、有範圍、依賴工作負載。兩者都不會告訴你自己的帳單。30 分鐘試點:取一週真實的 Agent 執行,在每一檔努力下對著候選模型重放,逐步測量 Token 與快取命中率,把三個數字(價目表、Token 帳單、實測每任務)放進採購一頁紙。TypeSafe Jev 三層棧讓這件事連續化——一個校準的決策層分類器盯住每類步的帳單,因為監視者每次呼叫幾乎免費。
有一條誠實標記適用於上述一切,包括算術框:所有實測每任務數字來自兩個獨立的當日測試來源(AA、kingy.ai)加上供應商公布的表格,且都在基準任務上,不是你的負載。AA 的 Intelligence Index 今年也已兩次重定基線;這裡引用的得分與成本是同一發布日期內的比較,下次重定基線時可能變動。把這一切當作試點將取代的起點基線——方向(價目表 ≠ 帳單;Token 才是變數)是穩定的,精確常數不是。
真實檔案上的結果
在本站寫作所圍繞的中等市場建構檔案上執行這些數字:一個分銷商的報價 Agent,每週 200 份 RFQ,跨目錄查詢、分層定價、知識圖譜替代品與草稿生成,每週約 1,200 次模型步。Sonnet 5.5 最高檔下,該檔案每週帳單約 $2,300。經過刻意路由——僅在談判相關步驟用前沿努力檔,查詢用中檔模型,分類用近地板價模型,快取密集的上下文跨步共享——同樣的負載每週帳單低於 $300,而品質集中在業務結果真正所在之處:客戶看到的那份報價。87% 的差距不是模型選擇技巧;是執行環境替你執行了一項發布帖從未替你做出的成本決策。在這些交易量下,整合層——MCP 模組、路由策略、稽核軌跡——仍然是建構的 90%,是按 Token 價目表無法定價的部分;模型帳單是噪音,上面的模式就是讓你的帳單保持為噪音而不是訊號的方法。
相關閱讀
- 推理經濟學:為什麼常駐生產型 Agent 現在負擔得起 — 母文章:1,000 倍每 Token 成本崩塌、Jevons 悖論框架,以及本輪降價背後的超大規模資本開支背景
- 超越每 Token:重塑推理採購的六個成本向量 — 本文四條條款所嵌入的採購框架;Token 效率是其供應商連續性向量的模型層配對
- DeepSeek V4.1-Flash 與靜默模型替換 — 讓服務模型日誌與固定 ID 合約從「謹慎」變為「必需」的替換事件
一家執行 NetSuite 與 BigCommerce 的中等市場分銷商,透過受治理的 Agent 棧每週對 200 份 RFQ 報價:ERP 與三個供應商目錄的 MCP 模組、零件替代品知識圖譜、處理庫存可用性鎖定的 RFQ 引擎——以及一個按步類別固定模型 ID、限制每任務 Token、在每次呼叫記錄服務模型的路由層。當下一篇發布帖聲稱「便宜 30%」時,這一層執行一週的重放試點,採購一頁紙上得到的是三個數字而不是一個形容詞。首個 Agent 5–8 週上線。
申請受限範圍建構。 一週發現期。無論是否與我們合作,你都會得到系統清單、工作流程地圖與固定範圍。
想為您的系統建構這個嗎?
這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。
申請客製開發為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。