0.10 美元的子代理:Claude Haiku 5.5 坍縮了前沿與開放權重模型之間的成本差距
核心要點
- Claude Haiku 5.5 針對低於 100K 的提示詞定價為每百萬 token 0.10/0.50 美元——比 Haiku 4.5 低 90%,與 GPT-6 Luna 定價完全一致——使子代理層在三家供應商對 90% 的請求而言實際上近乎免費(Anthropic,10 月 7 日)。
- OSWorld 2.1 從 Haiku 4.5 的 15.7% 躍升至 Haiku 5.5 的 72.4%——4.6 倍的改進,使這款廉價模型與 Sonnet 5.5 的 83.9% 相差不到 12 分(Anthropic,10 月 7 日)。
- Sonnet 5.5 快取讀取價格減半,從每百萬 token 0.20 美元降至 0.10 美元,將 Sonnet 5.5 的代理成本削減約 20%——中端模型在子代理層發布當天同步降價(Anthropic,10 月 7 日)。
- GLM-5.3-Flash 定價 0.15/0.50 美元,GPT-6 Luna 定價 0.10/0.50 美元——小模型層級中前沿閉源與開放權重之間的輸入成本差距如今僅 0.05 美元/M,對大多數工作負載而言可約等於零(Z.AI;Anthropic)。
- 競爭軸心已從價格轉向能力、安全姿態與生態系統整合——子代理層不再是一個成本決策,而是一個架構決策(Yahoo Finance,10 月 7 日)。
本文承接 30% 每任務成本更低卻花費 7 倍 token:透視 Sonnet 5.5 的效率陷阱——該文梳理了旗艦層級上三種在每任務成本上競爭的發布策略。這裡深入下一層:子代理層——負責壓縮、分類、資料庫查詢和編碼輔助工作的模型,剛剛觸及六個月前還不可想像的價格下限。Sonnet 5.5 快取讀取減半——發布於同一份公告——是直接的配套數據點:該文的 token 效率論題獲得了一個定價變化,使中端模型在快取讀取佔主導的代理工作負載上便宜了 20%。
子代理層如今是一個統一價格的三供應商市場
截至 2026 年 10 月 8 日的小模型層級定價表:
| 模型 | 輸入 $/M | 輸出 $/M | 類型 | 供應商 |
|---|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.50 | 前沿閉源 | OpenAI |
| Claude Haiku 5.5 | $0.10 | $0.50 | 前沿閉源 | Anthropic |
| GLM-5.3-Flash | $0.15 | $0.50 | 開放權重 | Z.ai |
三者的輸出價格完全相同。前沿閉源雙雄與開放權重模型之間的輸入價差為每百萬 token 0.05 美元——對於一個壓縮 5 萬 token 對話上下文的子代理,差異僅為 0.0025 美元。選錯子代理模型的代價如今以每任務幾分之一美分計,而不是每天數美元。
截至 2026 年 10 月 8 日的子代理層定價格局:
Yahoo Finance 將 Haiku 5.5 的發布概括為「AI 價格戰加劇」(Yahoo Finance,10 月 7 日)。這個概括是準確的,但低估了實際發生的事情。價格戰意味著同一產品上的利潤壓縮。實際發生的是:子代理層——大多數代理 token 消耗所在的層級——坍縮到了一個此前只有最便宜的開放權重模型才能提供的價格。前沿閉源模型與開放權重模型如今在輸出 token 上處於同一價格點。「我應該用前沿閉源子代理還是開放權重子代理」已不再是一個成本問題。
變化所在:子代理變得能幹了
價格只是一半的故事。Haiku 5.5 的基準躍升才是改變架構決策的部分:
- OSWorld 2.1(離線子集):72.4%——從 Haiku 4.5 的 15.7% 躍升,改進 4.6 倍。GPT-6 Luna 為 48.9%。子代理如今操作電腦完成多步驟任務的水平,達到十二個月前旗艦層的水準(Anthropic)。
- Terminal-Bench 4.0:39.2%——從 Haiku 4.5 的 0.0% 躍升。GPT-6 Luna 為 16.4%。子代理如今可以完成上一代根本無法嘗試的複雜命令列任務(Anthropic)。
- FrontierCode 1.1(Main):46.4%——高於 GPT-6 Luna 的 42.4%,低於 Sonnet 5.5 在 xhigh 檔的 52.1%。子代理編寫的生產程式碼已足以勝任編碼助手——Cognition 將其作為 Devin Fusion 中的 sidekick 出貨,以更低的成本和延遲保持 66.2 的頂級 FrontierCode 分數(Anthropic)。
- HubSpot CRM 任務套件:92.8%——HubSpot 在其模擬入口 CRM 評估中測得的最好成績。子代理識別過期但模糊記錄的命中率最高、誤報率最低,優於所有受測模型(Anthropic)。
HubSpot 這個數據點的意義超出基準本身。HubSpot 是一個正在評估前沿小模型執行 CRM 自動化任務的主流 CRM 平台——這正是客製化 MCP 模組所針對的用例。當子代理層能以 0.10 美元/M 輸入的價格、92.8% 的準確率識別過期 CRM 記錄時,執行一個 24/7 監控商機管線的 agent 的成本,從預算科目降為捨入誤差。
可調努力檔位:同一個模型,五個價格點
Haiku 5.5 是首款帶可調努力檔位(low、medium、high、xhigh、max)的 Haiku 級模型。這正是 DeepSeek 自動路由分析所標記的同一家可配置成本模式——只不過那裡指的是路由不可見時的採購風險;而在這裡,控制權握在操作者手中。壓縮對話上下文的子代理可以用 low 檔以每任務 0.002 美元執行;同一個模型可以用 max 檔執行更難的資料庫查詢。每任務成本曲線如今是一個撥盤,而不是固定費率。
對推論採購的直接含義是:一份只寫明模型和費率卡的合約,無法控制努力檔位。以 max 檔執行的 agent 比以 medium 檔執行的同一 agent 燒掉更多 token——而操作者只能看到發票。Sonnet 5.5 一文推薦的四個合約條款(努力檔位鎖定、替換揭露、快取讀取價格底線、token 用量上限)如今同等地適用於子代理層——因為努力撥盤在那裡也存在了。
Sonnet 5.5 快取讀取減半:中端層也便宜了
同一份公告將 Sonnet 5.5 的快取讀取從每百萬 token 0.20 美元降至 0.10 美元。快取讀取在代理 token 消耗中佔很大比重——一個在每一輪都重複讀取相同系統提示詞、工具定義和對話歷史的 agent,其快取讀取帳單項的用量高於輸入或輸出帳單項。在主導代理支出的帳單項上砍掉 50%,意味著 Sonnet 5.5 的總代理成本降低約 20%(Anthropic)。
這對 agent 架構決策很重要。0.10/0.50 美元的子代理層承擔壓縮、分類和助手工作。2/10 美元的中端層——現在快取讀取減半——承擔複雜的代理編碼和多步推理。4/20 美元的旗艦層承擔最難的任務。三層堆疊如今定價清晰:廉價的子代理、快取便宜的中端主力、強大的旗艦。10 月 7 日當天,為 always-on 生產 agent 執行整套堆疊的成本顯著下降。
這對建置意味著什麼
推論經濟學分析確立了 10:1 的比例:每 1 美元模型支出對應 10 美元的流程、治理和整合工作。Haiku 5.5 的發布進一步拉大了這個比例。模型便宜了 90%,整合層沒有。將 agent 連接到 NetSuite 的 MCP 模組、解析替代件的知識圖譜、記錄每一次工具呼叫的審計日誌——這些成本不變。與一週前相比,模型在總建置成本中的佔比更小了。
這就是採購洞察。子代理層的價格坍縮並沒有讓 agent 系統的建置更便宜,而是讓執行更便宜——這意味著已經建好整合層的團隊,其成本降幅大於尚未建好整合層的團隊。一個用帶類型的 MCP 模組、知識圖譜和人審檢查點執行生產 RFQ agent 的團隊,其月度推論帳單一夜之間降了 75%。而尚未建置整合層的團隊看不到任何變化——因為成本就在整合層裡。
相關閱讀
- 30% 每任務成本更低卻花費 7 倍 token:透視 Sonnet 5.5 的效率陷阱——梳理在每任務成本上競爭的三種發布策略的父文;快取讀取減半是直接的配套數據點
- 推論經濟學:為什麼 always-on 生產 agent 如今負擔得起——整合成本與模型成本 10:1 的比例;子代理層的坍縮進一步拉大差距
- GLM-5.3-Flash:以旗艦價格十分之一逼近 Claude Opus 4.8 的 320B 開放權重模型——成本坍縮論題的開放權重一半;定價 0.15/0.50 的 GLM-5.3-Flash 是三供應商子代理層中的第三家
一家營運 NetSuite、BigCommerce 和三個供應商目錄的區域經銷商每週處理 200 份 RFQ。報價 agent 以 Haiku 5.5 為子代理,負責目錄檢索和價格層級分類;以快取讀取減半的 Sonnet 5.5 負責報價起草步驟;以知識圖譜負責替代件解析。10 月 7 日,整套堆疊的月度推論成本下降了 75%——從約 4,000 美元降至 1,000 美元以下——而整合程式碼一行未改。讓成本下降成為現實的,是 MCP 模組、知識圖譜和審計日誌。模型價格只是容易的那部分。
申請一次有明確範圍的建置
為期一週的探索。你將獲得系統清單、工作流程圖譜和固定範圍——無論是否與我們合作。
想為您的系統建構這個嗎?
這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。
申請客製開發為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。