0.10 美元的子代理:Claude Haiku 5.5 坍缩了前沿与开放权重模型之间的成本差距
核心要点
- Claude Haiku 5.5 针对低于 100K 的提示词定价为每百万 token 0.10/0.50 美元——比 Haiku 4.5 低 90%,与 GPT-6 Luna 定价完全一致——使子代理层在三家供应商对 90% 的请求而言实际上近乎免费(Anthropic,10 月 7 日)。
- OSWorld 2.1 从 Haiku 4.5 的 15.7% 跃升至 Haiku 5.5 的 72.4%——4.6 倍的改进,使这款廉价模型与 Sonnet 5.5 的 83.9% 相差不到 12 分(Anthropic,10 月 7 日)。
- Sonnet 5.5 缓存读取价格减半,从每百万 token 0.20 美元降至 0.10 美元,将 Sonnet 5.5 的代理成本削减约 20%——中端模型在子代理层发布当天同步降价(Anthropic,10 月 7 日)。
- GLM-5.3-Flash 定价 0.15/0.50 美元,GPT-6 Luna 定价 0.10/0.50 美元——小模型层级中前沿闭源与开放权重之间的输入成本差距如今仅 0.05 美元/M,对大多数工作负载而言可约等于零(Z.AI;Anthropic)。
- 竞争轴心已从价格转向能力、安全姿态与生态系统集成——子代理层不再是一个成本决策,而是一个架构决策(Yahoo Finance,10 月 7 日)。
本文承接 30% 每任务成本更低却花费 7 倍 token:透视 Sonnet 5.5 的效率陷阱——该文梳理了旗舰层级上三种在每任务成本上竞争的发布策略。这里深入下一层:子代理层——负责压缩、分类、数据库查询和编码辅助工作的模型,刚刚触及六个月前还不可想象的价格下限。Sonnet 5.5 缓存读取减半——发布于同一份公告——是直接的配套数据点:该文的 token 效率论题获得了一个定价变化,使中端模型在缓存读取占主导的代理工作负载上便宜了 20%。
子代理层如今是一个统一价格的三供应商市场
截至 2026 年 10 月 8 日的小模型层级定价表:
| 模型 | 输入 $/M | 输出 $/M | 类型 | 供应商 |
|---|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.50 | 前沿闭源 | OpenAI |
| Claude Haiku 5.5 | $0.10 | $0.50 | 前沿闭源 | Anthropic |
| GLM-5.3-Flash | $0.15 | $0.50 | 开放权重 | Z.ai |
三者的输出价格完全相同。前沿闭源双雄与开放权重模型之间的输入价差为每百万 token 0.05 美元——对于一个压缩 5 万 token 对话上下文的子代理,差异仅为 0.0025 美元。选错子代理模型的代价如今以每任务几分之一美分计,而不是每天数美元。
截至 2026 年 10 月 8 日的子代理层定价格局:
Yahoo Finance 将 Haiku 5.5 的发布概括为"AI 价格战加剧"(Yahoo Finance,10 月 7 日)。这个概括是准确的,但低估了实际发生的事情。价格战意味着同一产品上的利润压缩。实际发生的是:子代理层——大多数代理 token 消耗所在的层级——坍缩到了一个此前只有最便宜的开放权重模型才能提供的价格。前沿闭源模型与开放权重模型如今在输出 token 上处于同一价格点。"我应该用前沿闭源子代理还是开放权重子代理"已不再是一个成本问题。
变化所在:子代理变得能干了
价格只是一半的故事。Haiku 5.5 的基准跃升才是改变架构决策的部分:
- OSWorld 2.1(离线子集):72.4%——从 Haiku 4.5 的 15.7% 跃升,改进 4.6 倍。GPT-6 Luna 为 48.9%。子代理如今操作计算机完成多步骤任务的水平,达到十二个月前旗舰层的水准(Anthropic)。
- Terminal-Bench 4.0:39.2%——从 Haiku 4.5 的 0.0% 跃升。GPT-6 Luna 为 16.4%。子代理如今可以完成上一代根本无法尝试的复杂命令行任务(Anthropic)。
- FrontierCode 1.1(Main):46.4%——高于 GPT-6 Luna 的 42.4%,低于 Sonnet 5.5 在 xhigh 档的 52.1%。子代理编写的生产代码已足以胜任编码助手——Cognition 将其作为 Devin Fusion 中的 sidekick 出货,以更低的成本和延迟保持 66.2 的顶级 FrontierCode 分数(Anthropic)。
- HubSpot CRM 任务套件:92.8%——HubSpot 在其模拟门户 CRM 评估中测得的最好成绩。子代理识别过期但模糊记录的命中率最高、误报率最低,优于所有受测模型(Anthropic)。
HubSpot 这个数据点的意义超出基准本身。HubSpot 是一个正在评估前沿小模型执行 CRM 自动化任务的主流 CRM 平台——这正是定制 MCP 模块所针对的用例。当子代理层级能以 0.10 美元/M 输入的价格、92.8% 的准确率识别过期 CRM 记录时,运行一个 24/7 监控商机管线的 agent 的成本,从预算科目降为舍入误差。
可调努力档位:同一个模型,五个价格点
Haiku 5.5 是首款带可调努力档位(low、medium、high、xhigh、max)的 Haiku 级模型。这正是 DeepSeek 自动路由分析所标记的同一种可配置成本模式——只不过那里指的是路由不可见时的采购风险;而在这里,控制权握在操作者手中。压缩对话上下文的子代理可以用 low 档以每任务 0.002 美元运行;同一个模型可以用 max 档执行更难的数据库查询。每任务成本曲线如今是一个拨盘,而不是固定费率。
对推理采购的直接含义是:一份只写明模型和费率卡的合同,无法控制努力档位。以 max 档运行的 agent 比以 medium 档运行的同一 agent 烧掉更多 token——而操作者只能看到发票。Sonnet 5.5 一文推荐的四个合同条款(努力档位锁定、替换披露、缓存读取价格底线、token 用量上限)如今同等地适用于子代理层——因为努力拨盘在那里也存在了。
Sonnet 5.5 缓存读取减半:中端层也便宜了
同一份公告将 Sonnet 5.5 的缓存读取从每百万 token 0.20 美元降至 0.10 美元。缓存读取在代理 token 消耗中占很大比重——一个在每一轮都重复读取相同系统提示词、工具定义和对话历史的 agent,其缓存读取账单项的用量高于输入或输出账单项。在主导代理支出的账单项上砍掉 50%,意味着 Sonnet 5.5 的总代理成本降低约 20%(Anthropic)。
这对 agent 架构决策很重要。0.10/0.50 美元的子代理层承担压缩、分类和助手工作。2/10 美元的中端层——现在缓存读取减半——承担复杂的代理编码和多步推理。4/20 美元的旗舰层承担最难的任务。三层堆栈如今定价清晰:廉价的子代理、缓存便宜的中端主力、强大的旗舰。10 月 7 日当天,为 always-on 生产 agent 运行整套堆栈的成本显著下降。
这对构建意味着什么
推理经济学分析确立了 10:1 的比例:每 1 美元模型支出对应 10 美元的流程、治理和集成工作。Haiku 5.5 的发布进一步拉大了这个比例。模型便宜了 90%,集成层没有。将 agent 连接到 NetSuite 的 MCP 模块、解析替代件的知识图谱、记录每一次工具调用的审计日志——这些成本不变。与一周前相比,模型在总构建成本中的占比更小了。
这就是采购洞察。子代理层的价格坍缩并没有让 agent 系统的构建更便宜,而是让运行更便宜——这意味着已经建好集成层的团队,其成本降幅大于尚未建好集成层的团队。一个用带类型的 MCP 模块、知识图谱和人审检查点运行生产 RFQ agent 的团队,其月度推理账单一夜之间降了 75%。而尚未构建集成层的团队看不到任何变化——因为成本就在集成层里。
相关阅读
- 30% 每任务成本更低却花费 7 倍 token:透视 Sonnet 5.5 的效率陷阱——梳理在每任务成本上竞争的三种发布策略的父文;缓存读取减半是直接的配套数据点
- 推理经济学:为什么 always-on 生产 agent 如今负担得起——集成成本与模型成本 10:1 的比例;子代理层的坍缩进一步拉大差距
- GLM-5.3-Flash:以旗舰价格十分之一逼近 Claude Opus 4.8 的 320B 开放权重模型——成本坍缩论题的开放权重一半;定价 0.15/0.50 的 GLM-5.3-Flash 是三供应商子代理层中的第三家
一家运营 NetSuite、BigCommerce 和三个供应商目录的区域分销商每周处理 200 份 RFQ。报价 agent 以 Haiku 5.5 为子代理,负责目录检索和价格层级分类;以缓存读取减半的 Sonnet 5.5 负责报价起草步骤;以知识图谱负责替代件解析。10 月 7 日,整套堆栈的月度推理成本下降了 75%——从约 4,000 美元降至 1,000 美元以下——而集成代码一行未改。让成本下降成为现实的,是 MCP 模块、知识图谱和审计日志。模型价格只是容易的那部分。
申请一次有明确范围的构建
为期一周的探索。你将获得系统清单、工作流图谱和固定范围——无论是否与我们合作。
想为您的系统构建这个吗?
这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。
申请定制开发为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。