返回资料库
策略

0.10 美元的子代理:Claude Haiku 5.5 坍缩了前沿与开放权重模型之间的成本差距

最后更新:2026年10月7日

核心要点

  • Claude Haiku 5.5 针对低于 100K 的提示词定价为每百万 token 0.10/0.50 美元——比 Haiku 4.5 低 90%,与 GPT-6 Luna 定价完全一致——使子代理层在三家供应商对 90% 的请求而言实际上近乎免费(Anthropic,10 月 7 日)。
  • OSWorld 2.1 从 Haiku 4.5 的 15.7% 跃升至 Haiku 5.5 的 72.4%——4.6 倍的改进,使这款廉价模型与 Sonnet 5.5 的 83.9% 相差不到 12 分(Anthropic,10 月 7 日)。
  • Sonnet 5.5 缓存读取价格减半,从每百万 token 0.20 美元降至 0.10 美元,将 Sonnet 5.5 的代理成本削减约 20%——中端模型在子代理层发布当天同步降价(Anthropic,10 月 7 日)。
  • GLM-5.3-Flash 定价 0.15/0.50 美元,GPT-6 Luna 定价 0.10/0.50 美元——小模型层级中前沿闭源与开放权重之间的输入成本差距如今仅 0.05 美元/M,对大多数工作负载而言可约等于零(Z.AI;Anthropic)。
  • 竞争轴心已从价格转向能力、安全姿态与生态系统集成——子代理层不再是一个成本决策,而是一个架构决策(Yahoo Finance,10 月 7 日)。

本文承接 30% 每任务成本更低却花费 7 倍 token:透视 Sonnet 5.5 的效率陷阱——该文梳理了旗舰层级上三种在每任务成本上竞争的发布策略。这里深入下一层:子代理层——负责压缩、分类、数据库查询和编码辅助工作的模型,刚刚触及六个月前还不可想象的价格下限。Sonnet 5.5 缓存读取减半——发布于同一份公告——是直接的配套数据点:该文的 token 效率论题获得了一个定价变化,使中端模型在缓存读取占主导的代理工作负载上便宜了 20%。

子代理层如今是一个统一价格的三供应商市场

截至 2026 年 10 月 8 日的小模型层级定价表:

模型 输入 $/M 输出 $/M 类型 供应商
GPT-6 Luna $0.10 $0.50 前沿闭源 OpenAI
Claude Haiku 5.5 $0.10 $0.50 前沿闭源 Anthropic
GLM-5.3-Flash $0.15 $0.50 开放权重 Z.ai

三者的输出价格完全相同。前沿闭源双雄与开放权重模型之间的输入价差为每百万 token 0.05 美元——对于一个压缩 5 万 token 对话上下文的子代理,差异仅为 0.0025 美元。选错子代理模型的代价如今以每任务几分之一美分计,而不是每天数美元。

截至 2026 年 10 月 8 日的子代理层定价格局:

0.10 美元层级的子代理 三家供应商。同一价格。前沿与开放权重的输入成本差距如今为 0.05 美元/M。 L GPT-6 Luna OpenAI · 前沿闭源 $0.10 /M 输入 $0.50 /M 输出 OSWorld 2.1: 48.9% H Claude Haiku 5.5 Anthropic · 前沿闭源 · 新发布 $0.10 /M 输入 $0.50 /M 输出 OSWorld 2.1: 72.4%(原为 15.7%) G GLM-5.3-Flash Z.ai · 开放权重 $0.15 /M 输入 $0.50 /M 输出 320B/18B MoE · MIT 权重 前沿与开放权重的输入成本差距:0.05 美元/M token 对 50K token 的压缩:0.0025 美元之差。子代理层已不再是成本决策。 10:1 比例依然成立 每 1 美元模型支出对应 10 美元集成与治理支出 $1 模型 $10 集成 MCP 模块、知识图谱、 审计日志、治理 Sonnet 5.5 缓存读取减半 同一公告 · 代理工作成本降低约 20% $0.20/M 缓存读取 $0.10/M 缓存读取 缓存读取在代理 token 消耗中占主导—— 这一账单项目随每一轮对话 线性扩展 模型便宜了 90%,集成层没有。 数据来源:Anthropic(2026 年 10 月 7 日)· Z.AI · Yahoo Finance · IdeaBosque ideabosque.com/library/haiku-5-5-subagent-tier-cost-collapse

Yahoo Finance 将 Haiku 5.5 的发布概括为"AI 价格战加剧"(Yahoo Finance,10 月 7 日)。这个概括是准确的,但低估了实际发生的事情。价格战意味着同一产品上的利润压缩。实际发生的是:子代理层——大多数代理 token 消耗所在的层级——坍缩到了一个此前只有最便宜的开放权重模型才能提供的价格。前沿闭源模型与开放权重模型如今在输出 token 上处于同一价格点。"我应该用前沿闭源子代理还是开放权重子代理"已不再是一个成本问题。

变化所在:子代理变得能干了

价格只是一半的故事。Haiku 5.5 的基准跃升才是改变架构决策的部分:

  • OSWorld 2.1(离线子集):72.4%——从 Haiku 4.5 的 15.7% 跃升,改进 4.6 倍。GPT-6 Luna 为 48.9%。子代理如今操作计算机完成多步骤任务的水平,达到十二个月前旗舰层的水准(Anthropic)。
  • Terminal-Bench 4.0:39.2%——从 Haiku 4.5 的 0.0% 跃升。GPT-6 Luna 为 16.4%。子代理如今可以完成上一代根本无法尝试的复杂命令行任务(Anthropic)。
  • FrontierCode 1.1(Main):46.4%——高于 GPT-6 Luna 的 42.4%,低于 Sonnet 5.5 在 xhigh 档的 52.1%。子代理编写的生产代码已足以胜任编码助手——Cognition 将其作为 Devin Fusion 中的 sidekick 出货,以更低的成本和延迟保持 66.2 的顶级 FrontierCode 分数(Anthropic)。
  • HubSpot CRM 任务套件:92.8%——HubSpot 在其模拟门户 CRM 评估中测得的最好成绩。子代理识别过期但模糊记录的命中率最高、误报率最低,优于所有受测模型(Anthropic)。

HubSpot 这个数据点的意义超出基准本身。HubSpot 是一个正在评估前沿小模型执行 CRM 自动化任务的主流 CRM 平台——这正是定制 MCP 模块所针对的用例。当子代理层级能以 0.10 美元/M 输入的价格、92.8% 的准确率识别过期 CRM 记录时,运行一个 24/7 监控商机管线的 agent 的成本,从预算科目降为舍入误差。

可调努力档位:同一个模型,五个价格点

Haiku 5.5 是首款带可调努力档位(low、medium、high、xhigh、max)的 Haiku 级模型。这正是 DeepSeek 自动路由分析所标记的同一种可配置成本模式——只不过那里指的是路由不可见时的采购风险;而在这里,控制权握在操作者手中。压缩对话上下文的子代理可以用 low 档以每任务 0.002 美元运行;同一个模型可以用 max 档执行更难的数据库查询。每任务成本曲线如今是一个拨盘,而不是固定费率。

对推理采购的直接含义是:一份只写明模型和费率卡的合同,无法控制努力档位。以 max 档运行的 agent 比以 medium 档运行的同一 agent 烧掉更多 token——而操作者只能看到发票。Sonnet 5.5 一文推荐的四个合同条款(努力档位锁定、替换披露、缓存读取价格底线、token 用量上限)如今同等地适用于子代理层——因为努力拨盘在那里也存在了。

Sonnet 5.5 缓存读取减半:中端层也便宜了

同一份公告将 Sonnet 5.5 的缓存读取从每百万 token 0.20 美元降至 0.10 美元。缓存读取在代理 token 消耗中占很大比重——一个在每一轮都重复读取相同系统提示词、工具定义和对话历史的 agent,其缓存读取账单项的用量高于输入或输出账单项。在主导代理支出的账单项上砍掉 50%,意味着 Sonnet 5.5 的总代理成本降低约 20%(Anthropic)。

这对 agent 架构决策很重要。0.10/0.50 美元的子代理层承担压缩、分类和助手工作。2/10 美元的中端层——现在缓存读取减半——承担复杂的代理编码和多步推理。4/20 美元的旗舰层承担最难的任务。三层堆栈如今定价清晰:廉价的子代理、缓存便宜的中端主力、强大的旗舰。10 月 7 日当天,为 always-on 生产 agent 运行整套堆栈的成本显著下降。

这对构建意味着什么

推理经济学分析确立了 10:1 的比例:每 1 美元模型支出对应 10 美元的流程、治理和集成工作。Haiku 5.5 的发布进一步拉大了这个比例。模型便宜了 90%,集成层没有。将 agent 连接到 NetSuite 的 MCP 模块、解析替代件的知识图谱、记录每一次工具调用的审计日志——这些成本不变。与一周前相比,模型在总构建成本中的占比更小了。

这就是采购洞察。子代理层的价格坍缩并没有让 agent 系统的构建更便宜,而是让运行更便宜——这意味着已经建好集成层的团队,其成本降幅大于尚未建好集成层的团队。一个用带类型的 MCP 模块、知识图谱和人审检查点运行生产 RFQ agent 的团队,其月度推理账单一夜之间降了 75%。而尚未构建集成层的团队看不到任何变化——因为成本就在集成层里。

相关阅读

一家运营 NetSuite、BigCommerce 和三个供应商目录的区域分销商每周处理 200 份 RFQ。报价 agent 以 Haiku 5.5 为子代理,负责目录检索和价格层级分类;以缓存读取减半的 Sonnet 5.5 负责报价起草步骤;以知识图谱负责替代件解析。10 月 7 日,整套堆栈的月度推理成本下降了 75%——从约 4,000 美元降至 1,000 美元以下——而集成代码一行未改。让成本下降成为现实的,是 MCP 模块、知识图谱和审计日志。模型价格只是容易的那部分。

申请一次有明确范围的构建

为期一周的探索。你将获得系统清单、工作流图谱和固定范围——无论是否与我们合作。

想为您的系统构建这个吗?

这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。

申请定制开发

为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。