返回资料库
策略

号称每任务便宜 30%,却多花 7 倍 Token:深入 Sonnet 5.5 的效率陷阱

最后更新:2026年9月27日

要点

  • Sonnet 5.5 的“每任务最多便宜 30%”在低与中努力等级成立,但在最高等级反转:Anthropic 收同样的 $2/$10 定价表,而模型每个索引任务消耗约 193,000 输出 Token——Artificial Analysis 测过的最重 Token 用量——实测成本 $7.60 每任务,比 Sonnet 5 高约 50%,比 Opus 5.5 的 $5.98 高约 27%(Anthropic,9/28;Artificial Analysis,9/28)。
  • 同一发布窗口出现了两种相反的策略:OpenAI 于 9 月 22 日将 GPT-6 Sol/Luna 价格下调 50% 至 $2/$10 与 $0.10/$0.50 每百万 Token——GPT-6 Sol 最高档每 Intelligence Index 任务 $1.06,比前代低约 50%——而 Anthropic 保持 Sonnet 定价表不动,任由 Token 账单上涨(OpenAI;Artificial Analysis)。
  • Opus 5.5(9 月 22 日)走了第三条路:标价打 8 折、缓存读取降 60%($0.50 → $0.20 每百万),瞄准 Agent 工作负载占主导的那一项——这正是它实测每任务 $5.98 在最高档反而低于自家后辈的原因(Anthropic;Finout)。
  • 在高到最高档,Sonnet 5.5 偏离成本效率前沿:GPT-6 Sol 以“实质相同的每任务成本”提供接近的智能,GPT-6 Luna 最高档以每任务 $0.07 做等智能的工作——约为 Sonnet 5.5 最高档账单的百分之一(Artificial Analysis,9/28)。
  • 672 个被追踪的模型中,9 月约有 180 个发生价格变动——定价表已成为月度风险,而一份只按 Token 定价签约的 Agent,对未经它同意的替换毫无防御(pricepertoken,9/28;DeepSeek 自动路由反转是完整案例)。

Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,带着市场上最干净的成本主张:“相比 Claude Sonnet 5 是一次清晰升级,快 30% 以上,大多数工作最多便宜 30%。”每个字都站得住——但其机制并非标题所暗示的那样。定价表没有动:输入 $2/百万 Token,输出 $10,缓存读取 $0.20,与 Sonnet 5 完全相同。变的是 Token 账单,而且在该代理工作实际使用的努力等级上,它朝主张的反方向移动。Artificial Analysis 在发布当天就运行了该模型:最高努力等级下,Sonnet 5.5 每个 Intelligence Index 任务消耗约 193,000 输出 Token——他们测试史上最高,比 Opus 5.5 最高档高约 60%,约为 GPT-6 Astra 的 7 倍——实测成本 $7.60 每任务(Artificial Analysis,9/28;kingy.ai 团队率先记录:“Sonnet 5.5 按 Token 便宜,但按任务可能很贵”)。

孤立地看,这是单一模型的怪癖。放到同一两周窗口里读,这就是行业的岔路口。9 月 22 日,OpenAI 将 GPT-6 Sol 与 Luna 价格砍半(OpenAI),Anthropic 将 Opus 5.5 缓存读取降 60%(Anthropic)。六天后,Anthropic 以“便宜 30%”的姿态入场,对同一 Token 量的定价是竞争对手以半价出售的水平——它用花钱买 Token 的方式换取索引第 2 的能力,而不是把 Token 买便宜。三种发布策略现在在同一个指标上竞争——每任务成本——而它们分歧最大的地方,恰好是推理采购指南所在之处。本文将三种策略对照 Artificial Analysis 的实测数字逐一拆解,算清按 Token 定价表所隐藏的 Token 效率算术,并以四条合同条款收尾,让下一次模型替换无法静默重定价你的 Agent 账单。

主张、机制与测量

Anthropic 的主张是关于效率的,而且发布会页面明确说明了机制:模型“通常只需少得多的 Token 即可完成同样的工作。在我们的测试中,每任务成本比前代最多低 30%。”这在 Anthropic 自己的测试分布、Anthropic 自选的设置上是真的——该公司报告 Sonnet 5.5 在低与中努力等级下“以约十分之一的每任务成本”超越 Sonnet 5 的最佳基准分数(据 kingy.ai 概述)。如果你的工作负载是轻量且 Anthropic 形状的——短草稿、分类、有界查询——这个主张大概率会在你的账单上成立。

代理式工作负载不是那个分布。Artificial Analysis Intelligence Index 在五个努力等级下运行多步任务,模型的自适应推理会在难题上升级努力等级。在那个范围顶端,Token 账单爆炸:最高档约每任务 193k 输出 Token,对比 Sonnet 5 最高档与 Opus 5.5 最高档的约 120k(约 +60%)、GPT-6 Astra 最高档的约 27k(约 7 倍)。Token 量正是要点——Sonnet 5.5(最高档)在索引上得 56 分,落后 Opus 5.5 的 58 分 2 分,Terminal-Bench 4.0 为 64%,略高于 Opus 5.5 与 GPT-6 Astra。它通过每一步想得更久来达到该能力,而输出 Token 一律按每百万 $10 计费,不管每一个有多站得住脚。一条回退脚注补全了机制:Anthropic 默认的自适应路由“在约 0.1% 的任务中回退……所有情况均回退至 Sonnet 5”——又一次对定价表中立的替换,操作者只能在发票上看到它(Artificial Analysis)。

每任务成本是唯一能经受住这一结构检验的指标,因为它把定价表与 Token 账单合成到一起。同日实测,全部为 Intelligence Index 最高档的每任务成本:

模型(最高档) 标价($/M 输入/输出) 输出 Token/任务 实测成本/任务 发布策略
Claude Sonnet 5.5 $2 / $10 ~193k $7.60 能力主导:定价表不动,Token 账单上行
Claude Opus 5.5 $4 / $20(缓存 $0.20) ~120k $5.98 缓存主导:标价 −20%,代理项 −60%
Claude Sonnet 5 $2 / $10 ~120k ~$5.00 基线
GPT-6 Sol $2 / $10 ~31k $1.06 价格主导:标价 −50%
GPT-6 Luna $0.10 / $0.50 ~51k $0.07 价格主导:地板价

(AA Intelligence Index v4.x 得分:Sonnet 5.5 得 56 排名第 2;Opus 5.5 得 58 排名第 1;GPT-6 Sol 在编码代理工作上约等于 56 档。得分带有谱系警示——AA 今年已两次重定指数基线,仅在同一来源的发布之间引用得分。)

陷阱在第一行与第三行:标价相同,实测成本相差 7.6 倍。一项基于定价表的采购决策——“Sonnet 5.5 与 Sonnet 5 同价,所以是经济的升级”——得出与账单完全相反的结论。而实测排名第二次反转了直觉:桌上标价更贵的那个(Opus 5.5,$4/$20)反而是更便宜的任务,因为它的缓存读取降价打击了代理式工作负载真正主导的科目——每个任务数千次重读长上下文(Anthropic:“缓存读取(占代理与编码工作成本的大头)为 $0.20 每百万 Token”)。

三种发布策略,同一个战场

9 月的窗口把价格战从 6 月以来的暗示变成了明文:每 Token 价格不再是供应商竞争的地方,因为每 Token 价格已近乎免费。战场移到每任务成本,各家实验室选了不同的武器。

能力主导(Anthropic,Sonnet 线)。 用旧的定价表发一个接近前沿的模型,赢下基准表。Sonnet 5.5 排第 2、Token 账单重 60%,是这一策略最纯粹的形式:智能提升是真实的(最高档比 Sonnet 5 高 +18 个索引点),而它的成本落在发票的 Token 一栏,在那里“便宜 30%”和“$7.60”在技术上同时为真。该策略赌的是买家看标题和基准、把 Token 量当免费品——而据盖特纳 9 月 16 日预测,2026 年全球 AI 支出增长 49.5% 至 $2.7T,agents-and-assistants 细分沿 $16.5B → $29.2B → $65.5B 的路径增长,这个赌注有真实受众。

价格主导(OpenAI,Sol/Luna 线)。 标价砍半,自己公布每任务算术。OpenAI 的发布表格是历次模型发布中最具采购可用性的:GPT-6 Sol(xhigh)得分 33.2%、每任务 $0.27,对比 Claude Opus 5(最高档)的 26.9%、贵 11.1 倍。在 Artificial Analysis 一侧,GPT-6 Sol 最高档把上一代的 $1.99 减半到 $1.06,同时在 Coding Agent Index 上涨 2 分(Artificial Analysis)。该策略赌的是实测并公开的每任务成本是未来的采购指标——而且一个对自己的效率有信心的供应商,通过让成本比较毫不费力来赢得采购。

缓存主导(Anthropic,Opus 线)。 保留前沿标价,掏空代理成本驱动项。Opus 5.5 把缓存读取从 $0.50 降到 $0.20,正中代理 Token 所在的工作负载形状——对大而稳定的上下文反复读取。Anthropic 估计典型工作总成本约低 40%(Fello AI 概述发布主张),实测 $5.98 对 $7.60 每任务独立地印证了方向。

同一个指标,三种相反的策略。 2026 年 9 月发布的实测每 Intelligence Index 任务成本(最高努力档)· Artificial Analysis 实测每任务成本(最高努力档) $7.60 Sonnet 5.5 每任务 193k 输出 Token $5.98 Opus 5.5 缓存读取降 60% ~$5.00 Sonnet 5 “上一代”基线 $1.06 GPT-6 Sol 标价降 50% $0.07 GPT-6 Luna 地板档 最高档 Sonnet 5.5 成本是 GPT-6 Sol 最高档的 7.2 倍——在完全相同的 $2/$10 定价表上 三种发布策略,2026 年 9 月 能力主导——Anthropic Sonnet 5.5 定价表持平于 $2/$10。靠想得更久 赢下索引(第 2,得分 56): 每任务 193k Token,AA 测过的最重 账单。成本落在发票的 Token 一栏。 基准买来的是标题 价格主导——OpenAI Sol / Luna 标价砍半(9/22),并在发布 帖中公开每任务算术: Sol xhigh 每任务 $0.27,对比 Opus 5 最高档贵 11.1 倍。Luna:比 Fable 5 每任务便宜 96%。 按公开数字采购 缓存主导——Anthropic(Opus) Opus 5.5 标价 −20%,缓存读取 −60% ($0.50 → $0.20)。正中代理工作 负载主导的科目: “缓存读取……占代理与编码 工作成本的大头。” 兄长反向压过幼弟 定价表隐藏的算术——一个 200 步工作负载,每日 1,000 步 Sonnet 5.5 最高档:每周 1,200 步 x 193k 输出 Token = 每周 2.316 亿输出 Token x $10/M = 每周 $2,316 同一负载在 GPT-6 Sol 最高档:31k Token → 每周 $121。Sonnet 5 最高档:120k Token → 每周 $1,200。 在这个画像上,“便宜 30%”的模型比它自己的上一代贵 1.9 倍——定价表从未变;变的是 Token 那一列。 努力档位让账单摆动 30 倍——按上限签合同 每 Token 价格是错误的采购指标。要么按每任务成本签约,要么把账单交给每一次替换。 按步固定模型 ID · 用熔断器限制每任务 Token · 记录服务模型而非请求模型 · 要求公开每任务定价 DeepSeek 45 小时的反转证明四条缺一不可——也没有哪一条单独足够。 Sonnet 5.5 最高档 $7.60/任务 · Opus 5.5 $5.98 · Sonnet 5 ~$5.00 · GPT-6 Sol $1.06 · GPT-6 Luna $0.07 数据来源:Artificial Analysis(9/22 与 9/28)· Anthropic · OpenAI — ideabosque.com

这张图的要点是算术框,不是柱子:定价表是每百万的价格;每任务成本合同是每个产出的价格。在一个每周运行 1,200 次的 200 步负载上,Sonnet 5.5 最高档每步花 193k 输出 Token,每周账单约 $2,316,而 GPT-6 Sol 以近似相同的实测智能只花 $121(两者索引得分都在 55 上下;Sol 的编码代理经济性为每任务 $2.99,按 AA 编码指数分析处于帕累托前沿)。“便宜 30%”的模型与它自己的上一代之间每周差约 $1,100——“最多便宜 30%”与成本翻倍同时为真,区别只在努力分布。这就是为什么合同比发布帖更重要。

九月让采购问题变得更难了

两个结构性事实使它从评论变成合同语言。首先,定价表风险已成月度常态:pricepertoken 读到 9 月672 个被追踪模型中约 180 个价格变动(该计数器全月的漂移:178/672 → 181/671),LLM Gateway 时间线列出本月 15 家供应商的 23 个新模型——你的 Agent 八月跑的账单不是十月跑的账单。其次,替换层已作为产品交付:LLM Gateway 的 Smart Route 于 9 月 25 日发布,把供应商侧路由做成可购买的功能,而 Anthropic 的自适应回退(“在约 0.1% 的任务中回退,主要在 Terminal-Bench,一律回退至 Sonnet 5”,据 AA 测试)是模型调用内部的同一机制。两者都不是不当行为——DeepSeek 事件表明供应商甚至可以宣布一次全舰队模型替换、再在用户压力下 45 小时后撤回。路由决策是真实的,而且属于握着运行时的人。

在这个背景下,按定价表采购有三种具体失败模式:

  1. 基准标题失败。 Sonnet 5.5 在同一次发布中同时领跑能力故事(索引第 2,Terminal-Bench 4.0 64%)与成本故事(每任务便宜 30%)——两者都真,但对照不同基线。读了发布帖与基准表、却没读 Token 那一列的采购审批,会通过桌上最贵的每任务成本配置。
  2. 对努力等级失明的预测。 大多数公开的成本算术假设公开的设置。AA 的扫测显示 Sonnet 5.5 的账单随 effort 摆动(最高 $7.60 对 Sonnet 5 约 $5.00;“便宜 30%”所在的低/中档);建立在 API 默认值上的预测,只会继承供应商 SDK 升级逻辑为每个任务挑中的档位。
  3. 对缓存失明的单价。 相隔 30 天的两个 Anthropic 模型选择了相反的轴——Sonnet 5.5 让 Token 保持昂贵,Opus 5.5 把缓存读取做便宜。一个代理工作负载的实际缓存命中率(长而稳定的系统提示;重复的工具 schema;大块检索上下文)现在是两者谁更便宜的最大单一决定因素——而大多数 RFQ 流程从不询问这个数字。

这些都不是供应商欺骗。三者都是一个市场的正常输出——它的单位经济在自家定价语言之下发生了位移。AA 用一句话给出了同样的结论:“Sonnet 5.5 按 Token 便宜,但按任务可能很贵。”

合同:能活过下一次发布的四条条款

解法不是挑出赢的那家实验室;在每任务成本上,赢家每周都变(pricepertoken 计数器每月移动)。解法是把决策仪表化,让下一次替换成为一次有实测数据的配置变更,而不是发票上的惊吓。四条条款对应本站在每个代理中构建的同一个运行时:

1. 按步固定模型 ID,并记录服务模型而非请求模型。 路由层是运营者基础设施。model 字段存在于你的 Agent 配置中——在我们的参考运行时里,Agent 以 provider + name 引用注册的模型资源,更换模型是数据操作而非重新部署。审计轨迹记录每次工具调用实际服务的模型(DeepSeek 文章覆盖完整事件模式)。静默换掉你模型的供应商,现在会留下一个看得见的 diff。

2. 按每任务成本加每周上限签约,而不是按 Token 加每月发票。 每任务定价正在成为公开发布的第一方指标(OpenAI 在发布表格中公布;AA 用同样的任务测所有人)。一份范围明确的合同会写明工作负载(步数、上下文形状、预期缓存命中率)、每步类别的模型与努力档,以及每任务的实测上限——以供应商公布的每任务价格为基准行。六成本向量框架提供审计清单;第五个向量(供应商替换风险)就是本节操作化的条款。

3. 把努力旋钮当作采购面来预算 Token,而不是开发者设置。 Sonnet 5.5 横跨 effort 档位 30 倍的账单摆动是具体案例。路由层应把推理努力当作每步类别的类型化配置字段——升级阈值显式、上限在运行时硬停(长时运行代理的成本上限模式),升级策略在审计轨迹中可见。在每天 1,200 步上默认“最高努力”,是一个从未被做出的采购决策。

4. 在把一支舰队押上去之前,先在自己的负载上测试所声称的效率。 Anthropic 的“最多低 30%”是诚实的、有范围的、且依赖工作负载——AA 的反测 $7.60 同样诚实、有范围、依赖工作负载。两者都不会告诉你自己的账单。30 分钟试点:取一周真实的 Agent 运行,在每一档努力下对着候选模型重放,逐步测量 Token 与缓存命中率,把三个数字(定价表、Token 账单、实测每任务)放进采购一页纸。TypeSafe Jev 三层栈让这件事连续化——一个校准的决策层分类器盯住每类步的账单,因为监视者每次调用几乎免费。

有一条诚实标记适用于上述一切,包括算术框:所有实测每任务数字来自两个独立的当日测试来源(AA、kingy.ai)加上供应商公布的表格,且都在基准任务上,不是你的负载。AA 的 Intelligence Index 今年也已两次重定基线;这里引用的得分与成本是同一发布日期内的比较,下次重定基线时可能变动。把这一切当作试点将取代的起点基线——方向(定价表 ≠ 账单;Token 才是变量)是稳定的,精确常数不是。

真实档案上的结果

在本站写作所围绕的中等市场构建档案上运行这些数字:一个分销商的报价 Agent,每周 200 份 RFQ,跨目录查询、分层定价、知识图谱替代品与草稿生成,每周约 1,200 次模型步。Sonnet 5.5 最高档下,该档案每周账单约 $2,300。经过刻意路由——仅在谈判相关步骤用前沿努力档,查询用中档模型,分类用近地板价模型,缓存密集的上下文跨步共享——同样的负载每周账单低于 $300,而质量集中在业务结果真正所在之处:客户看到的那份报价。87% 的差距不是模型选择技巧;是运行时替你执行了一项发布帖从未替你做出的成本决策。在这些交易量下,集成层——MCP 模块、路由策略、审计轨迹——仍然是构建的 90%,是按 Token 定价表无法定价的部分;模型账单是噪音,上面的模式就是让你的账单保持为噪音而不是信号的方法。

相关阅读


一家运行 NetSuite 与 BigCommerce 的中等市场分销商,通过受治理的 Agent 栈每周对 200 份 RFQ 报价:ERP 与三个供应商目录的 MCP 模块、零件替代品知识图谱、处理库存可用性锁定的 RFQ 引擎——以及一个按步类别固定模型 ID、限制每任务 Token、在每次调用记录服务模型的路由层。当下一篇发布帖声称“便宜 30%”时,这一层运行一周的重放试点,采购一页纸上得到的是三个数字而不是一个形容词。首个 Agent 5–8 周上线。

申请受限范围构建。 一周发现期。无论是否与我们合作,你都会得到系统清单、工作流地图与固定范围。

想为您的系统构建这个吗?

这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。

申请定制开发

为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。