号称每任务便宜 30%,却多花 7 倍 Token:深入 Sonnet 5.5 的效率陷阱
要点
- Sonnet 5.5 的“每任务最多便宜 30%”在低与中努力等级成立,但在最高等级反转:Anthropic 收同样的 $2/$10 定价表,而模型每个索引任务消耗约 193,000 输出 Token——Artificial Analysis 测过的最重 Token 用量——实测成本 $7.60 每任务,比 Sonnet 5 高约 50%,比 Opus 5.5 的 $5.98 高约 27%(Anthropic,9/28;Artificial Analysis,9/28)。
- 同一发布窗口出现了两种相反的策略:OpenAI 于 9 月 22 日将 GPT-6 Sol/Luna 价格下调 50% 至 $2/$10 与 $0.10/$0.50 每百万 Token——GPT-6 Sol 最高档每 Intelligence Index 任务 $1.06,比前代低约 50%——而 Anthropic 保持 Sonnet 定价表不动,任由 Token 账单上涨(OpenAI;Artificial Analysis)。
- Opus 5.5(9 月 22 日)走了第三条路:标价打 8 折、缓存读取降 60%($0.50 → $0.20 每百万),瞄准 Agent 工作负载占主导的那一项——这正是它实测每任务 $5.98 在最高档反而低于自家后辈的原因(Anthropic;Finout)。
- 在高到最高档,Sonnet 5.5 偏离成本效率前沿:GPT-6 Sol 以“实质相同的每任务成本”提供接近的智能,GPT-6 Luna 最高档以每任务 $0.07 做等智能的工作——约为 Sonnet 5.5 最高档账单的百分之一(Artificial Analysis,9/28)。
- 672 个被追踪的模型中,9 月约有 180 个发生价格变动——定价表已成为月度风险,而一份只按 Token 定价签约的 Agent,对未经它同意的替换毫无防御(pricepertoken,9/28;DeepSeek 自动路由反转是完整案例)。
Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,带着市场上最干净的成本主张:“相比 Claude Sonnet 5 是一次清晰升级,快 30% 以上,大多数工作最多便宜 30%。”每个字都站得住——但其机制并非标题所暗示的那样。定价表没有动:输入 $2/百万 Token,输出 $10,缓存读取 $0.20,与 Sonnet 5 完全相同。变的是 Token 账单,而且在该代理工作实际使用的努力等级上,它朝主张的反方向移动。Artificial Analysis 在发布当天就运行了该模型:最高努力等级下,Sonnet 5.5 每个 Intelligence Index 任务消耗约 193,000 输出 Token——他们测试史上最高,比 Opus 5.5 最高档高约 60%,约为 GPT-6 Astra 的 7 倍——实测成本 $7.60 每任务(Artificial Analysis,9/28;kingy.ai 团队率先记录:“Sonnet 5.5 按 Token 便宜,但按任务可能很贵”)。
孤立地看,这是单一模型的怪癖。放到同一两周窗口里读,这就是行业的岔路口。9 月 22 日,OpenAI 将 GPT-6 Sol 与 Luna 价格砍半(OpenAI),Anthropic 将 Opus 5.5 缓存读取降 60%(Anthropic)。六天后,Anthropic 以“便宜 30%”的姿态入场,对同一 Token 量的定价是竞争对手以半价出售的水平——它用花钱买 Token 的方式换取索引第 2 的能力,而不是把 Token 买便宜。三种发布策略现在在同一个指标上竞争——每任务成本——而它们分歧最大的地方,恰好是推理采购指南所在之处。本文将三种策略对照 Artificial Analysis 的实测数字逐一拆解,算清按 Token 定价表所隐藏的 Token 效率算术,并以四条合同条款收尾,让下一次模型替换无法静默重定价你的 Agent 账单。
主张、机制与测量
Anthropic 的主张是关于效率的,而且发布会页面明确说明了机制:模型“通常只需少得多的 Token 即可完成同样的工作。在我们的测试中,每任务成本比前代最多低 30%。”这在 Anthropic 自己的测试分布、Anthropic 自选的设置上是真的——该公司报告 Sonnet 5.5 在低与中努力等级下“以约十分之一的每任务成本”超越 Sonnet 5 的最佳基准分数(据 kingy.ai 概述)。如果你的工作负载是轻量且 Anthropic 形状的——短草稿、分类、有界查询——这个主张大概率会在你的账单上成立。
代理式工作负载不是那个分布。Artificial Analysis Intelligence Index 在五个努力等级下运行多步任务,模型的自适应推理会在难题上升级努力等级。在那个范围顶端,Token 账单爆炸:最高档约每任务 193k 输出 Token,对比 Sonnet 5 最高档与 Opus 5.5 最高档的约 120k(约 +60%)、GPT-6 Astra 最高档的约 27k(约 7 倍)。Token 量正是要点——Sonnet 5.5(最高档)在索引上得 56 分,落后 Opus 5.5 的 58 分 2 分,Terminal-Bench 4.0 为 64%,略高于 Opus 5.5 与 GPT-6 Astra。它通过每一步想得更久来达到该能力,而输出 Token 一律按每百万 $10 计费,不管每一个有多站得住脚。一条回退脚注补全了机制:Anthropic 默认的自适应路由“在约 0.1% 的任务中回退……所有情况均回退至 Sonnet 5”——又一次对定价表中立的替换,操作者只能在发票上看到它(Artificial Analysis)。
每任务成本是唯一能经受住这一结构检验的指标,因为它把定价表与 Token 账单合成到一起。同日实测,全部为 Intelligence Index 最高档的每任务成本:
| 模型(最高档) | 标价($/M 输入/输出) | 输出 Token/任务 | 实测成本/任务 | 发布策略 |
|---|---|---|---|---|
| Claude Sonnet 5.5 | $2 / $10 | ~193k | $7.60 | 能力主导:定价表不动,Token 账单上行 |
| Claude Opus 5.5 | $4 / $20(缓存 $0.20) | ~120k | $5.98 | 缓存主导:标价 −20%,代理项 −60% |
| Claude Sonnet 5 | $2 / $10 | ~120k | ~$5.00 | 基线 |
| GPT-6 Sol | $2 / $10 | ~31k | $1.06 | 价格主导:标价 −50% |
| GPT-6 Luna | $0.10 / $0.50 | ~51k | $0.07 | 价格主导:地板价 |
(AA Intelligence Index v4.x 得分:Sonnet 5.5 得 56 排名第 2;Opus 5.5 得 58 排名第 1;GPT-6 Sol 在编码代理工作上约等于 56 档。得分带有谱系警示——AA 今年已两次重定指数基线,仅在同一来源的发布之间引用得分。)
陷阱在第一行与第三行:标价相同,实测成本相差 7.6 倍。一项基于定价表的采购决策——“Sonnet 5.5 与 Sonnet 5 同价,所以是经济的升级”——得出与账单完全相反的结论。而实测排名第二次反转了直觉:桌上标价更贵的那个(Opus 5.5,$4/$20)反而是更便宜的任务,因为它的缓存读取降价打击了代理式工作负载真正主导的科目——每个任务数千次重读长上下文(Anthropic:“缓存读取(占代理与编码工作成本的大头)为 $0.20 每百万 Token”)。
三种发布策略,同一个战场
9 月的窗口把价格战从 6 月以来的暗示变成了明文:每 Token 价格不再是供应商竞争的地方,因为每 Token 价格已近乎免费。战场移到每任务成本,各家实验室选了不同的武器。
能力主导(Anthropic,Sonnet 线)。 用旧的定价表发一个接近前沿的模型,赢下基准表。Sonnet 5.5 排第 2、Token 账单重 60%,是这一策略最纯粹的形式:智能提升是真实的(最高档比 Sonnet 5 高 +18 个索引点),而它的成本落在发票的 Token 一栏,在那里“便宜 30%”和“$7.60”在技术上同时为真。该策略赌的是买家看标题和基准、把 Token 量当免费品——而据盖特纳 9 月 16 日预测,2026 年全球 AI 支出增长 49.5% 至 $2.7T,agents-and-assistants 细分沿 $16.5B → $29.2B → $65.5B 的路径增长,这个赌注有真实受众。
价格主导(OpenAI,Sol/Luna 线)。 标价砍半,自己公布每任务算术。OpenAI 的发布表格是历次模型发布中最具采购可用性的:GPT-6 Sol(xhigh)得分 33.2%、每任务 $0.27,对比 Claude Opus 5(最高档)的 26.9%、贵 11.1 倍。在 Artificial Analysis 一侧,GPT-6 Sol 最高档把上一代的 $1.99 减半到 $1.06,同时在 Coding Agent Index 上涨 2 分(Artificial Analysis)。该策略赌的是实测并公开的每任务成本是未来的采购指标——而且一个对自己的效率有信心的供应商,通过让成本比较毫不费力来赢得采购。
缓存主导(Anthropic,Opus 线)。 保留前沿标价,掏空代理成本驱动项。Opus 5.5 把缓存读取从 $0.50 降到 $0.20,正中代理 Token 所在的工作负载形状——对大而稳定的上下文反复读取。Anthropic 估计典型工作总成本约低 40%(Fello AI 概述发布主张),实测 $5.98 对 $7.60 每任务独立地印证了方向。
这张图的要点是算术框,不是柱子:定价表是每百万的价格;每任务成本合同是每个产出的价格。在一个每周运行 1,200 次的 200 步负载上,Sonnet 5.5 最高档每步花 193k 输出 Token,每周账单约 $2,316,而 GPT-6 Sol 以近似相同的实测智能只花 $121(两者索引得分都在 55 上下;Sol 的编码代理经济性为每任务 $2.99,按 AA 编码指数分析处于帕累托前沿)。“便宜 30%”的模型与它自己的上一代之间每周差约 $1,100——“最多便宜 30%”与成本翻倍同时为真,区别只在努力分布。这就是为什么合同比发布帖更重要。
九月让采购问题变得更难了
两个结构性事实使它从评论变成合同语言。首先,定价表风险已成月度常态:pricepertoken 读到 9 月672 个被追踪模型中约 180 个价格变动(该计数器全月的漂移:178/672 → 181/671),LLM Gateway 时间线列出本月 15 家供应商的 23 个新模型——你的 Agent 八月跑的账单不是十月跑的账单。其次,替换层已作为产品交付:LLM Gateway 的 Smart Route 于 9 月 25 日发布,把供应商侧路由做成可购买的功能,而 Anthropic 的自适应回退(“在约 0.1% 的任务中回退,主要在 Terminal-Bench,一律回退至 Sonnet 5”,据 AA 测试)是模型调用内部的同一机制。两者都不是不当行为——DeepSeek 事件表明供应商甚至可以宣布一次全舰队模型替换、再在用户压力下 45 小时后撤回。路由决策是真实的,而且属于握着运行时的人。
在这个背景下,按定价表采购有三种具体失败模式:
- 基准标题失败。 Sonnet 5.5 在同一次发布中同时领跑能力故事(索引第 2,Terminal-Bench 4.0 64%)与成本故事(每任务便宜 30%)——两者都真,但对照不同基线。读了发布帖与基准表、却没读 Token 那一列的采购审批,会通过桌上最贵的每任务成本配置。
- 对努力等级失明的预测。 大多数公开的成本算术假设公开的设置。AA 的扫测显示 Sonnet 5.5 的账单随 effort 摆动(最高 $7.60 对 Sonnet 5 约 $5.00;“便宜 30%”所在的低/中档);建立在 API 默认值上的预测,只会继承供应商 SDK 升级逻辑为每个任务挑中的档位。
- 对缓存失明的单价。 相隔 30 天的两个 Anthropic 模型选择了相反的轴——Sonnet 5.5 让 Token 保持昂贵,Opus 5.5 把缓存读取做便宜。一个代理工作负载的实际缓存命中率(长而稳定的系统提示;重复的工具 schema;大块检索上下文)现在是两者谁更便宜的最大单一决定因素——而大多数 RFQ 流程从不询问这个数字。
这些都不是供应商欺骗。三者都是一个市场的正常输出——它的单位经济在自家定价语言之下发生了位移。AA 用一句话给出了同样的结论:“Sonnet 5.5 按 Token 便宜,但按任务可能很贵。”
合同:能活过下一次发布的四条条款
解法不是挑出赢的那家实验室;在每任务成本上,赢家每周都变(pricepertoken 计数器每月移动)。解法是把决策仪表化,让下一次替换成为一次有实测数据的配置变更,而不是发票上的惊吓。四条条款对应本站在每个代理中构建的同一个运行时:
1. 按步固定模型 ID,并记录服务模型而非请求模型。 路由层是运营者基础设施。model 字段存在于你的 Agent 配置中——在我们的参考运行时里,Agent 以 provider + name 引用注册的模型资源,更换模型是数据操作而非重新部署。审计轨迹记录每次工具调用实际服务的模型(DeepSeek 文章覆盖完整事件模式)。静默换掉你模型的供应商,现在会留下一个看得见的 diff。
2. 按每任务成本加每周上限签约,而不是按 Token 加每月发票。 每任务定价正在成为公开发布的第一方指标(OpenAI 在发布表格中公布;AA 用同样的任务测所有人)。一份范围明确的合同会写明工作负载(步数、上下文形状、预期缓存命中率)、每步类别的模型与努力档,以及每任务的实测上限——以供应商公布的每任务价格为基准行。六成本向量框架提供审计清单;第五个向量(供应商替换风险)就是本节操作化的条款。
3. 把努力旋钮当作采购面来预算 Token,而不是开发者设置。 Sonnet 5.5 横跨 effort 档位 30 倍的账单摆动是具体案例。路由层应把推理努力当作每步类别的类型化配置字段——升级阈值显式、上限在运行时硬停(长时运行代理的成本上限模式),升级策略在审计轨迹中可见。在每天 1,200 步上默认“最高努力”,是一个从未被做出的采购决策。
4. 在把一支舰队押上去之前,先在自己的负载上测试所声称的效率。 Anthropic 的“最多低 30%”是诚实的、有范围的、且依赖工作负载——AA 的反测 $7.60 同样诚实、有范围、依赖工作负载。两者都不会告诉你自己的账单。30 分钟试点:取一周真实的 Agent 运行,在每一档努力下对着候选模型重放,逐步测量 Token 与缓存命中率,把三个数字(定价表、Token 账单、实测每任务)放进采购一页纸。TypeSafe Jev 三层栈让这件事连续化——一个校准的决策层分类器盯住每类步的账单,因为监视者每次调用几乎免费。
有一条诚实标记适用于上述一切,包括算术框:所有实测每任务数字来自两个独立的当日测试来源(AA、kingy.ai)加上供应商公布的表格,且都在基准任务上,不是你的负载。AA 的 Intelligence Index 今年也已两次重定基线;这里引用的得分与成本是同一发布日期内的比较,下次重定基线时可能变动。把这一切当作试点将取代的起点基线——方向(定价表 ≠ 账单;Token 才是变量)是稳定的,精确常数不是。
真实档案上的结果
在本站写作所围绕的中等市场构建档案上运行这些数字:一个分销商的报价 Agent,每周 200 份 RFQ,跨目录查询、分层定价、知识图谱替代品与草稿生成,每周约 1,200 次模型步。Sonnet 5.5 最高档下,该档案每周账单约 $2,300。经过刻意路由——仅在谈判相关步骤用前沿努力档,查询用中档模型,分类用近地板价模型,缓存密集的上下文跨步共享——同样的负载每周账单低于 $300,而质量集中在业务结果真正所在之处:客户看到的那份报价。87% 的差距不是模型选择技巧;是运行时替你执行了一项发布帖从未替你做出的成本决策。在这些交易量下,集成层——MCP 模块、路由策略、审计轨迹——仍然是构建的 90%,是按 Token 定价表无法定价的部分;模型账单是噪音,上面的模式就是让你的账单保持为噪音而不是信号的方法。
相关阅读
- 推理经济学:为什么常驻生产型 Agent 现在负担得起 — 母文章:1,000 倍每 Token 成本崩塌、Jevons 悖论框架,以及本轮降价背后的超大规模资本开支背景
- 超越每 Token:重塑推理采购的六个成本向量 — 本文四条条款所嵌入的采购框架;Token 效率是其供应商连续性向量的模型层配对
- DeepSeek V4.1-Flash 与静默模型替换 — 让服务模型日志与固定 ID 合同从“谨慎”变为“必需”的替换事件
一家运行 NetSuite 与 BigCommerce 的中等市场分销商,通过受治理的 Agent 栈每周对 200 份 RFQ 报价:ERP 与三个供应商目录的 MCP 模块、零件替代品知识图谱、处理库存可用性锁定的 RFQ 引擎——以及一个按步类别固定模型 ID、限制每任务 Token、在每次调用记录服务模型的路由层。当下一篇发布帖声称“便宜 30%”时,这一层运行一周的重放试点,采购一页纸上得到的是三个数字而不是一个形容词。首个 Agent 5–8 周上线。
申请受限范围构建。 一周发现期。无论是否与我们合作,你都会得到系统清单、工作流地图与固定范围。
想为您的系统构建这个吗?
这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。
申请定制开发为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。