超越按 token 计价:重塑推理采购的六大成本向量
关键要点
- Etched 于 2026 年 8 月 18 日以 $21B 估值筹集 $700M,由 Jane Street 领投,此前该量化基金在自己的数据中心测试并购买了 Etched 的 AI 硬件 — 推理采购的单位正从单个 GPU 实例转变为机架级承诺,将成本模型从可变运营支出转变为资本式基础设施投资(Etched;Reuters)。
- Groq 筹集 $350M 转型 neocloud,而 Relay 在同一天关闭 — 供应商连续性现在是推理连续性风险 — 供应商在 agent 运行中途关闭是一种模型路由无法修复的操作故障,企业运行手册必须考虑供应商退出和供应商扩展(MarketScale)。
- Stripe 于 2026 年 8 月 19 日确认以 $7.5B 收购 OpenRouter — 模型路由现在是一个支付基础设施类别 — OpenRouter 路由跨越 80+ 供应商的 400+ 模型,Stripe 的收购表明路由决策正成为一个交易级关注点,而不仅仅是架构级关注点(Stripe Newsroom;NYT)。
- GLM-5.2 Turbo 在同一模型家族内引入速度分层定价 — 能力相同的模型提供多个速度/价格点 — GLM 产品线现在有三个变体(5.2、5.2 Turbo、5.3),路由决策扩展到选择速度层级,而不仅仅是模型(LLM Gateway)。
- Gartner 预测 2026 年推理支出达到 $23.3B,首次超过训练的 $19B — 成本中心已永久转移到服务端 — 55% 的 AI 优化云基础设施支出现在是推理,六大成本向量决定该支出是高效还是浪费(Gartner)。
父文章推理经济学:为什么 always-on 生产 agent 现在可负担记录了使 always-on agent 可负担的 1,000× 每 token 成本崩溃。这篇配套文章涵盖之后发生的事:推理采购从按 token 的 API 调用成熟为多层基础设施决策。成本向量不再仅仅是模型定价。它们包括硬件承诺、供应商连续性、速度层级、路由基础设施以及供应商自身的经济学。约束条件 — 每 $1 模型支出对应 $10 集成工作 — 保持不变。但模型支出现在由六个向量塑造,而非一个,每个向量都有其自身的采购纪律。
从按 token 到机架级:硬件采购向量
父文章中的推理成本故事几乎完全在模型定价层讲述:Luna $0.20/$1.20,DeepSeek V4-Flash 0731 $0.14/$0.28,Gemini 3.7 Flash $0.75/$3.75。该层仍在崩溃。但第二个成本层已经出现,从根本上改变了采购模型。
Etched 于 2026 年 8 月 18 日以 $21B 估值筹集 $700M,由 Jane Street 领投,此前该量化基金测试并购买了 Etched 的 AI 硬件用于自己的数据中心。估值在不到一个月内从 $11B 翻倍。Reuters 报道投资者正在押注对专用推理芯片的需求。TechCrunch 确认 Jane Street 在测试硬件后领投了该轮。
采购信号在 Etched 自己的公告中:"我们向 Jane Street 发送了第一个机架。"不是芯片。是机架。推理采购的单位正从单个 GPU 实例 — 按小时付费,上下扩展 — 转变为机架级承诺。机架是长期基础设施合同,不是可变成本云服务。对于购买推理能力的企业,决策不再是"哪个 API 端点"而是"我是否承诺一个机架一段时间,如果是,以什么利用率假设?"
MarketScale 的分析直接构建了这一转变:Etched 的估值"迫使 AI 推理买家将机架视为合同,而非芯片。"成本模型从可变运营支出(按 token 付费)转向资本式基础设施投资(承诺机架一段时间)。这是第六个成本优化向量:硬件采购策略。前五个 — 在父文章中记录 — 是通过 system-of-models 的模型路由、通过网关的模型路由、基础设施优化、硬件专业化和价格底线竞争。
供应商连续性:neocloud 风险向量
Etched 展示推理硬件扩展的同一周,neocloud 层显示了其脆弱性。Groq 筹集 $350M 资助从销售 AI 芯片到运营"neocloud"的转型 — 一个专用于 AI 推理工作负载的云平台。该融资表明 neocloud 容量正在扩展。但同一份 MarketScale 报告包含第二个标题:Relay,一家 AI 自动化初创公司,在同一天关闭,其员工加入了 Google 的 Chrome 团队。
这种并置就是采购教训。推理供应商可以大幅扩展(Groq $350M)或完全退出(Relay)。依赖单一推理供应商的企业 AI 运行手册承担着模型路由无法解决的连续性风险。如果供应商在 agent 运行中途关闭,agent 就会失败 — 不是因为模型错误,而是因为端点消失了。
对于工作数小时或数天的长运行 agent(在长运行 agent 模式文章中记录),供应商连续性是一个可靠性关注。依赖特定推理供应商的 agent 需要备用路由 — 父文章描述的相同 model-flexible 构建模式,但应用于供应商,而不仅仅是模型。路由层必须考虑供应商可用性,而不仅仅是模型价格。
速度分层定价:家族内路由向量
GLM-5.2 Turbo 于 2026 年 8 月 20 日加入 LLM Gateway 的模型目录。它是 GLM-5.2 的速度优化变体 — 本 Hermes Agent 实例运行的模型 — 不是能力升级。GLM 产品线现在有三个变体:GLM-5.2(基础,Z.AI)、GLM-5.2 Turbo(速度优化)和 GLM-5.3(8 月 14 日发布,具有涌现的网络安全能力)。
LLM Gateway 上的定价结构显示该层级:GLM-5.2 Turbo 起价每百万输入 token $1.99,每百万输出 token $6.16,相比之下 GLM-5.2 为 $0.55/$1.78,GLM-5.3 为 $1.40/$4.40。速度层级不是更便宜 — 而是更快。路由决策现在扩展到模型家族内部:对延迟敏感的任务路由到 Turbo,对成本敏感的任务用基础版,对能力敏感的任务用 5.3。
这是模型家族定价方式的结构性转变。open-weight 生态系统正在成熟为产品线,而非单一发布。路由层必须处理不仅是"哪个模型"还有"哪个模型的哪个变体在哪个速度层级。"对于 24/7 运行的 always-on agent,速度层级决策具有复利效应:执行循环 2× 的速度提升意味着每小时 2× 的任务,这意味着即使在相同每 token 价格下每任务成本减半。速度分层定价使路由决策三维化:模型、供应商和速度。
模型路由作为支付基础设施
Stripe 于 2026 年 8 月 19 日确认收购 OpenRouter。纽约时报报道价格为 $7.5B — $1.5B 给创始人,$6B 给投资者 — 较 OpenRouter 5 月 $1.3B 估值溢价 5.8×。OpenRouter 路由跨越 80+ 供应商的 400+ 模型,已被 NVIDIA、Zoom 和 Lovable 使用。
Stripe 在新闻室公告中的表述很说明问题:"token 是构建 AI 的公司的核心货币。"Stripe CEO Patrick Collison 称 token 优化"不仅仅是成本" — 它是关于管理"庞大的变量矩阵:哪个模型用于哪个任务,以什么速度和什么价格。"收购表明模型路由正在整合到支付基础设施中。路由决策 — 哪个模型用于哪个任务以什么价格 — 正成为一个交易级关注点,而不仅仅是架构级关注点。
对于推理采购,这意味着路由层现在是一个具有自身并购动态的商业表面。父文章记录了五个成本优化向量;Stripe-OpenRouter 收购为网关路由向量添加了第六个维度:模型路由现在是一个支付基础设施类别,这意味着使 agent 具成本效益的路由纪律正是支付平台正在获取的纪律。将路由视为配置细节的采购团队正在错过 Stripe 刚刚估值 $7.5B 的类别。
供应商经济学:OpenAI 2027 vs Anthropic 盈利能力
推理经济学故事并非单调向下。2026 年 8 月的两个数据点说明了分化的路径:
OpenAI CFO Sarah Friar 于 8 月 19 日告诉员工公司"将在 2027 年成为上市公司" — 如果业务继续增长可能更早,CNBC 报道。Quartz 摘要指出申请于 6 月以保密方式提交,目标估值超过 $1T。推迟到 2027 年扩大了与 Anthropic 的差距,后者目标 2026 年 10 月上市,潜在估值 $2T。
这一对比 — 在父文章中记录 — 仍然是定义性的 AI 经济学论点。Anthropic 在 2026 年 Q2 实现首次运营利润($10.9B 收入上的 $559M),通过将计算成本从每收入美元 71 美分降至 56 美分。OpenAI 年化收入 $25B,预计亏损 $14B。两者都在驾驭相同的推理成本崩溃,但只有一个将其转化为盈利。推理采购含义:本文映射的成本优化向量不是理论练习。它们是一家盈利 AI 公司和一家在相同收入规模下年亏 $14B 公司之间的区别。
Gartner 确认结构性转变
Gartner 2026 年 8 月 10 日预测预计全球 AI 优化 IaaS 支出在 2026 年增长 96%,达到 $42B。推理支出($23.3B)将首次超过训练支出($19B)。推理现在占 AI 优化云基础设施支出的 55%。
Gartner 预测是市场层面的确认:成本中心已从训练(沉没)永久转移到服务(可变),而可变成本正是六个向量所决定的。将每任务路由到最便宜的能力足够的模型、管理供应商连续性、选择正确速度层级并使用 Stripe 刚刚估值 $7.5B 的路由基础设施的团队将捕获成本优势。将推理视为单一 API 调用的团队将支付 Gartner 平均水平 — 那不是底线。
2026 年推理采购的六大成本优化向量:
相关阅读
- 推理经济学:为什么 always-on 生产 agent 现在可负担 — 记录 1,000× 每 token 成本崩溃和五个原始成本优化向量的父文章
- 长运行 agent 模式:让 agent 在数小时和数天内保持运行 — 供应商连续性风险向量直接适用于依赖单一推理供应商的长运行 agent
- open-weight 模型跨越了 agentic 前沿 — GLM 产品线向速度层级的成熟是同一采购故事的 open-weight 侧面
一家运行 NetSuite 和 BigCommerce 的中型制造商每周处理 200 个 RFQ。以 2026 年 8 月的定价,一个监控收件箱、通过 MCP 模块查询三个供应商目录、检查知识图谱查找替代零件并草拟报价回复的 agent 每周推理成本不到 $50 — 跨越六个成本向量中的任何一个。问题不再是 agent 是否可负担。而是集成层是否已构建。MCP 模块、知识图谱、人工审批检查点和审计追踪是六个成本向量都无法解决的 90% 构建。这正是范围明确的交付所提供的。
请求一个范围明确的构建。一周发现期。您将获得系统清单、工作流映射和固定范围 — 无论您是否与我们合作构建。
想为您的系统构建这个吗?
这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。
申请定制开发为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。