Bedrock vs OpenAI:为生产级智能体选择托管 AI 平台
关键要点
- OpenAI 于 2026 年 8 月 21 日将 GPT-5.6 Sol API 和信用定价降低超过 20%,为期三个月 — 一周内第二次前沿模型大幅降价,紧随 OpenRouter 50% 的降幅,为 12 月之前做出的任何平台决策创造了时间敏感的 TCO 比较窗口(OpenAI Community)。
- OpenAI 企业收入在 7 月以 400 亿美元年化运行率超越消费端收入,企业客户增长 32% — 企业-消费交叉比预期更早到来,证实 B2B AI 是核心商业引擎,为平台选择决策提供了具体的跑道数据(CNBC)。
- Ramp 数据显示 619 倍的支出差距 — 美国企业前 1% 每员工在 AI 上花费 7,400 美元,而中位数为 11.95 美元 — 即使在最重消费者中也存在价格敏感性;Fable 5 价格为 GPT-5.6 Sol 的两倍,仅占 Anthropic token 的 6%,而 Sol 占 OpenAI token 的 25%(PYMNTS;TechCrunch)。
- OpenAI Private Safety Processing 提供零数据保留监控,而 Anthropic 的 Fable 5 要求 30 天数据保留 — 隐私与安全架构现在是平台选择维度,而非合规脚注,这一选择决定了哪些客户数据离开您的环境。
- Etched 以机架级合约达到 210 亿美元估值,而 Relay 在 Groq 融资 3.5 亿美元的同一周关闭 — neocloud 和硬件供应商连续性现在是推理连续性风险,没有平台 SLA 能完全覆盖。
生产级 AI 智能体的平台决策曾经很简单:选最好的模型,调用 API,发布。在 2026 年 8 月,这个决策有七个维度,而模型基准是唯一可以安全降低优先级的。OpenAI 将 GPT-5.6 Sol 降价超过 20%,为期三个月。Anthropic 的 Fable 5 以两倍价格令人失望。OpenAI 企业收入超越消费端,达到 400 亿美元运行率。Ramp 覆盖 70,000+ 家企业的数据显示 619 倍支出差距,即使在顶级消费者中也存在价格敏感性。问题不再是谁的模型评分最高 — 而是哪个平台能通过 12 个月的成本、隐私和供应商稳定性审计。
决定平台的七个维度及其关键数据点:
本文将决策映射到三个托管平台 — AWS Bedrock、OpenAI API 和 Anthropic Claude(直连及通过 Bedrock) — 对照现在决定您的生产级智能体是否保持可负担、合规和在线的七个维度。下方的决策矩阵承担核心分析。后续章节用平台选择决策所需的一手数据解释每个维度。
决策矩阵
| 维度 | AWS Bedrock | OpenAI API(直连) | Anthropic Claude(直连 / 通过 Bedrock) |
|---|---|---|---|
| 模型选择 | 多模型:通过单一 API 使用 Claude、Llama、Mistral、Titan、DeepSeek | 仅 OpenAI:GPT-5.6 Sol、o-series、Codex | 仅 Anthropic:Claude Mythos 5、Fable 5、Opus 5 |
| 成本结构(2026年8月) | 按 token,批量层级,承诺支出的 Provisioned Throughput | 按 token,GPT-5.6 Sol 降价 20%+ 持续 3 个月,Codex/Work 基于信用 | 按 token,Fable 5 约 $10/M(2× GPT-5.6 Sol),30 天保留开销 |
| 数据驻留 | AWS 区域隔离,现有合规姿态 | 美国端点,通过 Private Safety Processing 实现 ZDR | Fable 5 要求 30 天保留,部分层级提供 ZDR |
| 隐私架构 | 继承 AWS 数据治理;不用您的数据训练 | Private Safety Processing:兼容 ZDR 的跨会话监控 | Fable 5 的 30 天数据保留引发用户不满 |
| 推理前执行 | Guardrails 服务(可配置),无内置智能体 kill switch | Inference Hooks(推理前否决),轨迹级监控 | Claude Enterprise Inference Hooks(推理前否决,三层执行) |
| 供应商稳定性 | AWS 支持;超大规模 capex $195–205B(2026) | $40B 运行率,IPO 延至 2027,高管离职(CRO、COO) | $65B 运行率,Q2 盈利($559M),IPO 目标 $2T(2026年10月),超级投票权 |
| Neocloud / 硬件风险 | 屏蔽 — AWS 吸收硬件供应商轮换 | 暴露于 OpenAI 基础设施选择(Nvidia $105B 俄亥俄融资) | 暴露于 Anthropic 算力合作(Google、AWS) |
| 锁定概况 | API 级;多模型降低模型锁定但增加 AWS 锁定 | 高:仅 OpenAI 模型,Codex 信用,ChatGPT Work 生态 | 中:仅 Claude 模型,但可通过 Bedrock 作为备选 |
| 企业采购信号 | IBM-OpenAI 将 OpenAI 嵌入 IBM Consulting — 非 Bedrock 原生 | Ramp:40% 市场份额,Q3 增长更快 | Ramp:44% 市场份额,Fable 5 在价格+保留上表现不佳 |
成本结构:三个月窗口
成本维度在 2026 年 8 月发生了实质性变化。OpenAI 宣布 GPT-5.6 Sol 降价 20%+,涵盖 API 定价、Codex 信用和 ChatGPT Work 计划,为期三个月。此前 OpenRouter 于 8 月 18 日对 GPT-5.6 Sol 降价 50%,Grok 4.6 以 $2/$6 每百万 token 发布(低于可比定价 60%)。推理价格战现在是多向量市场动态:网关竞争、前沿实验室直降和新进入者低价。
Ramp 数据量化了这对平台选择的意义。Anthropic 的 Fable 5,定价约 $10 每百万 token(GPT-5.6 Sol 的两倍),首月仅占企业从 Anthropic 购买的 token 的 6%,占总支出的 11.4%。GPT-5.6 Sol 以半价占据 OpenAI token 的 25% 和支出的 23%。Ramp 经济学家 Ara Kharazian 的结论:"我们找到了企业愿意在 AI 上花费的新上限。"
对于平台决策,信号很明确:高端模型的价格溢价未能持续。基于 8 月定价的三个月 TCO 比较将显示 GPT-5.6 Sol 在相同工作负载类别下显著便宜。Bedrock 对 Claude 模型的按 token 定价与 Anthropic 的直连定价一致,因此成本维度不偏向 Bedrock 的 Claude 工作负载 — 但 Bedrock 的 Provisioned Throughput 选项允许承诺固定支出,如果您的智能体始终在线,这很重要。母文章 Inference Economics: Why Always-On Production Agents Are Now Affordable 涵盖了使始终在线智能体可行的 1,000 倍按 token 成本崩溃。伴随文章 Beyond Per-Token: Six Cost Vectors Reshaping Inference Procurement 涵盖了模型定价之外的六个成本优化向量。本文聚焦于这些成本向量所馈入的平台级决策。
隐私架构:ZDR vs 30 天保留
隐私维度在 2026 年 8 月成为平台选择标准。OpenAI 推出了 Private Safety Processing — 兼容零数据保留的跨会话安全监控,不存储客户提示或补全。相比之下,Anthropic 的 Fable 5 要求 30 天数据保留,这是监管者施加的要求,也是用户不满的来源。TechCrunch 报道 Ramp 的数据显示 Fable 5"在采用和实际应用中都令人失望,原因是价格+数据保留要求。"
对于运行处理客户数据、RFQ 内容或采购文档的生产级智能体的 B2B 团队,保留策略不是合规脚注 — 它决定了哪些数据离开您的环境以及持续多久。AWS Bedrock 继承 AWS 的数据治理姿态,对许多企业来说已映射到现有合规框架。OpenAI 的 Private Safety Processing 为不能允许保留的团队提供 ZDR 监控。Anthropic 的 30 天保留是受监管工作负载的硬约束。
更深入的分析见 Privacy vs Safety Architecture: The New Agent Governance Choice,涵盖四层 kill-switch 架构(网络、身份、应用、平台)和 ZDR-vs-保留权衡的细节。对于平台决策,总结是:如果您的智能体处理受 GDPR、HIPAA 或 ITAR 约束的数据,保留策略可能在成本比较开始之前就排除某个平台。
供应商稳定性:capex、IPO 和高管流失
平台决策是 12 到 36 个月的承诺。供应商稳定性维度评估平台提供商是否会在该期限内存在、保持独立并维持定价姿态。
三个数据点定义了当前格局。OpenAI CFO 告诉投资者企业收入超越消费端,年化运行率 $40B,7 月企业客户增长 32% — 强劲商业势头。但 OpenAI 的 CRO 在八个月后离职,COO 在八年后离开,IPO 延迟至 2027。Anthropic 达到 $65B 运行率,Q2 利润 $559M,2026 年 10 月 IPO 目标 $2T,但为创始人引入超级投票权,集中了治理。AWS 由 Alphabet 级别的 capex 支持 — Alphabet Q2 显示 $5.9B 现金消耗(十年来首次负自由现金流),2026 capex 指引提高至 $195–205B。
Neocloud 层增加了第二个稳定性风险。Etched 以机架级合约达到 $21B 估值。Groq 融资 $350M 进行 neocloud 转型。Relay 在同一周关闭。如果您的智能体依赖 neocloud 推理提供商且该提供商退出,智能体会失败 — 不是因为模型错误,而是因为端点消失了。AWS Bedrock 将您与 neocloud 轮换隔离,因为 AWS 在内部吸收硬件供应商风险。OpenAI 和 Anthropic 将您暴露于其基础设施选择,现在包括 Nvidia 融资 $105B 的俄亥俄数据中心。
企业采购信号:市场在做什么
8 月 13 日宣布的 IBM-OpenAI 战略合作是最清晰的企业采购信号:IBM 将 OpenAI 模型嵌入 IBM Consulting Advantage,配备数千名认证顾问,面向金融服务、政府、电信和零售。对于平台选择,这意味着 OpenAI 正在构建降低 B2B 团队部署风险的企业服务层 — 但也意味着 OpenAI 正在成为默认选择,以及随之而来的锁定。
Ramp 数据显示市场尚未稳定。Anthropic 以 44% 对 OpenAI 的 40% 领先(截至 7 月),但 OpenAI 在 Q3 增长更快。Salesforce Agentic Enterprise Index 显示每组织智能体从 5 个增至 13 个,几乎翻三倍。顶级消费者与中位数之间的 619 倍支出差距 意味着市场正在分化:一小群人重金押注,其他人谨慎购买。OpenAI CFO 点明了转变:"企业客户已从 tokenmaxxing 转向关注单位智能成本。"
对于平台选择,采购信号是:市场波动、价格敏感且未锁定。今天做出的平台决策应考虑成本领先者在 6 个月内变化的可能性。AWS Bedrock 的多模型访问是对冲这种波动性的工具 — 您可以在同一 API 合约内从 Claude 切换到 Llama 再到 DeepSeek。OpenAI 和 Anthropic 将您锁定在单一实验室的模型上。
推理前执行:治理维度
生产级智能体需要 kill switch。治理维度已从锦上添花成熟为平台选择标准。OpenAI 推出了 Inference Hooks — 推理前否决、轨迹级监控以及暂停长时间会话供人工审查的能力。Anthropic 推出 Claude Enterprise Inference Hooks,具备三层执行。AWS Bedrock 提供 Guardrails 作为可配置服务,但不包含内置智能体 kill switch — 您需自行构建。
四层 kill-switch 架构 — 网络(Portnox)、身份(Okta XAA)、应用(Straiker)、平台(ServiceNow)— 在 Kill Switch by Design: Agent Governance Architecture 中详述。对于平台决策,总结是:OpenAI 和 Anthropic 正在将推理前执行作为平台功能发布。AWS Bedrock 给您构建块但无执行。如果您的智能体处理金融交易、采购审批或客户数据修改,推理前执行差距就是生产就绪差距。
更新 — 2026-09-30:Gemini 4 Argon 的 Fairwind Program——托管平台的门控发布模式走向收敛
Google 的 Gemini 4 Argon 发布(2026 年 9 月 30 日)从另一个方向给整合论证补上了托管平台数据点:该模型首先经由 Google 的 Fairwind Program 向受信任的网络防御者开放——这是一个受控的、需凭证的渠道——之后再分阶段扩展到付费 API 客户与消费者,与美国政府的自愿性模型预发布访问流程保持一致。该模式与本文在 AWS 一侧跟踪的模式(Astra 自身的门控预发布访问)互为映照,如今已在三个实验室得到确认:前沿能力越来越多地经由受控访问计划而非首日全面开放来分发,而平台承诺(Bedrock、Vertex AI)都位于这些门控之内。对今天就要做平台决策的团队,评估问题要扩展到发布渠道治理之外:哪家提供商的访问计划覆盖你的合规姿态,以及在你的获批渠道承载该模型之前的窗口期里,你的工作负载要怎么做。网络防御还是该受控渠道点名的首项能力——Argon 以 68% 并列 CWE-bench v1 第一,且 Wiz 已通过 Scan for Good 用它发现了一个此前前沿模型都漏掉的关键医疗软件漏洞——这使得"安全类工作负载的准入资格"成为两条平台上防御团队的活采购问题。
更新 — 2026-10-02:没有云供应商的计算访问——Broadcom 租赁路径
本文所映射的计算访问图景(bedrock vs 直接 API)在 2026 年 10 月 1 日获得第三种结构:Broadcom 同意向 Anthropic 出借至多 $42 billion,以租用 Broadcom 芯片——一条供应商融资路径,把前沿实验室产能放到了本文比较所假设的两云供应商框架之外。对评估托管平台的企业而言,这个数据点是结构性的:Anthropic 的产能不再完全由 AWS/GCP 承诺结构中介;它如今包括一种由芯片供应商自己资产负债表出资的直接硅片租赁关系。平台选择的实践性后果方向不变——托管平台买给你的仍是集成与治理,而不只是产能——但产能风险问题(“如果供应商的配额不足怎么办?”)在 Anthropic 一侧有了新答案,而本文给出的多供应商路由指引再多一条理由:产能结构正按供应商融资模型分流,而不只是按云区域。
更新 — 2026-10-07:GLM-5.3-Flash——服务效率数据点落在中国芯片轴上
**GLM-5.3-Flash(2026 年 10 月 7 日)——服务效率数据点落在中国芯片轴上。**Z.ai 新推出的 320B 总参数/18B 激活原生多模态 MoE,定价每百万 token 0.15/0.50 美元(仅为 744B 旗舰 1.40/4.40 的十分之一),在大规模服务中运行于中国 AI 芯片上,配备 SGLang 上的专用推理引擎,宣称端到端服务性能提升 3 倍——硬件效率与每 token 成本堪比主流 NVIDIA GPU(Z.AI 博客)。对本文论述的平台决策而言,该数据点强化了主权轴的服务侧:托管平台对比(Bedrock vs OpenAI)将 NVIDIA 支撑的推理固定在美国司法辖区内,而开放权重路线现在拥有接近前沿的代理能力——Terminal Bench 84.3、AutomationBench 48.8 超越 Claude Opus 4.8——且其服务基础设施不依赖任何西方供应链。已经在权衡成本、隐私、供应商稳定性与主权能力访问的平台评估,如今还要权衡服务芯片的身居何处——对路由表中成本优化的 80% 部分,开放权重+自托管路线在全部五个轴上都有可信答案。
相关阅读
- Inference Economics: Why Always-On Production Agents Are Now Affordable — 母文章,记录使始终在线智能体可行的 1,000 倍按 token 成本崩溃
- Beyond Per-Token: Six Cost Vectors Reshaping Inference Procurement — 伴随文章,涵盖机架级合约、neocloud 风险和模型定价之外的路由基础设施
- Privacy vs Safety Architecture: The New Agent Governance Choice — ZDR-vs-保留权衡和四层 kill-switch 架构详解
更新 — 2026-10-05:主权开放权重之周——Mistral Large 4、Reflection Beam、Kolibri-1
Mistral Large 4(ML4)——公开预览(2026 年 10 月 6 日)。 Mistral 发布了 ML4("le Chonk")的公开预览:1T 参数 / 49B 激活的原生多模态 MoE,在 Mistral 位于欧洲的自有数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 训练,由 €3B 的 D 轮融资支撑——欧洲科技公司史上最大的股权融资。在网络安全上居开放权重模型之首(reproduce-and-patch 得分 82%——已测模型中的最高分;Claude Opus 5.5 与 GPT-6 Astra 因拒绝执行该任务而接近零分),金融与法律亦然。伴随的论点是网络主权主张:供应商级 refusal 会阻断正当的漏洞研究与事件响应——在事件进行中失去一项能力,本身就可能成为关键安全风险。 开放权重竞赛如今是三个区域——美国(Reflection Beam,501B / 23B 激活稀疏 MoE,算力效率比 GLM-5.2 级高出 3–4 倍,Nvidia 支持,Apache 2.0 权重本月)、欧洲(Mistral ML4;Aleph Alpha 的 Kolibri-1,78.1B / 3.46B 激活 MoE,在德国和芬兰构建训练,德英双语,Apache 2.0),中国(DeepSeek、Qwen、GLM)。对本文框架的平台决策而言,评估问题在成本、隐私、供应商稳定性之外新增第四个轴:主权能力获取——你的工作负载能否通过这样一条部署路线运行网络安全能力类(reproduce-and-patch 达 82%):其能力可用性不依赖某个拒绝层?如今每个企业技术栈对这个问题都有三个区域性的答案。
对买方算术而言:主权数据点并不改变平台对比的结构(集成与治理仍然买到可用性与合规),但容量/主权这一行项目现在要计入权重位于何处、谁能拒绝你的事件响应工作负载——这是 10 月 2 日的算力访问更新以融资术语引入、而本周模型格局新闻用能力术语坐实的评估维度。
一家运行 NetSuite 和 BigCommerce 的中型经销商需要决定哪个托管平台支持其报价智能体。智能体每周处理 200 个 RFQ,读取供应商目录,将报价写回 ERP,并处理客户特定定价层级。平台决策不是关于哪个模型在基准测试中得分最高 — 而是关于当 neocloud 提供商关闭时平台是否保持智能体在线,客户 RFQ 数据是否留在正确的司法管辖区,以及第 9 个月的按 token 成本是否与第 1 个月的按 token 成本相似。
GPT-5.6 Sol 三个月的价格窗口将在 12 月关闭。平台决策应在此之前做出 — 但应基于成本、隐私、供应商稳定性和推理前执行,而非三者已趋同的基准测试。
申请一个范围明确的构建。一周发现期。您将获得系统清单、工作流地图和固定范围 — 无论您是否与我们合作。
想为您的系统构建这个吗?
这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。
申请定制开发为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。