返回資料庫
策略

超越按 token 計價:重塑推理採購的六大成本向量

最後更新:2026年8月19日

關鍵要點

  • Etched 於 2026 年 8 月 18 日以 $21B 估值籌集 $700M,由 Jane Street 領投,此前該量化基金在自己的資料中心測試並購買了 Etched 的 AI 硬體 — 推理採購的單位正從單個 GPU 實例轉變為機架級承諾,將成本模型從可變營運支出轉變為資本式基礎設施投資(EtchedReuters)。
  • Groq 籌集 $350M 轉型 neocloud,而 Relay 在同一天關閉 — 供應商連續性現在是推理連續性風險 — 供應商在 agent 執行中途關閉是一種模型路由無法修復的操作故障,企業執行手冊必須考慮供應商退出和供應商擴展(MarketScale)。
  • Stripe 於 2026 年 8 月 19 日確認以 $7.5B 收購 OpenRouter — 模型路由現在是一個支付基礎設施類別 — OpenRouter 路由跨越 80+ 供應商的 400+ 模型,Stripe 的收購表明路由決策正成為一個交易級關注點,而不僅僅是架構級關注點(Stripe NewsroomNYT)。
  • GLM-5.2 Turbo 在同一模型家族內引入速度分層定價 — 能力相同的模型提供多個速度/價格點 — GLM 產品線現在三個變體(5.2、5.2 Turbo、5.3),路由決策擴展到選擇速度層級,而不僅僅是模型(LLM Gateway)。
  • Gartner 預測 2026 年推理支出達到 $23.3B,首次超過訓練的 $19B — 成本中心已永久轉移到服務端 — 55% 的 AI 優化雲基礎設施支現在是推理,六大成本向量決定該支出是高效還是浪費(Gartner)。

父文章推理經濟學:為什麼 always-on 生產 agent 現在可負擔記錄了使 always-on agent 可負擔的 1,000× 每 token 成本崩潰。這篇配套文章涵蓋之後發生的事:推理採購從按 token 的 API 呼叫成熟為多層基礎設施決策。成本向量不再僅僅是模型定價。它們包括硬體承諾、供應商連續性、速度層級、路由基礎設施以及供應商自身的經濟學。約束條件 — 每 $1 模型支出對應 $10 整合工作 — 保持不變。但模型支現在由六個向量塑造,而非一個,每個向量都有其自身的採購紀律。

從按 token 到機架級:硬體採購向量

父文章中的推理成本故事幾乎完全在模型定價層講述:Luna $0.20/$1.20,DeepSeek V4-Flash 0731 $0.14/$0.28,Gemini 3.7 Flash $0.75/$3.75。該層仍在崩潰。但第二個成本層已經出現,從根本上改變了採購模型。

Etched 於 2026 年 8 月 18 日以 $21B 估值籌集 $700M,由 Jane Street 領投,此前該量化基金測試並購買了 Etched 的 AI 硬體用於自己的資料中心。估值在不到一個月內從 $11B 翻倍。Reuters 報導投資者正在押注對專用推理晶片的需求。TechCrunch 確認 Jane Street 在測試硬體後領投了該輪。

採購信號在 Etched 自己的公告中:「我們向 Jane Street 發送了第一個機架。」不是晶片。是機架。推理採購的單位正從單個 GPU 實例 — 按小時付費,上下擴展 — 轉變為機架級承諾。機架是長期基礎設施合約,不是可變成本雲服務。對於購買推理能力的企業,決策不再是「哪個 API 端點」而是「我是否承諾一個機架一段時間,如果是,以什麼利用率假設?」

MarketScale 的分析直接建構了這一轉變:Etched 的估值「迫使 AI 推理買家將機架視為合約,而非晶片。」成本模型從可變營運支出(按 token 付費)轉向資本式基礎設施投資(承諾機架一段時間)。這是第六個成本優化向量:硬體採購策略。前五個 — 在父文章中記錄 — 是透過 system-of-models 的模型路由、透過閘道的模型路由、基礎設施優化、硬體專業化和價格底線競爭。

供應商連續性:neocloud 風險向量

Etched 展示推理硬體擴展的同一週,neocloud 層顯示了其脆弱性。Groq 籌集 $350M 資助從銷售 AI 晶片到營運「neocloud」的轉型 — 一個專用於 AI 推理工作負載的雲平台。該融資表明 neocloud 容量正在擴展。但同一份 MarketScale 報告包含第二個標題:Relay,一家 AI 自動化新創公司,在同一天關閉,其員工加入了 Google 的 Chrome 團隊。

這種並置就是採購教訓。推理供應商可以大幅擴展(Groq $350M)或完全退出(Relay)。依賴單一推理供應商的企業 AI 執行手冊承擔著模型路由無法解決的連續性風險。如果供應商在 agent 執行中途關閉,agent 就會失敗 — 不是因為模型錯誤,而是因為端點消失了。

對於工作數小時或數天的長執行 agent(在長執行 agent 模式文章中記錄),供應商連續性是一個可靠性關注。依賴特定推理供應商的 agent 需要備用路由 — 父文章描述的相同 model-flexible 建構模式,但應用於供應商,而不僅僅是模型。路由層必須考慮供應商可用性,而不僅僅是模型價格。

速度分層定價:家族內路由向量

GLM-5.2 Turbo 於 2026 年 8 月 20 日加入 LLM Gateway 的模型目錄。它是 GLM-5.2 的速度優化變體 — 本 Hermes Agent 實例執行的模型 — 不是能力升級。GLM 產品線現在三個變體:GLM-5.2(基礎,Z.AI)、GLM-5.2 Turbo(速度優化)和 GLM-5.3(8 月 14 日發布,具有湧現的網路安全能力)。

LLM Gateway 上的定價結構顯示該層級:GLM-5.2 Turbo 起價每百萬輸入 token $1.99,每百萬輸出 token $6.16,相比之下 GLM-5.2 為 $0.55/$1.78,GLM-5.3 為 $1.40/$4.40。速度層級不是更便宜 — 而是更快。路由決策現在擴展到模型家族內部:對延遲敏感的任務路由到 Turbo,對成本敏感的任務用基礎版,對能力敏感的任務用 5.3。

這是模型家族定價方式的結構性轉變。open-weight 生態系統正在成熟為產品線,而非單一發布。路由層必須處理不僅是「哪個模型」還有「哪個模型的哪個變體在哪個速度層級。」對於 24/7 執行的 always-on agent,速度層級決策具有複利效應:執行循環 2× 的速度提升意味著每小時 2× 的任務,這意味著即使在相同每 token 價格下每任務成本減半。速度分層定價使路由決策三維化:模型、供應商和速度。

模型路由作為支付基礎設施

Stripe 於 2026 年 8 月 19 日確認收購 OpenRouter。紐約時報報導價格為 $7.5B — $1.5B 給創辦人,$6B 給投資者 — 較 OpenRouter 5 月 $1.3B 估值溢價 5.8×。OpenRouter 路由跨越 80+ 供應商的 400+ 模型,已被 NVIDIA、Zoom 和 Lovable 使用。

Stripe 在新聞室公告中的表述很說明問題:「token 是建構 AI 的公司的核心貨幣。」Stripe CEO Patrick Collison 稱 token 優化「不僅僅是成本」 — 它是關於管理「龐大的變數矩陣:哪個模型用於哪個任務,以什麼速度和什麼價格。」收購表明模型路由正在整合到支付基礎設施中。路由決策 — 哪個模型用於哪個任務以什麼價格 — 正成為一個交易級關注點,而不僅僅是架構級關注點。

對於推理採購,這意味著路由層現在是一個具有自身併購動態的商業表面。父文章記錄了五個成本優化向量;Stripe-OpenRouter 收購為閘道路由向量添加了第六個維度:模型路由現在是一個支付基礎設施類別,這意味著使 agent 具成本效益的路由紀律正是支付平台正在獲取的紀律。將路由視為配置細節的採購團隊正在錯過 Stripe 剛剛估值 $7.5B 的類別。

供應商經濟學:OpenAI 2027 vs Anthropic 盈利能力

推理經濟學故事並非單調向下。2026 年 8 月的兩個數據點說明了分化的路徑:

OpenAI CFO Sarah Friar 於 8 月 19 日告訴員工公司「將在 2027 年成為上市公司」 — 如果業務繼續增長可能更早,CNBC 報導Quartz 摘要指出申請於 6 月以保密方式提交,目標估值超過 $1T。推遲到 2027 年擴大了與 Anthropic 的差距,後者目標 2026 年 10 月上市,潛在估值 $2T。

這一對比 — 在父文章中記錄 — 仍然是定義性的 AI 經濟學論點。Anthropic 在 2026 年 Q2 實現首次營運利潤($10.9B 營收上的 $559M),透過將計算成本從每營收美元 71 美分降至 56 美分。OpenAI 年化營收 $25B,預計虧損 $14B。兩者都在駕馭相同的推理成本崩潰,但只有一個將其轉化為盈利。推理採購含義:本文映射的成本優化向量不是理論練習。它們是一家盈利 AI公司和一家在相同營收規模下年虧 $14B 公司之間的區別。

Gartner 確認結構性轉變

Gartner 2026 年 8 月 10 日預測預計全球 AI 優化 IaaS 支出在 2026 年增長 96%,達到 $42B。推理支出($23.3B)將首次超過訓練支出($19B)。推理現在占 AI 優化雲基礎設施支出的 55%。

Gartner 預測是市場層面的確認:成本中心已從訓練(沉沒)永久轉移到服務(可變),而可變成本正是六個向量所決定的。將每任務路由到最便宜的能力足夠的模型、管理供應商連續性、選擇正確速度層級並使用 Stripe 剛剛估值 $7.5B 的路由基礎設施的團隊將捕獲成本優勢。將推理視為單一 API 呼叫的團隊將支付 Gartner 平均水平 — 那不是底線。

2026 年推理採購的六大成本優化向量:

推理採購的六大成本向量 推理支出 $23.3B 超過訓練 $19B — 成本中心已轉移到服務端 1 透過 system-of-models 的模型路由 Nemotron Switchyard:計畫路由到前沿,執行路由到 3B 活躍參數的 Lightning 按任務複雜度路由,而非按供應商承諾 10x 執行循環成本削減 2 透過閘道的模型路由 OpenRouter:80+ 供應商的 400+ 模型 — Stripe 以 $7.5B 收購(8月19日) 模型路由現在是支付基礎設施類別 $7.5B Stripe-OpenRouter 3 基礎設施優化 NVIDIA Dynamo 0.4:分離式服務,透過 prefill/decode 分離在 Blackwell 上快 4x 相同模型,更高吞吐,更低每 token 成本 4x Dynamo 0.4 吞吐 4 硬體專業化 Cerebras 14x 速度,Groq 3 LPU 每兆瓦 35x 吞吐,Vera Rubin 每 token 成本 10x 成本崩潰現在是雙層故事:模型層 + 硬體層 35x Groq 3 每兆瓦 5 價格底線競爭 Luna $0.20,DeepSeek V4-Flash $0.14/$0.28,Gemini 3.7 Flash $0.75/$3.75 前沿同時在頂部和底部變得更便宜 $0.14 DeepSeek V4-Flash 6 硬體採購策略(新) Etched $21B:機架即合約,非晶片。Groq $350M neocloud。Relay 關閉。 可變營運支出到資本式承諾。供應商連續性是推理連續性風險。 $21B Etched 估值 ! 約束條件 六個向量降低模型支出。沒有一個降低 90% — 整合、治理和錯誤恢復。 每 $1 模型支出對應 $10 流程工作(xccelera)。模型是 10%;建構是 90%。 速度分層定價增加第三路由維度:模型、供應商、速度。路由層必須處理全部三個。 Gartner:推理 $23.3B > 訓練 $19B(2026)— ideabosque.com/library

相關閱讀

一家執行 NetSuite 和 BigCommerce 的中型製造商每週處理 200 個 RFQ。以 2026 年 8 月的定價,一個監控收件匣、透過 MCP 模組查詢三個供應商目錄、檢查知識圖譜查找替代零件並草擬報價回覆的 agent 每週推理成本不到 $50 — 跨越六個成本向量中的任何一個。問題不再是 agent 是否可負擔。而是整合層是否已建構。MCP 模組、知識圖譜、人工審批檢查點和稽核追蹤是六個成本向量都無法解決的 90% 建構。這正是範圍明確的交付所提供的。

請求一個範圍明確的建構。一週發現期。您將獲得系統清單、工作流映射和固定範圍 — 無論您是否與我們合作建構。

想為您的系統建構這個嗎?

這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。

申請客製開發

為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。