返回资料库
策略

TypeSafe Jev 与智能体模型栈的第三层

最后更新:2026年9月19日

关键要点

  • TypeSafe AI 于 2026 年 9 月 18 日发布 Jev——首个基于 Transformer、输出校准概率而非文本的商业模型——由于用户预先定义输出空间,该模型在构造上不可能产生幻觉(TechCrunch)。
  • Vercel 将基于 OpenAI Luna 的安全分类器替换为 Jev,运行速度提升 5–18 倍且精度更高;Bryo AI 发现 Gemini 在邮件分类上略更准确,但成本高出 10–20 倍——同一模式下的两个独立采用数据点。
  • Gartner 现已将"AI Agents and Assistants"单列为一个市场:2025 年 165 亿美元、2026 年 292 亿美元、2027 年 655 亿美元——智能体软件支出到 2027 年接近翻倍,决策层模型正是这一预算的采购对象之一。
  • 架构启示是一个三层模型栈——前沿推理层、开放权重通用层、校准决策层——它改变了智能体系统路由工作、执行护栏、观测行为以及验证 kill-switch 决策的方式。

用 LLM 对智能体的每个动作做安全分类,是一种与被保护对象同等昂贵的护栏。Vercel 一直运行 OpenAI 的 ChatGPT Luna 5.6 作为其智能体基础设施的安全分类器——在执行前审查命令——直到本周。在用 Jev 替换它之后,分类器运行速度提升 5–18 倍且精度更高。在 Bryo AI,Gemini 在邮件分类精度上略胜 Jev 一筹,但成本高出 10–20 倍。两家公司从不同方向得出了同一结论:一大类智能体决策根本不需要语言生成,为一个 LLM 产出的、随即被丢弃的散文式文本付费,是错误的成本结构。

Jev 由 TypeSafe AI 于 9 月 18 日发布,是为这一类工作构建的首个商业模型。它基于 Transformer 但不是大语言模型:它在用户预先定义的输出空间上输出校准概率——该公司称之为"校准决策"。TypeSafe 联合创始人 Diogo Almeida(前 OpenAI 研究员,曾参与 ChatGPT 与 RLHF)向 TechCrunch 阐述了这一论点:"四年来我们极其擅长人类语言,但这对自动化没有用处,因为计算机说的是另一种语言。"本文描绘一个非语言决策模型如何改变智能体架构——模型路由、护栏、可观测性与 kill-switch 验证——以及它在生产级 B2B 系统实际运行的模型栈中的位置。

Jev 是什么,哪些仍然未知

先看可验证的事实。Jev 在用户定义的输出空间上产出概率,而非自由文本。其输出 token 免费,输入按十亿而非百万计量——这一定价颠覆了 LLM 的成本结构,因为生成是语言模型最昂贵的部分,而 Jev 不做生成。它完全使用合成数据训练,采用 Almeida 称为"校准决策强化学习"的技术;发布后需求一度压垮了 API——该公司在发布后一度丧失了服务用户的能力

诚实性标记与宣传同样重要。Almeida 对架构讳莫如深,外部观察者怀疑其构建于某个开放权重 LLM 之上——"不可能幻觉"这一属性来自受约束的输出空间,而非任何已公开的架构细节。Vercel 与 Bryo 的对比是开发者自述,而非基准测试评估。Jev 仅限早期访问——它是三个受控发布的 9 月模型之一(与 Anthropic 的 Mythos 5.1 和 Google 的 Fairwind 专属 Gemini 3.8 Flash Cyber 并列)——因此采用数字建立在受控访问的群体之上。Earendil CTO、开源模型 harness Pi 的创造者 Armin Ronacher 预计,在实用性已经可见的当下,竞争者会跟进:"大概因为 LLM 太便宜且有补贴,你常常还不必发挥创造力。"将 Jev 视为品类验证,而非确定的供应商选择。

智能体模型栈的第三层

生产级智能体系统已经在运行两个行为截然不同的模型层。前沿推理层负责规划、起草和处理歧义。开放权重通用层——DeepSeek、Qwen、GLM 的发布已将成本压低的模式——以远低于前沿的价格执行高流量工具调用与校验。缺失的是第三层,用于既非推理也非语言的工作:智能体系统每天数以百万计的小型分类决策。这条命令是否安全可执行。这条 trace 是否像一次越狱。这个工作负载是否需要昂贵的模型。这个价格偏差是否真实。

把语言模型放在这些决策上,一直只是因为不存在商业替代品。Gartner 九月的预测将智能体软件市场规模定为 2025 年 165 亿美元、2026 年 292 亿美元、2027 年 655 亿美元——到 2027 年接近翻倍——这笔建设的每一美元都让忽视决策层问题的代价更高,因为每个已部署的智能体都会成倍增加护栏检查、路由调用与验证流程的流量,而这些流量目前默认全部流经 LLM。

三层智能体模型栈——两个语言层,以及为其周边流量定价的非语言决策层:

三层智能体模型栈 前沿推理层 · 开放权重通用层 · 校准决策层——每层按其职责定价 1 前沿推理层——规划、起草、处理歧义 昂贵的一层,谨慎使用:谈判策略、异常处理、面向客户的语言。 按百万 token 计量。这一层的流量是预算驱动因素。 $/Mtok 定价 2 开放权重通用层——执行高流量语言工作 工具调用、目录查询、摘要、校验——按任务类别在网关后路由。 DeepSeek、Qwen、GLM 级模型:接近前沿的能力,执行层成本。 按任务类别路由 3 校准决策层——概率,而非散文 护栏检查、路由决策、trace 分类、kill-switch 验证。 输出 token 免费,输入按十亿计量。Vercel:分类器快 5–18 倍。Bryo:比 Gemini 便宜 10–20 倍。 构造上不可能幻觉——输出空间由用户定义,而非模型。 TypeSafe Jev — 2026 年 9 月 18 日 决策层是智能体流量的聚集地。 Gartner 预测 AI 智能体与助手市场:1650 亿美元(2025)→ 292 亿美元(2026)→ 655 亿美元(2027)——每个已部署的智能体都会放大决策层流量。 用生成式 LLM 承载这些决策,是最昂贵的可能基底。 来源:TechCrunch 2026-09-18(Vercel 5–18x,Bryo 10–20x)· Gartner 2026-09-16 智能体细分预测 · typesafe.ai 三层智能体模型栈—— ideabosque.com/library

它如何改变智能体架构

当校准决策层成为商业选项,四个架构决策的形态随之改变。每一项都对应生产级智能体系统已有的决策;变化的是成本结构,以及对"判断住在哪里"的诚实。

模型路由在高频场景下变得经济上合理。Ronacher,最被期待的具体用法是预测某个工作负载是否需要特定模型——只有当路由调用本身近乎免费时,实时分拣才成为可能。DeepSeek 自动路由事件展示了当操作者无法控制时,供应商侧自动路由的代价:静默的模型替换,在约 45 小时后因用户施压而逆转。廉价的决策层把路由从供应商网关移到操作者自己的运行时——用你自己的分类器做路由,把备用模型藏在你自己的开关之后,替换风险就从"意外"变成"设计选择"。

护栏获得概率契约。 Ronacher 对 Jev 的概括:"它把幻觉问题稍稍转嫁给用户"——由操作者声明阈值。如果一个决策返回 50%,把它当作掷硬币并转给人工处理;达到 95%,就执行。这比询问 LLM"这安全吗"并从从未校准过的散文式回答中解析置信度,是一份实质性更好的契约。治理检查清单中显式审批门控的模式保留下来;变化在于门控检查本身运行在一个无法虚构"是"的模型上。

可观测性获得廉价的监视器。 Almeida 自己的说法:用智能体监控智能体很昂贵,但用 Jev 来做并不贵——追踪 LLM 智能体 trace 并防范越狱,恰恰是决策层定价所针对的高流量、低歧义分类工作。多数团队想要却因"监控 LLM 的成本直逼生产 LLM"而放弃的可观测性架构,当监视器成本低一个数量级时就变得可行。

Kill-switch 验证获得独立评估器。 依赖 LLM 判断触发的 kill switch,会继承 LLM 的失败模式。用一个决策层模型评估"这条 trace 是否符合中止标准",为 kill-switch 层提供了一个足够便宜、可在每个动作上运行的检查——经过校准而非凭感觉,且在架构上独立于被评估的智能体。kill-switch-by-design 模式一直要求中止决策独立于被中止的智能体;非语言评估器是这种独立性的第一个商业基底。

成本算术,直说

这些对比数据点是自述的,因此要谨慎看待——但方向在两个独立采用者之间保持一致。Vercel:比基于 Luna 的分类器快 5–18 倍,精度更高。Bryo:Gemini 在商务邮件分类上略更准确,但价格是 10–20 倍。两个数字背后的结构相同:LLM 把大部分算力花在生成语言上,而分类流水线随即丢弃这些语言;决策模型则把算力花在判别本身——输出免费,输入按十亿计量。在生产级智能体的流量画像下——每天数千次护栏检查、每个请求一次路由调用、每步一次 trace 评估——决策层是唯一以"单次调用近乎免费"为设计目标的层,而如今智能体恰恰从市场上最昂贵的模型那里租用这一层。

这一切都不会让决策层变成推理器。它无法起草报价、谈判例外或撰写客户邮件——前两层仍然拥有这些工作。主张更为狭窄:围绕智能体语言工作的决策流量,已经超出语言模型作为基底的承载能力,而首个为这一流量构建的商业模型已于 2026 年 9 月 18 日发布。

一个代表性的构建

一家中型分销商在 NetSuite 与 BigCommerce 上运行 24 小时报价智能体,此前为每个报价决策向前沿模型付费分类:这个折扣是否在政策内、供应商回复是否完整、这条 trace 是否需要人工复核。模型路由决策(五决策架构中的第三项)拆分了工作:前沿模型负责起草与谈判,执行级的开放权重模型处理目录与价格查询,校准决策层分类器运行护栏——命令安全检查、trace 分类,以及决定每一步由哪一层处理的路由调用。分类器的概率输出让升级策略显式化:高于 0.95 的决策自动解决,低于 0.50 的转人工,中间带附带概率排队复核。每个报价的护栏成本从 LLM 费率降到可以忽略不计,审计轨迹也改善了——每次升级决策现在携带一个校准后的数字,而非散文式裁决。

在前沿推理层、开放权重通用层与决策层构成的统一运行时背后,用显式升级阈值构建三层栈,是一次范围明确的构建,而非研究项目。

申请一次范围明确的构建。 为期一周的探索。你将获得系统清单、工作流地图与固定范围——无论你是否与我们合作。

相关阅读

想为您的系统构建这个吗?

这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。

申请定制开发

为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。