ライブラリに戻る
戦略

TypeSafe Jev とエージェントモデルスタックの第三層

最終更新:2026年9月19日

主要なポイント

  • TypeSafe AI は 2026 年 9 月 18 日に Jev をリリースしました——テキストではなく校準された確率を出力する、Transformer ベースの初の商用モデルです——ユーザーが出力空間を事前に定義するため、このモデルは構造的にハルシネーションを起こせません(TechCrunch)。
  • Vercel は OpenAI Luna ベースのセーフティ分類器を Jev に置き換え、5〜18 倍高速でより高い精度の結果を得ました。Bryo AI は、メール分類では Gemini の方がわずかに正確だがコストは 10〜20 倍と報告しています——同じパターンに関する 2 つの独立した採用データポイントです。
  • Gartner は「AI Agents and Assistants」を独立した市場として測定しています:2025 年 165 億ドル、2026 年 292 億ドル、2027 年 655 億ドル——エージェントソフトウェア支出は 2027 年にほぼ倍増し、ディシジョン層モデルはその予算が購入する対象の一部です。
  • アーキテクチャ上の帰結は 3 層のモデルスタック——フロンティア推論層、オープンウェイト汎用層、校準ディシジョン層——であり、エージェントシステムがワークのルーティング、ガードレールの適用、挙動の観測、キルスイッチ判定の検証を行う方法を変えます。

エージェントのすべてのアクションを LLM で安全分類するのは、それが守る対象と同等のコストがかかるガードレールです。Vercel は自社のエージェントインフラのセーフティ分類器として、実行前にコマンドを審査する OpenAI の ChatGPT Luna 5.6 を動かしていましたが、今週それをJev に置き換えたところ、分類器は 5〜18 倍高速に、より高い精度で動作するようになりました。Bryo AI では、Gemini がメール分類の精度で Jev をわずかに上回る一方で、コストは 10〜20 倍でした。2 社は別々の方向から同じ結論に達しました。エージェントの意思決定の大部分のクラスには言語生成がまったく必要なく、直後に捨てられる散文を LLM に生成させる支払い方は、誤ったコスト構造だというのです。

Jev は 9 月 18 日に TypeSafe AI がリリースした、そのクラスのワーク向けに作られた初の商用モデルです。Transformer ベースですが大規模言語モデルではありません。ユーザーが事前に定義した出力空間上の、校準された確率——同社はこれを「校準されたディシジョン」と呼びます——を出力します。TypeSafe の共同創業者で、ChatGPT と RLHF に携わった元 OpenAI リサーチャーの Diogo Almeida は TechCrunch にこう語りました。「私たちは 4 年間、人間の言語に極めて優れてきましたが、自動化には役立ちません。コンピュータは違う言語を話すからです」。本記事は、非言語的なディシジョンモデルがエージェントアーキテクチャの何を変えるか——モデルルーティング、ガードレール、オブザーバビリティ、キルスイッチの検証——と、本番の B2B システムが実際に運用するモデルスタックのどこに位置づくかを示します。

Jev の正体と、依然不明な点

まず検証可能な事実から。Jev は自由形式のテキストではなく、ユーザー定義の出力空間上の確率を生成します。出力トークンは無料で、入力は百万ではなく十億単位で計量されます——生成こそが言語モデルの高コスト部分であり、Jev は生成しないため、この価格設定は LLM のコスト構造を逆転させます。Almeida が「校準されたディシジョンからの強化学習」と呼ぶ手法で、合成データのみを使って学習されています。ローンチ後、需要が一時的に API を飽和させ、同社はしばらくの間ユーザーへの提供能力を失いました

正直さの指標は主張と同じくらい重要です。Almeida はアーキテクチャについて口を閉ざしており、外部の観察者はオープンウェイト LLM を基盤にしていると疑っています——「ハルシネーション不能」の性質は、公開されたアーキテクチャ詳細からではなく、制約された出力空間から導かれるものです。Vercel と Bryo の比較はベンチマーク評価ではなく開発者の自己申告です。さらに Jev は早期アクセス限定——9 月の 3 つのゲート付きリリース(Anthropic の Mythos 5.1、Google の Fairwind 専用 Gemini 3.8 Flash Cyber と並ぶ)の 1 つ——であり、採用数はアクセスを管理された集団に基づいています。Earendil の CTO でオープンソースモデルハーネス Pi の作者である Armin Ronacher は、有用性が見えた今、競合が追随すると予想します。「おそらく LLM が安く補助金付きなので、まだ創意工夫をする必要がないことが多いのだと思います」。Jev は、確立されたベンダー選択ではなく、カテゴリーの実証として扱うべきものです。

エージェントモデルスタックの第三層

本番のエージェントシステムは、すでに似ていない 2 つのモデル層を運用しています。フロンティア推論層は計画、起草、曖昧さへの対応を担います。オープンウェイト汎用層——DeepSeek、Qwen、GLM のリリースが低コスト化を推し進めたパターン——は、フロンティア価格の数分の一で高頻度のツール呼び出しと検証を実行します。欠けていたのは、推論でも言語でもないワークのための第 3 層です。エージェントシステムが毎日行う数百万の小さな分類判断——このコマンドは実行しても安全か。このトレースはジェイルブレイクに見えるか。このワークロードには高価なモデルが必要か。この価格の逸脱は本物か。

これらの判断に言語モデルを置くことがデフォルトだったのは、商用の代替が存在しなかったからにすぎません。Gartner の 9 月予測はエージェントソフトウェア市場を 2025 年 165 億ドル、2026 年 292 億ドル、2027 年 655 億ドルと測定しています——2027 年に向けてほぼ倍増——そしてこの投資の 1 ドル 1 ドルが、ディシジョン層の問いを無視するコストを引き上げます。デプロイされたエージェント 1 体 1 体が、現在デフォルトで LLM を流れるガードレールチェック、ルーティング呼び出し、検証パスの量を倍加させるからです。

3 層のエージェントモデルスタック——2 つの言語層と、その周辺の量を価格づける非言語ディシジョン層:

3層エージェントモデルスタック フロンティア推論層 · オープンウェイト汎用層 · 校準ディシジョン層——各層はその役割に応じて価格づけられる 1 フロンティア推論層——計画、起草、曖昧さへの対応 意図的に使う高価な層:交渉戦略、例外処理、顧客向けの言語。 100万トークン単位で計量。ここでの量が予算の駆動要因。 $/Mtok 価格 2 オープンウェイト汎用層——高頻度の言語ワークを実行 ツール呼び出し、カタログ照会、要約、検証——ゲートウェイの背後でタスククラス別にルーティング。 DeepSeek、Qwen、GLM クラスのモデル:フロンティア近接の能力を実行層のコストで。 タスククラス別ルーティング 3 校準ディシジョン層——散文ではなく確率 ガードレールチェック、ルーティング判断、トレース分類、キルスイッチ検証。 出力トークン無料、入力は10億単位で計量。Vercel:分類器が 5〜18 倍高速。Bryo:Gemini より 10〜20 倍安い。 構造的にハルシネーション不能——出力空間はモデルではなくユーザーが定義。 TypeSafe Jev — 2026年9月18日 ディシジョン層に、エージェントの量が集中します。 Gartner は AI エージェント・アシスタント市場を 165 億ドル(2025)→ 292 億ドル(2026)→ 655 億ドル(2027)と測定——デプロイされたエージェント 1 体ごとにディシジョン層の量が増幅されます。 これらの判断を生成的 LLM で賄うのは、最も高価な基板です。 出典:TechCrunch 2026-09-18(Vercel 5〜18倍、Bryo 10〜20倍)· Gartner 2026-09-16 エージェントセグメント予測 · typesafe.ai 3層エージェントモデルスタック—— ideabosque.com/library

エージェントアーキテクチャにとって何が変わるか

校準されたディシジョン層が商用オプションとして存在するようになると、4 つのアーキテクチャ決定の形が変わります。いずれも本番のエージェントシステムがすでに下している決定に対応し、変わるのはコスト構造と、運用上の判断がどこに宿るかについての誠実さです。

モデルルーティングが高頻度で経済的に合理的になります。 Ronacher によれば、最も要望の多い近接ユースケースは、あるワークロードが特定のモデルを必要とするかを予測すること——ルーティング呼び出し自体がほぼ無料になって初めて可能になる、リアルタイムの仕分けです。DeepSeek の自動ルーティング事故は、オペレーターが制御できないときにベンダー側の自動ルーティングが何をcostするかを示しました:サイレントなモデル置換、ユーザーの圧力により約 45 時間で逆転。安価なディシジョン層は、ルーティングをベンダーのゲートウェイからオペレーターのランタイムへ移します。自分の分類器でルートし、フォールバックモデルは自分のフラグの背後に置く。置換リスクはサプライズではなく、設計選択になります。

ガードレールは確率の契約を得ます。 Jev についての Ronacher の表現:「ハルシネーション問題を少しユーザーに委ねる」——オペレーターが閾値を宣言します。判断が 50% で返ってきたらコイン投げとして人間に回し、95% なら実行する。これは、LLM に「これは安全か?」と尋ね、決して校準されていない散文の回答から自信を読み取るよりも、実質的に優れた契約です。ガバナンスチェックリストの明示的な承認ゲートのパターンは存続します。変わるのは、ゲートチェック自体が「イエス」を捏造できないモデル上で動くということです。

オブザーバビリティは安価な監視者を得ます。 Almeida 自身の枠組み:エージェントでエージェントを監視するのは高価ですが、Jev で行うのは高くありません——LLM エージェントのトレースを追跡しジェイルブレイクを防ぐことは、まさにディシジョン層が価格づけた高頻度・低曖昧さの分類ワークです。監視用 LLM のコストが本番 LLM に匹敵するためにほとんどのチームが諦めているオブザーバビリティアーキテクチャは、監視者の cost が一桁安くなれば実現可能になります。

キルスイッチの検証に独立した評価者が得られます。 LLM の判断で発火するキルスイッチは、LLM の失敗モードを継承します。ディシジョン層モデルが「このトレースは停止基準に一致するか」を評価すれば、キルスイッチ層はすべてのアクションで実行できるほど安く、感覚ではなく校準された、評価対象のエージェントからアーキテクチャ的に独立したチェックを得ます。キルスイッチ・バイ・デザインのパターンは、停止決定が停止対象のエージェントから独立していることを常に要求してきました。非言語の評価者は、その独立性のための最初の商用基板です。

コスト算術を、率直に

比較データポイントは自己申告であり、慎重に扱うべきです——しかし方向性は 2 つの独立した採用者で一致しています。Vercel:Luna ベースの分類器より 5〜18 倍高速、より高い精度。Bryo:ビジネスメール分類では Gemini の方がわずかに正確だが、価格は 10〜20 倍。両方の数字の背後にある構造は同じです。LLM は compute の大部分を、分類パイプラインが捨てる言語の生成に費やします。ディシジョンモデルは、それを判別そのものに費やします——出力無料、入力は10億単位の計量。本番エージェントの量のプロファイルにおいて——1 日数千のガードレールチェック、リクエストごとに 1 回のルーティング呼び出し、ステップごとに 1 回のトレース評価——ディシジョン層は「1 呼びあたりほぼ無料」を設計目標とする唯一の層であり、エージェントは現在、その層を市場で最も高価なモデルから借りています。

このどれも、ディシジョン層を推論器にはしません。見積書の起草、例外の交渉、顧客メールの作成はできません——最初の 2 層がそれを担い続けます。主張はもっと狭いものです。エージェントの言語ワークを取り巻く判断の量が、言語モデルを基板として追い越した。そしてその量のために作られた初の商用モデルが、2026 年 9 月 18 日に出荷されました。

実際の構築事例

NetSuite と BigCommerce 上で 24 時間の見積エージェントを運用する中堅ディストリビューターは、見積の各判断をフロンティアモデルに分類させていました。この割引はポリシー内か、このサプライヤーの回答は完全か、このトレースは人的レビューが必要か。モデルルーティングの決定(5 つの決定アーキテクチャの 3 番目)はワークを分割しました。フロンティアモデルが起草と交渉を担い、実行層のオープンウェイトモデルがカタログと価格の照会を処理し、校準されたディシジョン層の分類器がガードレール——コマンドの安全チェック、トレース分類、各ステップをどの層が扱うかを決めるルーティング呼び出し——を走らせます。分類器の確率出力はエスカレーションポリシーを明示的にしました。0.95 超の判断は自動解決、0.50 未満は人間に回し、中間帯は確率を添えてレビュー待ちにキューイングされます。見積あたりのガードレールコストは LLM 料金から丸め誤差まで下がり、監査証跡も改善しました——すべてのエスカレーション判断が、散文の判定の代わりに校準された数値を伴うようになったのです。

フロンティア推論層、オープンウェイト汎用層、ディシジョン層を 1 つのランタイムの背後に、明示的なエスカレーション閾値とともに構築することは、研究プロジェクトではなくスコープされたビルドです。

スコープされたビルドを依頼する。 1 週間のディスカバリー。当社と構築するかどうかに関わらず、システムインベントリ、ワークフローマップ、固定スコープを提供します。

関連読み物

あなたのシステムのためにこれを構築したいですか?

ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。

スコープ付き構築を依頼

1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。