라이브러리로 돌아가기
전략

TypeSafe Jev와 에이전트 모델 스택의 세 번째 계층

최종 업데이트: 2026年9月19日

핵심 요점

  • TypeSafe AI는 2026년 9월 18일 Jev를 출시했습니다——텍스트 대신 보정된 확률을 출력하는 최초의 트랜스포머 기반 상용 모델입니다——사용자가 출력 공간을 미리 정의하기 때문에 이 모델은 구조적으로 환각을 일으킬 수 없습니다(TechCrunch).
  • Vercel은 OpenAI Luna 기반 안전 분류기를 Jev로 교체한 후 5–18배 더 빠르고 더 높은 정확도의 결과를 얻었으며, Bryo AI는 이메일 분류에서 Gemini가 약간 더 정확하지만 10–20배 더 비싸다고 밝혔습니다——동일한 패턴에 대한 두 개의 독립적인 도입 데이터 포인트입니다.
  • Gartner는 이제 "AI Agents and Assistants"를 독립적인 시장으로 측정합니다: 2025년 165억 달러, 2026년 292억 달러, 2027년 655억 달러——에이전트 소프트웨어 지출은 2027년까지 거의 두 배가 되며, 의사결정 계층 모델은 그 예산이 구매하는 대상의 일부입니다.
  • 아키텍처적 귀결은 3계층 모델 스택——프론티어 추론 계층, 오픈 웨이트 범용 계층, 보정된 의사결정 계층——이며, 에이전트 시스템이 작업을 라우팅하고, 가드레일을 적용하고, 행동을 관측하고, 킬스위치 결정을 검증하는 방식을 바꿉니다.

에이전트의 모든 행동을 LLM으로 안전 분류하는 것은 그것이 보호하는 대상과 맞먹는 비용이 드는 가드레일입니다. Vercel은 자사 에이전트 인프라의 안전 분류기로서 실행 전 명령을 검토하는 OpenAI의 ChatGPT Luna 5.6을 운영해 왔습니다——이번 주까지. Jev로 교체한 후 분류기는 5–18배 더 빠르게, 더 높은 정확도로 실행되었습니다. Bryo AI에서는 Gemini가 이메일 분류 정확도에서 Jev를 근소하게 앞섰지만 비용은 10–20배였습니다. 두 회사는 서로 다른 방향에서 같은 결론에 도달했습니다: 에이전트 의사결정의 큰 부류는 언어 생성을 전혀 필요로 하지 않으며, LLM이 생성한 직후 버려지는 산문에 비용을 지불하는 것은 잘못된 비용 구조라는 것입니다.

Jev는 9월 18일 TypeSafe AI가 출시한, 그 부류의 작업을 위해 만들어진 최초의 상용 모델입니다. 트랜스포머 기반이지만 대규모 언어 모델이 아닙니다: 사용자가 사전에 정의한 출력 공간 위에서 보정된 확률——회사는 이를 "보정된 결정"이라 부릅니다——을 출력합니다. TypeSafe의 공동 창업자이자 ChatGPT와 RLHF 작업에 참여했던 전 OpenAI 리서처 Diogo Almeida는 TechCrunch에 이렇게 주장했습니다: "우리는 4년 동안 인간 언어에 매우 뛰어났지만, 자동화에는 유용하지 않습니다. 컴퓨터는 다른 언어를 사용하기 때문입니다." 이 글은 비언어적 의사결정 모델이 에이전트 아키텍처에서 무엇을 바꾸는지——모델 라우팅, 가드레일, 옵저버빌리티, 킬스위치 검증——그리고 프로덕션 B2B 시스템이 실제로 운영하는 모델 스택에서 어디에 자리하는지 보여줍니다.

Jev란 무엇이며, 여전히 알려지지 않은 것

검증 가능한 사실부터. Jev는 자유 형식 텍스트가 아니라 사용자가 정의한 출력 공간 위의 확률을 생성합니다. 출력 토큰은 무료이고 입력은 백만이 아닌 십억 단위로 계량됩니다——생성이 언어 모델의 비용이 큰 부분이고 Jev는 생성하지 않기 때문에, 이 가격 구조는 LLM 비용 구조를 역전시킵니다. Almeida가 "보정된 결정으로부터의 강화 학습"이라 부르는 기법으로 합성 데이터만을 사용해 훈련되었으며, 출시 직후 수요가 API를 일시적으로 포화시켜 회사는 한동안 사용자에게 서비스를 제공할 능력을 잃었습니다.

정직성 지표는 주장만큼 중요합니다. Almeida는 아키텍처에 대해 입을 다물고 있으며, 외부 관찰자들은 오픈 웨이트 LLM 위에 구축된 것으로 의심합니다——"환각 불가능" 속성은 공개된 아키텍처 세부 사항이 아니라 제약된 출력 공간에서 도출됩니다. Vercel과 Bryo의 비교는 벤치마크 평가가 아닌 개발자 자체 보고입니다. 그리고 Jev는 얼리 액세스 전용——9월의 세 가지 게이트 리리스 중 하나(Anthropic의 Mythos 5.1, Google의 Fairwind 전용 Gemini 3.8 Flash Cyber와 나란히)——이므로 도입 수치는 접근이 통제된 집단에 기반합니다. Earendil의 CTO이자 오픈소스 모델 하네스 Pi의 창시자인 Armin Ronacher는 유용성이 보인 지금 경쟁자들이 뒤따를 것으로 예상합니다: "아마도 LLM이 너무 저렴하고 보조금을 받기 때문에, 아직 창의력을 발휘할 필요가 없는 경우가 많을 겁니다." Jev는 확정된 벤더 선택이 아니라 카테고리의 실증으로 다뤄져야 합니다.

에이전트 모델 스택의 세 번째 계층

프로덕션 에이전트 시스템은 이미 전혀 닮지 않은 두 개의 모델 계층을 운영하고 있습니다. 프론티어 추론 계층은 계획, 초안 작성, 모호성 처리를 담당합니다. 오픈 웨이트 범용 계층——DeepSeek, Qwen, GLM 릴리스가 비용을 낮춘 패턴——은 프론티어 가격의 일부로 고빈도 도구 호출과 검증을 실행합니다. 빠진 것은 추론도 언어도 아닌 작업을 위한 세 번째 계층입니다. 에이전트 시스템이 매일 수행하는 수백만 건의 작은 분류 결정: 이 명령은 실행해도 안전한가. 이 트레이스는 탈옥처럼 보이는가. 이 워크로드는 비싼 모델이 필요한가. 이 가격 변동은 실제인가.

이러한 결정에 언어 모델을 두는 것이 기본값이었던 것은 상용 대안이 존재하지 않았기 때문일 뿐입니다. Gartner의 9월 전망은 에이전트 소프트웨어 시장을 2025년 165억 달러, 2026년 292억 달러, 2027년 655억 달러로 측정했습니다——2027년까지 거의 두 배——그리고 이 구축의 모든 달러는 의사결정 계층 질문을 무시하는 비용을 높입니다. 배포된 에이전트 하나하나가 현재 기본적으로 LLM을 통해 흐르는 가드레일 검사, 라우팅 호출, 검증 패스의 양을 배가시키기 때문입니다.

3계층 에이전트 모델 스택——두 개의 언어 계층과 그 주변의 물량을 가격 책정하는 비언어적 의사결정 계층:

3계층 에이전트 모델 스택 프론티어 추론 계층 · 오픈 웨이트 범용 계층 · 보정된 의사결정 계층——각 계층은 자기 역할에 맞게 가격이 책정된다 1 프론티어 추론 계층——계획, 초안 작성, 모호성 처리 의도적으로 쓰이는 비싼 계층: 협상 전략, 예외 처리, 고객 대면 언어. 100만 토큰 단위로 계량. 이 계층의 물량이 예산의 견인 요인. $/Mtok 가격 2 오픈 웨이트 범용 계층——고빈도 언어 작업을 실행 도구 호출, 카탈로그 조회, 요약, 검증——게이트웨이 뒤에서 작업 클래스별로 라우팅. DeepSeek, Qwen, GLM급 모델: 프론티어에 근접한 능력을 실행 계층의 비용으로. 작업 클래스별 라우팅 3 보정된 의사결정 계층——산문이 아닌 확률 가드레일 검사, 라우팅 결정, 트레이스 분류, 킬스위치 검증. 출력 토큰 무료, 입력은 십억 단위 계량. Vercel: 분류기 5–18배 고속. Bryo: Gemini보다 10–20배 저렴. 구조적으로 환각 불가——출력 공간은 모델이 아닌 사용자가 정의. TypeSafe Jev — 2026년 9월 18일 의사결정 계층에 에이전트 물량이 집중된다. Gartner는 AI 에이전트·어시스턴트 시장을 165억 달러(2025) → 292억 달러(2026) → 655억 달러(2027)로 측정——배포된 에이전트 하나하나가 의사결정 계층 물량을 증폭시킨다. 이 결정들을 생성적 LLM으로 처리하는 것은 가장 비싼 기판이다. 출처: TechCrunch 2026-09-18 (Vercel 5–18배, Bryo 10–20배) · Gartner 2026-09-16 에이전트 세그먼트 예측 · typesafe.ai 3계층 에이전트 모델 스택—— ideabosque.com/library

에이전트 아키텍처에 무엇이 바뀌는가

보정된 의사결정 계층이 상용 옵션으로 존재하게 되면 네 가지 아키텍처 결정의 형태가 바뀝니다. 각각은 프로덕션 에이전트 시스템이 이미 내리는 결정에 대응하며, 바뀌는 것은 비용 구조와 운영 판단이 어디에 사는지에 대한 정직함입니다.

모델 라우팅이 고빈도에서 경제적으로 합리적이 됩니다. Ronacher에 따르면 가장 많이 요청되는 단기 사용 사례는 워크로드가 특정 모델을 필요로 하는지 예측하는 것——라우팅 호출 자체가 거의 무료가 되어야만 가능한 실시간 분류입니다. DeepSeek 자동 라우팅 사건은 운영자가 제어하지 못할 때 벤더 측 자동 라우팅이 어떤 비용을 낳는지 보여주었습니다: 침묵 속의 모델 대체, 사용자 압박으로 약 45시간 만에 번복. 저렴한 의사결정 계층은 라우팅을 벤더의 게이트웨이에서 운영자의 런타임으로 옮깁니다——자신의 분류기로 라우팅하고, 폴백 모델은 자신의 플래그 뒤에 두면, 대체 리스크는 사고가 아닌 설계 선택이 됩니다.

가드레일은 확률 계약을 얻습니다. Jev에 대한 Ronacher의 표현: "환각 문제를 조금 사용자에게 떠넘긴다"——운영자가 임계값을 선언합니다. 결정이 50%로 돌아오면 동전 던지기로 취급해 사람에게 넘기고, 95%면 실행합니다. 이것은 LLM에게 "이것이 안전한가?"라고 묻고 결코 보정되지 않은 산문형 답변에서 신뢰도를 파싱하는 것보다 실질적으로 더 나은 계약입니다. 거버넌스 체크리스트의 명시적 승인 게이트 패턴은 유지됩니다. 바뀌는 것은 게이트 검사 자체가 "예"를 날조할 수 없는 모델 위에서 돈다는 점입니다.

옵저버빌리티는 저렴한 감시자를 얻습니다. Almeida 자신의 표현: 에이전트로 에이전트를 감시하는 것은 비싸지만 Jev로 하는 것은 그렇지 않습니다——LLM 에이전트 트레이스를 추적하고 탈옥을 막는 것은 정확히 의사결정 계층이 가격을 매긴 고빈도·저모호성 분류 작업입니다. 감시용 LLM 비용이 프로덕션 LLM에 필적한다는 이유로 대부분의 팀이 포기하는 옵저버빌리티 아키텍처는 감시자 비용이 한 자릿수 낮아지면 실현 가능해집니다.

킬스위치 검증은 독립적인 평가자를 얻습니다. LLM의 판단으로 트리거되는 킬스위치는 LLM의 실패 모드를 상속합니다. 의사결정 계층 모델이 "이 트레이스가 중단 기준에 부합하는가"를 평가하면 킬스위치 계층은 모든 행동에서 실행할 만큼 충분히 저렴하고, 감각이 아닌 보정된, 평가 대상 에이전트로부터 아키텍처적으로 독립된 검사를 얻습니다. 킬스위치 바이 디자인 패턴은 중단 결정이 중단되는 에이전트와 독립일 것을 늘 요구해 왔습니다. 비언어적 평가자는 그 독립성을 위한 최초의 상용 기판입니다.

비용 산술, 솔직하게

비교 데이터 포인트는 자체 보고이므로 신중하게 다뤄야 합니다——그러나 방향은 두 개의 독립적인 채택자 사이에서 일관됩니다. Vercel: Luna 기반 분류기보다 5–18배 빠르고 정확도도 더 높음. Bryo: 비즈니스 이메일 분류에서 Gemini가 약간 더 정확하지만 가격은 10–20배. 두 숫자 뒤의 구조는 동일합니다. LLM은 compute 대부분을 분류 파이프라인이 곧바로 버리는 언어 생성에 쓰고, 의사결정 모델은 그것을 판별 그 자체에 씁니다——출력은 무료, 입력은 십억 단위 계량. 프로덕션 에이전트의 물량 프로필에서——하루 수천 건의 가드레일 검사, 요청당 한 번의 라우팅 호출, 단계당 한 번의 트레이스 평가——의사결정 계층은 "호출당 거의 무료"를 설계 목표로 삼는 유일한 계층이며, 에이전트들은 현재 바로 그 계층을 시장에서 가장 비싼 모델로부터 임대하고 있습니다.

이 중 어떤 것도 의사결정 계층을 추론기로 만들지 않습니다. 견적서를 작성하거나, 예외를 협상하거나, 고객 이메일을 쓸 수 없습니다——처음 두 계층이 그것을 계속 소유합니다. 주장은 더 좁습니다: 에이전트의 언어 작업을 둘러싼 결정 물량이 언어 모델을 기판으로서 추월했고, 그 물량을 위해 만들어진 최초의 상용 모델이 2026년 9월 18일 출시되었다는 것입니다.

대표적인 구축 사례

NetSuite와 BigCommerce 위에서 24시간 견적 에이전트를 운영하는 중견 유통업체는 견적의 모든 결정을 프론티어 모델에 분류시키고 있었습니다: 이 할인이 정책 내인가, 이 공급업체 응답이 완전한가, 이 트레이스에 사람 검토가 필요한가. 모델 라우팅 결정(5가지 결정 아키텍처의 세 번째)이 작업을 분할했습니다: 프론티어 모델이 초안 작성과 협상을 담당하고, 실행 계층의 오픈 웨이트 모델이 카탈로그·가격 조회를 처리하며, 보정된 의사결정 계층 분류기가 가드레일——명령 안전 검사, 트레이스 분류, 각 단계를 어떤 계층이 처리할지 결정하는 라우팅 호출——을 구동합니다. 분류기의 확률 출력은 에스컬레이션 정책을 명시적으로 만들었습니다: 0.95 초과 결정은 자동 해결, 0.50 미만은 사람에게 회송, 중간 대역은 확률을 첨부해 검토 대기열에 들어갑니다. 견적당 가드레일 비용은 LLM 요율에서 반올림 오류 수준으로 떨어졌고, 감사 추적도 개선되었습니다——모든 에스컬레이션 결정이 이제 산문형 판정 대신 보정된 숫자를 실어 다닙니다.

프론티어 추론 계층, 오픈 웨이트 범용 계층, 의사결정 계층을 하나의 런타임 뒤에 명시적 에스컬레이션 임계값과 함께 구축하는 것은 연구 프로젝트가 아니라 범위가 명확한 빌드입니다.

범위가 명확한 빌드를 요청하세요. 1주일 디스커버리. 당사와 함께 구축하든 그렇지 않든, 시스템 인벤토리, 워크플로 지도, 고정된 범위를 제공합니다.

관련 읽기

귀하의 시스템을 위해 이것을 구축하고 싶으신가요?

여기의 각 문서는 실제 프로덕션 작업에서 나왔습니다. 대상 시스템과 워크플로가 있다면, 1주 내에 빌드를 범위 정의할 수 있습니다.

범위 정의 빌드 요청

1주 발견. 시스템 인벤토리, 워크플로 맵, 고정 범위를 받습니다 — 우리와 빌드할지 여부와 관계없이.