라이브러리로 돌아가기
전략

0.10달러 서브에이전트: Claude Haiku 5.5, 프런티어와 오픈 웨이트의 비용 격차를 무너뜨리다

최종 업데이트: 2026年10月7日

핵심 요약

  • Claude Haiku 5.5는 100K 미만 프롬프트에 대해 백만 토큰당 0.10/0.50달러로 가격이 책정되었습니다 — Haiku 4.5보다 90% 낮고 GPT-6 Luna의 가격과 정확히 일치하며, 3개 공급업체에서 요청의 90%에 대해 서브에이전트 계층이 사실상 무료가 됩니다(Anthropic, 10월 7일).
  • OSWorld 2.1은 Haiku 4.5의 15.7%에서 72.4%로 뛰었습니다 — 4.6배 개선으로, 이 저가 모델이 Sonnet 5.5의 83.9%와 12점 이내로 접근했습니다(Anthropic, 10월 7일).
  • Sonnet 5.5 캐시 읽기 비용이 백만 토큰당 0.20달러에서 0.10달러로 절반으로 줄어 Sonnet 5.5의 에이전트 비용을 약 20% 절감합니다 — 서브에이전트 계층이 출시된 같은 날 미드티어 모델도 저렴해졌습니다(Anthropic, 10월 7일).
  • GLM-5.3-Flash(0.15/0.50달러)와 GPT-6 Luna(0.10/0.50달러)는 소형 모델 계층에서 프런티어 폐쇄형과 오픈 웨이트 간 입력 비용 격차가 이제 0.05달러/M임을 의미합니다 — 대부분의 워크로드에서 0으로 반올림되는 수치입니다(Z.AI; Anthropic).
  • 경쟁의 축이 가격에서 능력·안전 자세·생태계 통합으로 이동했습니다 — 서브에이전트 계층은 더 이상 비용 결정이 아니라 아키텍처 결정입니다(Yahoo Finance, 10월 7일).

본 글은 30% 저렴한 태스크당 비용은 7배의 토큰을 소비한다: Sonnet 5.5의 효율성 트랩을 잇는 글입니다. 해당 문서는 플래그십 계층에서 태스크당 비용을 두고 경쟁하는 세 가지 출시 전략을 정리했습니다. 여기서는 한 계층 아래, 즉 압축·분류·데이터베이스 질의·코딩 보조 업무를 담당하는 모델이 6개월 전에는 상상도 할 수 없던 가격 하한선에 도달한 지점을 다룹니다. 같은 발표에서 함께 이루어진 Sonnet 5.5 캐시 읽기 절반 가격화는 직접적인 짝 데이터 포인트입니다. 해당 문서의 토큰 효율성 논제에, 캐시 읽기가 지배적인 에이전트 워크로드에서 미드티어 모델을 20% 저렴하게 만드는 가격 변경이 더해진 것입니다.

서브에이전트 계층은 이제 동일 가격의 3개 공급업체 시장입니다

2026년 10월 8일 기준 소형 모델 계층의 가격표:

모델 입력 $/M 출력 $/M 유형 공급업체
GPT-6 Luna $0.10 $0.50 프런티어 폐쇄형 OpenAI
Claude Haiku 5.5 $0.10 $0.50 프런티어 폐쇄형 Anthropic
GLM-5.3-Flash $0.15 $0.50 오픈 웨이트 Z.ai

출력 가격은 세 곳 모두 동일합니다. 프런티어 폐쇄형 두 모델과 오픈 웨이트 모델 간 입력 가격 차이는 백만 토큰당 0.05달러입니다 — 5만 토큰 대화 컨텍스트를 압축하는 서브에이전트 기준 0.0025달러의 차이입니다. 잘못된 서브에이전트를 고르는 비용은 이제 하루 달러 단위가 아니라 태스크당 몇 퍼센트의 센트 단위로 측정됩니다.

2026년 10월 8일 기준 서브에이전트 계층의 가격 구도:

0.10달러 서브에이전트 계층 3개 공급업체. 동일 가격. 프런티어-오픈 웨이트 입력 비용 격차는 이제 0.05달러/M. L GPT-6 Luna OpenAI · 프런티어 폐쇄형 $0.10 /M 입력 $0.50 /M 출력 OSWorld 2.1: 48.9% H Claude Haiku 5.5 Anthropic · 프런티어 폐쇄형 · 신규 $0.10 /M input $0.50 /M output OSWorld 2.1: 72.4% (이전 15.7%) G GLM-5.3-Flash Z.ai · 오픈 웨이트 $0.15 /M input $0.50 /M output 320B/18B MoE · MIT-weight 프런티어-오픈 웨이트 입력 비용 격차: 0.05달러/M 토큰 5만 토큰 압축 기준 0.0025달러 차이. 서브에이전트 계층은 더 이상 비용 결정이 아닙니다. 10:1 비율은 유지됩니다 모델 지출 1달러당 10달러의 통합+거버넌스 $1 모델 $10 통합 MCP 모듈, 지식 그래프, 감사 로그, 거버넌스 Sonnet 5.5 캐시 읽기 절반 같은 발표 · 에이전트 작업 약 20% 저렴 0.20달러/M 캐시 읽기 0.10달러/M 캐시 읽기 캐시 읽기가 에이전트 토큰 소비를 지배 — 매 턴 늘어나는 항목 모델은 90% 저렴해졌습니다. 통합 계층은 아닙니다. 출처: Anthropic(2026년 10월 7일) · Z.AI · Yahoo Finance · IdeaBosque ideabosque.com/library/haiku-5-5-subagent-tier-cost-collapse

Yahoo Finance는 Haiku 5.5 출시를 "AI 가격 전쟁이 격화"라고 프레임했습니다(Yahoo Finance, 10월 7일). 이 프레임은 정확하지만 실제 일어난 일을 과소평가합니다. 가격 전쟁은 같은 제품에서 마진이 압박받는 상황을 의미합니다. 실제로 일어난 일은, 대부분의 에이전트 토큰 소비가 발생하는 계층인 서브에이전트 계층이 이전에는 가장 저렴한 오픈 웨이트 모델에서만 가능했던 가격 수준까지 붕괴했다는 점입니다. 프런티어 폐쇄형 모델과 오픈 웨이트 모델이 이제 출력 토큰 기준 동일한 가격 지점에 놓였습니다. "프런티어 서브에이전트를 써야 하나, 오픈 웨이트 서브에이전트를 써야 하나"라는 질문은 더 이상 비용의 질문이 아닙니다.

무엇이 바뀌었나: 서브에이전트가 유능해졌다

가격은 이야기의 절반입니다. 아키텍처 결정을 바꾸는 것은 Haiku 5.5의 벤치마크 도약입니다:

  • OSWorld 2.1(오프라인 서브셋): 72.4% — Haiku 4.5의 15.7%에서 4.6배 개선. GPT-6 Luna는 48.9%. 서브에이전트는 이제 12개월 전 플래그십급 수준으로 컴퓨터를 조작해 멀티스텝 태스크를 완수할 수 있습니다(Anthropic).
  • Terminal-Bench 4.0: 39.2% — Haiku 4.5의 0.0%에서 도약. GPT-6 Luna는 16.4%. 서브에이전트는 이제 이전 세대가 시도조차 못 했던 복잡한 명령줄 태스크를 완수합니다(Anthropic).
  • FrontierCode 1.1(Main): 46.4% — GPT-6 Luna의 42.4%보다 높고, xhigh의 Sonnet 5.5(52.1%)보다는 낮습니다. 서브에이전트는 코딩 보조 역할을 할 수준의 프로덕션 코드를 작성합니다 — Cognition은 Devin Fusion의 사이드킥으로 이 모델을 출시하며, 더 낮은 비용과 지연으로 최상위 FrontierCode 점수 66.2를 유지합니다(Anthropic).
  • HubSpot CRM 태스크 스위트: 92.8% — HubSpot이 시뮬레이션 포털 CRM 평가에서 측정한 최고 점수입니다. 서브에이전트는 낡았지만 애매한 레코드를 테스트된 모든 모델 중 가장 높은 적중률과 가장 낮은 오탐률로 식별합니다(Anthropic).

HubSpot 데이터 포인트는 벤치마크를 넘어 중요합니다. HubSpot은 CRM 자동화 태스크를 위해 프런티어 소형 모델을 평가하는 주요 CRM 플랫폼입니다 — 커스텀 MCP 모듈이 다루는 바로 그 사용 사례입니다. 서브에이전트 계층이 0.10달러/M 입력으로 92.8% 정확도로 낡은 CRM 레코드를 식별할 수 있을 때, 딜 파이프라인을 24/7 감시하는 에이전트 운영 비용은 예산 항목에서 반올림 오차 수준으로 떨어집니다.

조정 가능한 effort: 같은 모델, 다섯 가지 가격 지점

Haiku 5.5는 effort 수준을 조정할 수 있는 최초의 Haiku급 모델입니다. low·medium·high·xhigh·max의 5단계입니다. 이는 DeepSeek 자동 라우팅 분석이 라우팅이 보이지 않을 때의 조달 리스크로 지적했던 것과 같은 구성 가능한 비용 패턴입니다 — 다만 여기서는 제어권이 운영자 손에 있습니다. 대화 컨텍스트를 압축하는 서브에이전트는 low effort로 태스크당 0.002달러로 실행할 수 있고, 같은 모델이 더 어려운 데이터베이스 질의에는 max effort로 실행될 수 있습니다. 태스크당 비용 곡선은 이제 고정 요율이 아니라 다이얼입니다.

추론 조달에 대한 시사점은 직접적입니다. 모델과 요율표만 명시한 계약에는 effort 수준을 제어할 방법이 없습니다. max effort로 도는 에이전트는 medium으로 도는 동일 에이전트보다 더 많은 토큰을 소모합니다 — 그리고 운영자에게 보이는 것은 청구서뿐입니다. Sonnet 5.5 문서가 권고한 4가지 계약 조항(effort 수준 고정, 대체 모델 공개, 캐시 읽기 가격 하한, 토큰 사용량 상한)은 effort 다이얼이 서브에이전트 계층에도 존재하는 이상, 여기에도 동일하게 적용됩니다.

Sonnet 5.5 캐시 읽기 절반 가격화: 미드티어도 저렴해졌다

같은 발표에서 Sonnet 5.5의 캐시 읽기가 백만 토큰당 0.20달러에서 0.10달러로 절반으로 줄었습니다. 캐시 읽기는 에이전트 토큰 소비의 큰 비중을 차지합니다 — 매 턴 동일한 시스템 프롬프트, 도구 정의, 대화 이력을 다시 읽는 에이전트는 입력·출력 항목보다 캐시 읽기 항목을 더 많이 건드립니다. 에이전트 지출을 지배하는 항목에서 50% 절감은 Sonnet 5.5의 전체 에이전트 비용 약 20% 절감에 해당합니다(Anthropic).

이것이 에이전트 아키텍처 결정에 중요한 이유입니다. 0.10/0.50달러의 서브에이전트 계층은 압축·분류·보조 업무를 담당하고, 2/10달러의 미드티어(캐시 읽기 절반 가격화)는 복잡한 에이전트 코딩과 멀티스텝 추론을 담당하며, 4/20달러의 플래그십 계층은 가장 어려운 태스크를 담당합니다. 이제 3계층 스택이 깔끔하게 가격이 매겨졌습니다: 저렴한 서브에이전트, 저렴한 캐시를 지닌 유능한 미드티어, 강력한 플래그십. 10월 7일, always-on 프로덕션 에이전트의 전체 스택 운영 비용이 유의미하게 하락했습니다.

이것이 빌드에 의미하는 것

추론 경제학 분석이 확립한 10:1 비율입니다. 모델 지출 1달러당 프로세스·거버넌스·통합 작업에 10달러. Haiku 5.5 출시는 이 비율을 더욱 벌립니다. 모델은 90% 저렴해졌지만 통합 계층은 그렇지 않습니다. 에이전트를 NetSuite에 연결하는 MCP 모듈, 대체 부품을 해결하는 지식 그래프, 모든 도구 호출을 기록하는 감사 로그 — 이 비용은 변하지 않았습니다. 모델이 총 빌드 비용에서 차지하는 비중은 1주일 전보다 작아졌습니다.

이것이 조달의 통찰입니다. 서브에이전트 계층의 가격 붕괴는 에이전트 시스템을 더 저렴하게 만들어주는 것이 아니라 운영을 더 저렴하게 만들어줍니다 — 즉, 통합 계층을 이미 구축한 팀이 구축하지 않은 팀보다 더 큰 비용 절감을 얻습니다. 타입드 MCP 모듈, 지식 그래프, human-in-the-loop 체크포인트를 갖춘 프로덕션 RFQ 에이전트를 운영하는 팀은 월간 추론 청구서가 하룻밤 새 75% 하락하는 것을 봅니다. 통합 계층을 구축하지 않은 팀에게는 변화가 없습니다 — 비용이 사는 곳은 통합 계층이기 때문입니다.

관련 문서

NetSuite, BigCommerce, 세 개의 공급업체 카탈로그를 운영하는 지역 유통업체가 주 200건의 RFQ를 처리합니다. 견적 에이전트는 카탈로그 조회와 가격 등급 분류에는 Haiku 5.5를 서브에이전트로, 견적 작성 단계에는 캐시 읽기 절반 가격화된 Sonnet 5.5를, 대체 부품 해결에는 지식 그래프를 활용합니다. 10월 7일, 전체 스택의 월간 추론 비용은 75% 하락했습니다 — 약 4,000달러에서 1,000달러 미만으로 — 통합 코드는 단 한 줄도 바꾸지 않고. 비용 절감을 현실로 만드는 것은 MCP 모듈, 지식 그래프, 감사 로그입니다. 모델 가격은 쉬운 부분입니다.

범위가 정해진 빌드 요청

1주일 디스커버리. 시스템 인벤토리, 워크플로우 맵, 고정 범위를 받습니다 — 저희와 빌드하든 아니든.

귀하의 시스템을 위해 이것을 구축하고 싶으신가요?

여기의 각 문서는 실제 프로덕션 작업에서 나왔습니다. 대상 시스템과 워크플로가 있다면, 1주 내에 빌드를 범위 정의할 수 있습니다.

범위 정의 빌드 요청

1주 발견. 시스템 인벤토리, 워크플로 맵, 고정 범위를 받습니다 — 우리와 빌드할지 여부와 관계없이.