Volver a la Biblioteca
Estrategia

El subagente de $0.10: Claude Haiku 5.5 colapsa la brecha de costes entre modelos frontera y pesos abiertos

Última actualización: 7 de octubre de 2026

Conclusiones clave

  • Claude Haiku 5.5 tiene un precio de 0,10/0,50 dólares por millón de tokens para prompts de menos de 100K — un 90% por debajo de Haiku 4.5 e idéntico al precio de GPT-6 Luna — lo que hace que el nivel de subagentes sea efectivamente gratuito para el 90% de las solicitudes en tres proveedores (Anthropic, 7 oct).
  • OSWorld 2.1 saltó del 15,7% (Haiku 4.5) al 72,4% (Haiku 5.5) — una mejora de 4,6× que sitúa al modelo barato a menos de 12 puntos del 83,9% de Sonnet 5.5 (Anthropic, 7 oct).
  • Las lecturas de caché de Sonnet 5.5 se redujeron a la mitad, de 0,20 a 0,10 dólares por millón de tokens, recortando el coste agéntico de Sonnet 5.5 en un ~20% — el modelo de nivel medio se abarató el mismo día en que se lanzó el nivel de subagentes (Anthropic, 7 oct).
  • GLM-5.3-Flash a 0,15/0,50 dólares y GPT-6 Luna a 0,10/0,50 significan que la brecha de coste entre frontera cerrada y pesos abiertos en el nivel de modelos pequeños es ahora de 0,05 dólares/M de entrada — una cifra que se redondea a cero para la mayoría de las cargas de trabajo (Z.AI; Anthropic).
  • El eje competitivo se ha desplazado del precio a la capacidad, la postura de seguridad y la integración del ecosistema — el nivel de subagentes ya no es una decisión de coste, es una decisión de arquitectura (Yahoo Finance, 7 oct).

Esto construye sobre 30% más barato por tarea cuesta 7 veces más tokens: la trampa de eficiencia de Sonnet 5.5, que mapeó las tres estrategias de lanzamiento que compiten en coste por tarea en el nivel insignia. Aquí el foco está una capa por debajo: el nivel de subagentes, donde el modelo que maneja compactación, clasificación, consultas a base de datos y trabajo de asistente de código acaba de golpear un suelo de precio que era impensable hace seis meses. La reducción a la mitad de las lecturas de caché de Sonnet 5.5 — lanzada en el mismo anuncio — es el dato complementario directo: la tesis de eficiencia por token del artículo gana un cambio de precio que hace que el modelo de nivel medio sea un 20% más barato en las cargas agénticas donde las lecturas de caché dominan.

El nivel de subagentes es ahora un mercado de tres proveedores a un solo precio

La tabla de precios del nivel de modelos pequeños a 8 de octubre de 2026:

Modelo Entrada $/M Salida $/M Tipo Proveedor
GPT-6 Luna $0.10 $0.50 Frontera cerrada OpenAI
Claude Haiku 5.5 $0.10 $0.50 Frontera cerrada Anthropic
GLM-5.3-Flash $0.15 $0.50 Pesos abiertos Z.ai

El precio de salida es idéntico en los tres. La brecha de entrada entre la pareja de frontera cerrada y el modelo de pesos abiertos es de 0,05 dólares por millón de tokens — para un subagente que compacta un contexto de conversación de 50.000 tokens, eso son 0,0025 dólares. El coste de elegir el subagente equivocado se mide ahora en fracciones de céntimo por tarea, no en dólares por día.

El panorama de precios del nivel de subagentes a 8 de octubre de 2026:

El nivel de subagentes a $0.10 Tres proveedores. Un precio. La brecha de coste frontera-vs-pesos-abiertos es ahora $0.05/M de entrada. L GPT-6 Luna OpenAI · Frontera cerrada $0.10 /M entrada $0.50 /M salida OSWorld 2.1: 48,9% H Claude Haiku 5.5 Anthropic · Frontera cerrada · NUEVO $0.10 /M entrada $0.50 /M salida OSWorld 2.1: 72,4% (antes 15,7%) G GLM-5.3-Flash Z.ai · Pesos abiertos $0.15 /M entrada $0.50 /M salida MoE 320B/18B · peso MIT Brecha de coste de entrada frontera-vs-pesos-abiertos: $0.05/M tokens Para una compactación de 50K tokens: $0.0025 de diferencia. El nivel de subagentes ya no es una decisión de coste. La proporción 10:1 se mantiene $10 de integración + gobernanza por cada $1 de gasto en modelo $1 Modelo $10 Integración Módulos MCP, grafos de conocimiento, trazas de auditoría, gobernanza Lecturas de caché de Sonnet 5.5 a la mitad Mismo anuncio · ~20% más barato el trabajo agéntico $0.20/M lecturas de caché $0.10/M lecturas de caché Las lecturas de caché dominan el consumo agéntico de tokens — la partida que escala con cada turno El modelo se abarató un 90%. La capa de integración, no. Fuentes: Anthropic (7 oct 2026) · Z.AI · Yahoo Finance · IdeaBosque ideabosque.com/library/haiku-5-5-subagent-tier-cost-collapse

Yahoo Finance enmarcó el lanzamiento de Haiku 5.5 como "la guerra de precios de la IA se intensifica" (Yahoo Finance, 7 oct). El encuadre es preciso pero se queda corto ante lo que ocurrió. Una guerra de precios implica márgenes comprimiéndose sobre el mismo producto. Lo que ocurrió realmente es que el nivel de subagentes — la capa donde ocurre la mayor parte del consumo agéntico de tokens — colapsó a un precio que antes solo estaba disponible en el modelo de pesos abiertos más barato. El modelo de frontera cerrada y el modelo de pesos abiertos están ahora en el mismo punto de precio para tokens de salida. La pregunta "¿debo usar un subagente de frontera o de pesos abiertos?" ya no es una cuestión de coste.

Lo que cambió: el subagente se volvió capaz

El precio es solo la mitad de la historia. El salto de benchmarks de Haiku 5.5 es la parte que cambia las decisiones de arquitectura:

  • OSWorld 2.1 (subconjunto offline): 72,4% — frente al 15,7% de Haiku 4.5, una mejora de 4,6×. GPT-6 Luna se queda en 48,9%. El subagente puede ahora operar un ordenador para completar tareas de varios pasos a un nivel que era de categoría insignia hace doce meses (Anthropic).
  • Terminal-Bench 4.0: 39,2% — frente al 0,0% de Haiku 4.5. GPT-6 Luna se queda en 16,4%. El subagente puede completar tareas complejas de línea de comandos que la generación anterior no podía siquiera intentar (Anthropic).
  • FrontierCode 1.1 (Main): 46,4% — por encima del 42,4% de GPT-6 Luna, por debajo del 52,1% de Sonnet 5.5 en xhigh. El subagente escribe código de producción lo bastante bien como para servir de asistente de código — Cognition lo incluye como el sidekick en Devin Fusion, con una puntuación FrontierCode de primer nivel de 66,2 a menor coste y latencia (Anthropic).
  • Suite de tareas CRM de HubSpot: 92,8% — la mejor puntuación que HubSpot ha medido en su evaluación CRM de portal simulado. El subagente identifica registros obsoletos pero ambiguos con la mayor tasa de acierto y la menor tasa de falsos positivos de cualquier modelo probado (Anthropic).

El dato de HubSpot importa más allá del benchmark. HubSpot es una plataforma CRM importante que evalúa modelos pequeños de frontera para tareas de automatización CRM — exactamente el caso de uso que aborda un módulo MCP personalizado. Cuando el nivel de subagentes puede identificar registros CRM obsoletos con un 92,8% de precisión a 0,10 dólares/M de entrada, el coste de ejecutar un agente que monitoriza un pipeline de acuerdos 24/7 pasa de ser una partida presupuestaria a un error de redondeo.

Esfuerzo ajustable: el mismo modelo, cinco precios

Haiku 5.5 es el primer modelo de clase Haiku con niveles de esfuerzo ajustables: bajo, medio, alto, xhigh y max. Es el mismo patrón de coste configurable que el análisis de auto-enrutamiento de DeepSeek señaló como riesgo de adquisición cuando el enrutamiento es invisible — pero aquí el control está en manos del operador. Un subagente que compacta el contexto de conversación puede ejecutarse con esfuerzo bajo a 0,002 dólares por tarea; el mismo modelo puede ejecutarse con esfuerzo máximo para una consulta a base de datos más difícil. La curva de coste por tarea es ahora un dial, no una tarifa fija.

La implicación para la adquisición de inferencia es directa: un contrato que solo nombre el modelo y la tarifa no tiene control sobre el nivel de esfuerzo. Un agente con esfuerzo máximo quema más tokens que el mismo agente en medio — y el operador solo ve la factura. Las cuatro cláusulas contractuales que recomendaba el artículo de Sonnet 5.5 (fijación del nivel de esfuerzo, divulgación de sustitución, suelos de precio de lecturas de caché, techos de volumen de tokens) se aplican por igual al nivel de subagentes ahora que el dial de esfuerzo existe allí también.

La reducción a la mitad de las lecturas de caché de Sonnet 5.5: el nivel medio también se abarató

El mismo anuncio redujo a la mitad las lecturas de caché de Sonnet 5.5, de 0,20 a 0,10 dólares por millón de tokens. Las lecturas de caché constituyen una gran parte del consumo agéntico de tokens — un agente que vuelve a leer el mismo system prompt, definiciones de herramientas e historial de conversación en cada turno golpea la partida de lecturas de caché más que las partidas de entrada o salida. Un recorte del 50% en la partida que domina el gasto agéntico es una reducción del ~20% en el coste agéntico total de Sonnet 5.5 (Anthropic).

Esto importa para la decisión de arquitectura del agente. El nivel de subagentes a 0,10/0,50 dólares maneja compactación, clasificación y trabajo de asistente. El nivel medio a 2/10 dólares — ahora con lecturas de caché a la mitad — maneja la codificación agéntica compleja y el razonamiento de varios pasos. El nivel insignia a 4/20 dólares maneja las tareas más difíciles. La pila de tres niveles está ahora limpiamente tarifada: subagente barato, nivel medio capaz con caché barata, insignia potente. El coste de ejecutar la pila completa para un agente de producción always-on cayó de forma significativa el 7 de octubre.

Lo que esto significa para la construcción

El análisis de economía de inferencia estableció la proporción 10:1: 10 dólares de trabajo de proceso, gobernanza e integración por cada 1 dólar de gasto en modelo. El lanzamiento de Haiku 5.5 amplía aún más esa proporción. El modelo se abarató un 90%; la capa de integración, no. Un módulo MCP que conecta un agente con NetSuite, un grafo de conocimiento que resuelve piezas sustitutas, una traza de auditoría que registra cada llamada a herramienta — estos costes no cambian. El modelo es ahora una fracción menor del coste total de construcción de lo que era hace una semana.

Esta es la idea de adquisición. El colapso de precios del nivel de subagentes no hace que los sistemas de agentes sean más baratos de construir. Los hace más baratos de ejecutar — lo que significa que los equipos que ya construyeron la capa de integración obtienen una reducción de coste mayor que los equipos que no. Un equipo que opera un agente de RFQ en producción con módulos MCP con tipos, un grafo de conocimiento y checkpoints humanos en el bucle ve su factura mensual de inferencia caer un 75% de la noche a la mañana. Un equipo que no ha construido la capa de integración no ve cambio alguno — porque la capa de integración es donde vive el coste.

Lecturas relacionadas

Un distribuidor regional que opera NetSuite, BigCommerce y tres catálogos de proveedores procesa 200 RFQ por semana. El agente de cotización ejecuta Haiku 5.5 como subagente para búsqueda en catálogo y clasificación de niveles de precio, Sonnet 5.5 con lecturas de caché a la mitad para el paso de redacción de cotizaciones, y un grafo de conocimiento para la resolución de piezas sustitutas. El coste mensual de inferencia de la pila completa cayó un 75% el 7 de octubre — de unos 4.000 dólares a menos de 1.000 — sin cambiar una sola línea de código de integración. Los módulos MCP, el grafo de conocimiento y la traza de auditoría son lo que hace real la reducción de coste. El precio del modelo es la parte fácil.

Solicite una construcción con alcance definido

Descubrimiento de una semana. Recibe un inventario de sistemas, un mapa de flujos de trabajo y un alcance fijo — construyas con nosotros o no.

¿Quieres esto construido para tus sistemas?

Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.

Solicitar un proyecto

Descubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.