Volver a la Biblioteca
Estrategia

30% más barato por tarea, 7 veces más tokens: dentro de la trampa de eficiencia de Sonnet 5.5

Última actualización: 27 de septiembre de 2026

Puntos clave

  • El titular de Sonnet 5.5, "hasta 30% menos por tarea", se sostiene con esfuerzo bajo y medio pero se invierte a máximo: Anthropic cobró la misma tabla de tarifas de $2/$10 mientras el modelo gastaba ~193,000 tokens de salida por tarea del índice — el consumo de tokens más pesado que Artificial Analysis haya medido — dejando el costo medido en $7.60 por tarea, unos 50% más que Sonnet 5 y ~27% más que los $5.98 de Opus 5.5 (Anthropic, 28 sep; Artificial Analysis, 28 sep).
  • La misma ventana de lanzamiento produjo dos estrategias opuestas: OpenAI recortó un 50% los precios de GPT-6 Sol/Luna a $2/$10 y $0.10/$0.50 por millón de tokens el 22 de septiembre — GPT-6 Sol a máximo cuesta $1.06 por tarea del Intelligence Index, unos 50% por debajo de su predecesor — mientras Anthropic mantenía la tabla de tarifas de Sonnet intacta y dejaba subir la factura de tokens (OpenAI; Artificial Analysis).
  • Opus 5.5 (22 de septiembre) tomó un tercer camino: 20% menos en el precio de lista y 60% menos en lecturas de caché ($0.50 → $0.20 por millón), atacando la partida que domina las cargas agénticas — por eso su costo medido de $5.98 por tarea undercut a su propio hermano menor a máximo esfuerzo (Anthropic; Finout).
  • Con esfuerzo alto a máximo, Sonnet 5.5 queda fuera de la frontera costo-eficiencia: GPT-6 Sol ofrece inteligencia casi igual a "efectivamente el mismo costo por tarea", y GPT-6 Luna a máximo hace trabajo de inteligencia equivalente por $0.07 por tarea — unos cien avos de la factura de Sonnet 5.5 a máximo (Artificial Analysis, 28 sep).
  • Cerca de 180 de 672 modelos rastreados tuvieron un cambio de precio en septiembre — la tabla de tarifas es ahora un riesgo mensual, y un agente cuyo contrato solo nombra precios por token no tiene defensa contra un reemplazo que nunca aprobó (pricepertoken, 28 sep; la reversión de auto-enrutamiento de DeepSeek es el ejemplo trabajado).

Anthropic lanzó Claude Sonnet 5.5 el 28 de septiembre con la afirmación de costo más limpia del mercado: "Es una mejora clara sobre Claude Sonnet 5, corre 30%+ más rápido y cuesta hasta 30% menos para la mayoría del trabajo." Cada palabra es defendible — y el mecanismo no es el que el titular implica. La tabla de tarifas no se movió: $2 por millón de tokens de entrada, $10 de salida, $0.20 lecturas de caché, idéntica a Sonnet 5. Lo que cambió es la factura de tokens, y se movió en dirección opuesta a la afirmación en el nivel de esfuerzo que el trabajo agéntico realmente usa. Artificial Analysis ejecutó el modelo el día de su lanzamiento: a máximo esfuerzo, Sonnet 5.5 gastó ~193,000 tokens de salida por tarea del Intelligence Index — el más alto que sus pruebas hayan registrado, unos 60% por encima de Opus 5.5 a máximo y aproximadamente siete veces GPT-6 Astra — produciendo un costo medido de $7.60 por tarea (Artificial Analysis, 28 sep; registrado primero por el equipo de kingy.ai: "Sonnet 5.5 es barato por token pero puede ser caro por tarea").

Por sí solo, eso es una peculiaridad de un modelo. Leído contra la misma ventana de dos semanas, es la bifurcación de la industria. El 22 de septiembre, OpenAI recortó un 50% los precios de GPT-6 Sol y Luna (OpenAI) y Anthropic recortó un 60% las lecturas de caché de Opus 5.5 (Anthropic). Seis días después, la entrada de Anthropic "30% más barato" precioa el mismo volumen de tokens que los competidores venden a la mitad de la tarifa — y compra capacidad #2 del índice gastando tokens en lugar de comprarlos a la baja. Tres estrategias de lanzamiento compiten ahora por la misma métrica, el costo por tarea, y divergen más exactamente donde vive la guía de adquisición de inferencia. Este artículo mapea las tres estrategias contra los números medidos de Artificial Analysis, trabaja la aritmética de eficiencia de tokens que una tabla de tarifas por token oculta, y cierra con las cuatro cláusulas de contrato que evitan que el próximo cambio de modelo reprecio silenciosamente la factura de tu agente.

La afirmación, el mecanismo y la medición

La afirmación de Anthropic es de eficiencia, y la página de lanzamiento es explícita sobre el mecanismo: el modelo "normalmente necesita muchos menos tokens para hacer el mismo trabajo. En nuestras pruebas, cuesta hasta 30% menos por tarea que su predecesor." Eso es cierto en la distribución de pruebas de Anthropic con los ajustes que Anthropic eligió — la compañía reporta que Sonnet 5.5 supera los mejores puntajes benchmark de Sonnet 5 "por cerca de un décimo del costo por tarea" con esfuerzo bajo y medio (según resume kingy.ai). Si tu carga de trabajo corre ligera y con forma Anthropic — borradores cortos, clasificación, búsquedas acotadas — la afirmación probablemente se sostenga en tu factura.

Las cargas agénticas no son esa distribución. El Intelligence Index de Artificial Analysis ejecuta tareas de múltiples pasos bajo cinco niveles de esfuerzo, y el razonamiento adaptativo del modelo escala el nivel en tareas difíciles. En el tope de ese rango la factura de tokens explota: 193k tokens de salida por tarea a máximo, contra ~120k de Sonnet 5 a máximo y Opus 5.5 a máximo (+60%) y 27k de GPT-6 Astra a máximo (7x). El volumen de tokens es el punto — Sonnet 5.5 (máximo) puntúa 56 en el índice, 2 puntos detrás del 58 de Opus 5.5, con Terminal-Bench 4.0 en 64%, ligeramente por encima de Opus 5.5 y GPT-6 Astra. Alcanza esa capacidad pensando más por paso, y los tokens de salida facturan a $10 por millón sin importar cuán defendible haya sido cada uno. Una nota al pie de fallback completa la mecánica: el enrutamiento adaptativo por defecto de Anthropic "cae en ~0.1% de las tareas... cayendo a Sonnet 5 en todos los casos" — otra sustitución neutral a la tabla de tarifas que un operador solo ve en la factura (Artificial Analysis).

El costo por tarea es la única métrica que sobrevive al contacto con esta estructura, porque compone la tabla de tarifas con la factura de tokens. Las mediciones del mismo día, todas de costo por tarea en el Intelligence Index a máximo esfuerzo:

Modelo (máximo) Tarifa ($/M entrada/salida) Tokens de salida/tarea Costo medido/tarea Estrategia de lanzamiento
Claude Sonnet 5.5 $2 / $10 ~193k $7.60 Guiada por capacidad: tabla de tarifas plana, factura de tokens al alza
Claude Opus 5.5 $4 / $20 (caché $0.20) ~120k $5.98 Guiada por caché: tarifa −20%, partida agéntica −60%
Claude Sonnet 5 $2 / $10 ~120k ~$5.00 Línea base
GPT-6 Sol $2 / $10 ~31k $1.06 Guiada por precio: tarifa −50%
GPT-6 Luna $0.10 / $0.50 ~51k $0.07 Guiada por precio: tarifa piso

(Puntuaciones del AA Intelligence Index v4.x: Sonnet 5.5 56 en #2; Opus 5.5 58 en #1; GPT-6 Sol equivalente de clase ~56 en trabajo de agentes de código. Las puntuaciones llevan un caveat de linaje — AA ha rehecho la base de su índice dos veces este año, así que cita puntuaciones solo contra publicaciones de la misma fuente.)

La trampa está en la primera y tercera filas: precios anunciados idénticos, 7.6x de distancia en costo medido. Una decisión de adquisición tomada sobre la tabla de tarifas — "Sonnet 5.5 iguala el precio de Sonnet 5, así que es la actualización económica" — produce exactamente el inverso de la factura. Y el ranking medido invierte la intuición una segunda vez: el precio anunciado más caro sobre la mesa (Opus 5.5 a $4/$20) es la tarea más barata, porque su recorte de lecturas de caché ataca la partida que las cargas agénticas realmente dominan — releer contexto largo miles de veces por tarea (Anthropic: "Las lecturas de caché (que constituyen la mayoría de los costos de trabajo agéntico y de código) están a $0.20 por millón de tokens").

Tres estrategias de lanzamiento, un solo campo de batalla

La ventana de septiembre formalizó lo que la guerra de precios venía insinuando desde junio: el precio por token ya no es donde compiten los proveedores, porque el precio por token se ha vuelto casi gratis. El campo de batalla se movió al costo por tarea, y cada laboratorio eligió un arma distinta.

Guiada por capacidad (Anthropic, línea Sonnet). Lanzar un modelo casi frontera sobre la vieja tabla de tarifas y ganar la tabla de benchmarks. Sonnet 5.5 en #2 con una factura de tokens 60% más pesada es la forma más pura: la ganancia de inteligencia es real (+18 puntos de índice sobre Sonnet 5 a máximo), y su costo aterriza en la línea de tokens de la factura, donde "30% más barato" y "$7.60" siguen siendo técnicamente ciertos. La estrategia apuesta a que los compradores leen titulares y benchmarks y tratan el volumen de tokens como un bien gratis — y según el pronóstico de Gartner del 16 de septiembre de que el gasto mundial en IA crece 49.5% en 2026 hasta $2.7T, con el segmento de agentes y asistentes en una trayectoria de $16.5B → $29.2B → $65.5B, la apuesta tiene una audiencia real.

Guiada por precio (OpenAI, línea Sol/Luna). Recortar a la mitad la tarifa y publicar la matemática por tarea tú mismo. La tabla de lanzamiento de OpenAI está lista para adquisición como ningún lanzamiento de modelo lo ha estado: GPT-6 Sol (xhigh) puntúa 33.2% a $0.27 por tarea contra Claude Opus 5 (máximo) en 26.9% por 11.1x el costo. Del lado de Artificial Analysis, GPT-6 Sol a máximo recortó a la mitad los $1.99 de su propio predecesor a $1.06 mientras ganaba 2 puntos en el Coding Agent Index (Artificial Analysis). La estrategia apuesta a que el costo por tarea medido y publicado es la métrica de compra del futuro — y que un proveedor confiado en su eficiencia gana la adquisición haciendo que las comparaciones de costo sean sin esfuerzo.

Guiada por caché (Anthropic, línea Opus). Mantener la tarifa de frontera, vaciar el impulsor de costo agéntico. El recorte de lecturas de caché de Opus 5.5 de $0.50 a $0.20 apunta exactamente a la forma de carga donde viven los tokens agénticos — lecturas repetidas de contexto grande y estable. Anthropic estima ~40% menos de costo total en trabajo típico (Fello AI resumiendo las afirmaciones del lanzamiento), y los $5.98 medidos por tarea contra $7.60 confirman la dirección de forma independiente.

La misma métrica. Tres estrategias opuestas. Costo por tarea del Intelligence Index a máximo esfuerzo, medido — lanzamientos de sept 2026 · Artificial Analysis COSTO MEDIDO POR TAREA (MÁXIMO ESFUERZO) $7.60 Sonnet 5.5 193k tokens de salida/tarea $5.98 Opus 5.5 lecturas de caché recortadas 60% ~$5.00 Sonnet 5 la línea base "predecesora" $1.06 GPT-6 Sol tarifa recortada 50% $0.07 GPT-6 Luna nivel piso Sonnet 5.5 a máximo cuesta 7.2x GPT-6 Sol a máximo — sobre una tabla de tarifas idéntica de $2/$10 TRES ESTRATEGIAS DE LANZAMIENTO, SEPTIEMBRE 2026 Guiada por capacidad — Anthropic Sonnet 5.5 Tabla de tarifas plana en $2/$10. Ganar el índice (#2, puntaje 56) pensando más: 193k tokens/tarea, lo más pesado que AA ha medido. El costo aterriza en la línea de tokens de la factura. El benchmark compra el titular Guiada por precio — OpenAI Sol / Luna Recortar la tarifa a la mitad (22 sept) y publicar la matemática por tarea en la publicación: Sol xhigh a $0.27/tarea vs Opus 5 máximo a 11.1x el costo. Luna: 96% menos por tarea que Fable 5. Adquisición por números publicados Guiada por caché — Anthropic (Opus) Opus 5.5 Tarifa −20%, lecturas de caché −60% ($0.50 → $0.20). Ataca la partida que dominan las cargas agénticas: "las lecturas de caché... constituyen la mayoría de los costos de trabajo agéntico y de código." El hermano mayor undercut al menor LA ARITMÉTICA QUE LA TARIFA OCULTA — UNA CARGA DE 200 PASOS, 1,000 PASOS/DÍA Sonnet 5.5 máximo: 1,200 pasos/semana x 193k tokens de salida = 231.6M tokens de salida/semana x $10/M = $2,316/semana La misma carga en GPT-6 Sol máximo: 31k tokens → $121/semana. En Sonnet 5 máximo: 120k tokens → $1,200/semana. El modelo "30% más barato" cuesta 1.9x a su propio predecesor en este perfil — la tarifa nunca cambió; la columna de tokens sí. Los niveles de esfuerzo cambian la factura 30x — contrata para el techo El precio por token es la métrica de adquisición equivocada. Contrata por costo por tarea o el cambio elige tu factura. Fija IDs de modelo por paso · bloquea tokens por tarea con un circuit breaker · registra el modelo servido, no el solicitado · exige precios por tarea publicados La reversión de 45 horas de DeepSeek prueba que los cuatro son necesarios — y ninguno suficiente por sí solo. Sonnet 5.5 máximo $7.60/tarea · Opus 5.5 $5.98 · Sonnet 5 ~$5.00 · GPT-6 Sol $1.06 · GPT-6 Luna $0.07 Fuentes: Artificial Analysis (22 + 28 sept) · Anthropic · OpenAI — ideabosque.com

El punto del diagrama es el recuadro de aritmética, no las barras: una tabla de tarifas es un precio por millón; un contrato de costo por tarea es un precio por resultado. En una carga de 200 pasos ejecutada 1,200 veces por semana, Sonnet 5.5 a máximo gasta 193k tokens de salida por paso y factura unos $2,316 semanales donde GPT-6 Sol factura $121 por inteligencia medida casi igual (ambos puntúan a mediados de los 50 en el índice; la economía de código de Sol a $2.99 por tarea está en la frontera de Pareto según el análisis del índice de código de AA). El diferencial semanal entre el modelo "30% más barato" y su propio predecesor es de unos $1,100 — la afirmación de "hasta 30% menos" y un aumento de costo de 2x son simultáneamente ciertos, distinguidos solo por la distribución de esfuerzo. Por eso el contrato importa más que la publicación de lanzamiento.

El problema de adquisición que septiembre acaba de hacer más difícil

Dos hechos estructurales convierten esto de comentario en lenguaje de contrato. Primero, el riesgo de la tabla de tarifas es ahora mensual: pricepertoken lee cerca de 180 de 672 modelos rastreados con un cambio de precio en septiembre (la deriva del contador a lo largo del mes: 178/672 → 181/671), y la línea de tiempo de LLM Gateway lista 23 modelos nuevos de 15 proveedores este mes — la factura que tu agente corrió en agosto no es la que corre en octubre. Segundo, la capa de sustitución ya se envía como producto: Smart Route de LLM Gateway lanzado el 25 de septiembre hace del enrutamiento del lado del proveedor una característica comprable, y el fallback adaptativo de Anthropic ("cae en ~0.1% de las tareas, principalmente en Terminal-Bench, cayendo a Sonnet 5 en todos los casos" según las pruebas de AA) es el mismo mecanismo dentro de la llamada del modelo. Ninguno es mala conducta — el episodio de DeepSeek mostró que los proveedores pueden incluso anunciar una sustitución de modelo para toda la flota y revertirla 45 horas después bajo presión de usuarios. La decisión de enrutamiento es real y pertenece a quien tenga el runtime.

Con ese trasfondo, comprar sobre la tabla de tarifas tiene tres modos de falla específicos:

  1. El error de titular-benchmark. Sonnet 5.5 encabeza la historia de capacidad (índice #2, Terminal-Bench 4.0 en 64%) y la historia de costo (30% menos por tarea) en el mismo lanzamiento — ambas ciertas, compuestas contra líneas base distintas. Un proceso de adquisición que lee la publicación de lanzamiento y la tabla de benchmarks pero no la columna de tokens aprueba la configuración de costo por tarea más cara sobre la mesa.
  2. El pronóstico ciego al esfuerzo. La mayor parte de la matemática de costos publicada asume configuraciones publicadas. El barrido de AA muestra que la factura de Sonnet 5.5 oscila por esfuerzo (máximo $7.60 contra ~$5.00 de Sonnet 5; configuraciones baja/media donde vive la afirmación "30% más barato"); un pronóstico construido sobre el valor por defecto de la API hereda el nivel que la lógica de escalada del SDK del proveedor elija por tarea.
  3. El precio unitario ciego al caché. Dos modelos de Anthropic con 30 días de diferencia eligieron ejes opuestos — Sonnet 5.5 dejó los tokens caros, Opus 5.5 hizo barata la lectura cacheada. La proporción real de aciertos de caché de una carga agéntica (prompts de sistema largos y estables; esquemas de herramientas repetidos; gran contexto recuperado) es ahora el mayor determinante único de cuál de los dos es más barato — un número que la mayoría de los procesos de RFQ nunca piden.

Ninguno de estos es engaño del proveedor. Los tres son el resultado normal de un mercado cuyas economías unitarias se desplazaron debajo de su propio lenguaje de precios — la misma conclusión a la que llegó AA en una línea: "Sonnet 5.5 es barato por token pero puede ser caro por tarea."

El contrato: cuatro cláusulas que sobreviven al próximo lanzamiento

La solución no es elegir el laboratorio ganador; en costo por tarea, el ganador cambia cada semana (el contador de pricepertoken se mueve cada mes). Es instrumentar la decisión para que el próximo cambio sea una modificación de configuración medida en lugar de una sorpresa en la factura. Las cuatro cláusulas mapean al mismo runtime que este sitio construye en cada agente:

1. Fija IDs de modelo por paso y registra el modelo servido, no el solicitado. La capa de enrutamiento es infraestructura del operador. Los campos model viven en la configuración de tu agente — en nuestro runtime de referencia, los agentes referencian recursos de modelo registrados por proveedor + nombre, y cambiar el modelo es una operación de datos, no un redeploy. La pista de auditoría registra el modelo realmente servido por llamada de herramienta (el artículo de DeepSeek cubre el patrón completo del incidente). Un proveedor que cambia tu modelo silenciosamente ahora produce un diff visible.

2. Contrata por costo por tarea con un techo semanal, no por token con una factura mensual. El precio por tarea se está convirtiendo en una métrica de primer nivel publicada (OpenAI la publica en tablas de lanzamiento; AA mide a todos contra las mismas tareas). Un contrato acotado nombra la carga (pasos, forma del contexto, proporción de aciertos de caché esperada), el modelo y nivel de esfuerzo por clase de paso, y un techo medido por tarea — con el precio por tarea publicado del proveedor como la fila benchmark. El marco de seis vectores de costo aporta la lista de auditoría; el quinto vector (riesgo de sustitución de proveedor) es la cláusula que esta sección operacionaliza.

3. Presupuesta tokens con el dial de esfuerzo como superficie de adquisición, no como ajuste de desarrollador. El balanceo de 30x en la factura de Sonnet 5.5 entre niveles de esfuerzo es el caso concreto. La capa de enrutamiento debe tratar el esfuerzo de razonamiento como un campo de configuración con tipo por clase de paso — umbrales de escalada explícitos, techos con parada dura en el runtime (el patrón de techo de costo de agentes de larga duración), y la política de escalada visible en la pista de auditoría. Un valor por defecto de "máximo esfuerzo" a lo largo de 1,200 pasos diarios es una decisión de adquisición que nunca se tomó.

4. Prueba la eficiencia afirmada sobre tu carga antes de comprometer una flota. El "hasta 30% menos" de Anthropic es honesto, acotado y condicional a la carga — y la contramedición de $7.60 de AA también es honesta, acotada y condicional a la carga. Ninguna de las dos dice tu factura. El piloto de 30 minutos: toma una semana de ejecuciones reales del agente, reprodúcelas contra el modelo candidato en cada nivel de esfuerzo, mide tokens y proporción de aciertos de caché por paso, y pon los tres números (tabla de tarifas, factura de tokens, costo medido por tarea) en el documento de adquisición. El stack de tres capas de TypeSafe Jev hace esto continuo — un clasificador de capa de decisión calibrado vigila la factura por clase de paso, porque el vigilante es casi gratis por llamada.

Un marcador de honestidad aplica a todo lo anterior, incluido el recuadro de aritmética: todos los números medidos por tarea vienen de dos fuentes independientes de prueba del mismo día (AA, kingy.ai) más tablas publicadas por los proveedores, sobre tareas de benchmark, no tu carga. El Intelligence Index de AA también ha rehecho su base dos veces este año; las puntuaciones y costos citados aquí son comparaciones de la misma fecha de publicación y pueden cambiar en el próximo rebase. Trata todo esto como la línea base de partida que un piloto reemplaza — la dirección (tarifa ≠ factura; los tokens son la variable) es estable, las constantes exactas no lo son.

El resultado, sobre un perfil real

Ejecuta los números sobre el perfil de construcción mid-market alrededor del cual escribe este sitio: el agente de cotización de un distribuidor, 200 RFQs por semana, unos 1,200 pasos de modelo por semana a lo largo de búsqueda de catálogo, precio por niveles, sustitutos del grafo de conocimiento y generación de borradores. A Sonnet 5.5 máximo, ese perfil factura alrededor de $2,300 por semana. Enrutado deliberadamente — esfuerzo de frontera solo en pasos relevantes para la negociación, un modelo de gama media en búsquedas, un modelo casi piso en clasificación, contexto pesado en caché compartido entre pasos — la misma carga factura menos de $300 por semana con la calidad concentrada donde vive realmente el resultado de negocio: la cotización que ve el cliente. La diferencia del 87% no es destreza de selección de modelo; es el runtime haciendo cumplir una decisión de costo que la publicación de lanzamiento nunca tomó por ti. A estos volúmenes, la capa de integración — módulos MCP, la política de enrutamiento, la pista de auditoría — sigue siendo el 90% de la construcción que una tabla de tarifas por token no puede precioar; la factura del modelo es el ruido, y el patrón anterior es cómo la mantienes como ruido en lugar de la señal.

Lectura relacionada


Un distribuidor de mid-market que ejecuta NetSuite y BigCommerce cotiza 200 RFQs por semana a través de un stack de agentes gobernado: módulos MCP para el ERP y tres catálogos de proveedores, un grafo de conocimiento para sustitutos de partes, un motor de RFQ gestionando reservas de disponibilidad — y una capa de enrutamiento que fija IDs de modelo por clase de paso, bloquea tokens por tarea y registra el modelo servido en cada llamada. Cuando la próxima publicación de lanzamiento afirme "30% más barato," la capa corre un piloto de repetición de una semana y el documento de adquisición obtiene tres números en lugar de un adjetivo. Primer agente en producción en 5–8 semanas.

Solicita una construcción delimitada. Descubrimiento de una semana. Obtienes un inventario del sistema, un mapa de flujo de trabajo y un alcance fijo — ya sea que construyas con nosotros o no.

¿Quieres esto construido para tus sistemas?

Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.

Solicitar un proyecto

Descubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.