Volver a la Biblioteca
Estrategia

Economía de la inferencia: por qué los agentes de producción always-on ahora son asequibles

Última actualización: 29 de julio de 2026

Actualización — 2026-08-18: Anthropic $65B run-rate con objetivo IPO $2T, OpenRouter 50% GPT-5.6 Sol, Stripe adquiere OpenRouter $7B+ — el punto de prueba de rentabilidad a escala corporativa y el enrutamiento de modelos como categoría de procurement

Tres desarrollos redefinen la tesis de economía de inferencia: Anthropic $65B run-rate con objetivo IPO $2T, OpenRouter 50% GPT-5.6 Sol a $2.50/$15, y Stripe adquiriendo OpenRouter por $7B+.

  1. Anthropic $65B run-rate con objetivo IPO $2T. La tasa de ingresos anualizada superó $65 mil millones a finales de julio 2026, frente a $9 mil millones a finales de 2025 — un aumento de 7× en 7 meses. IPO objetivo $2 billones (octubre 2026). La curva de costo de cómputo (71→56 céntimos por dólar de ingresos) produce un lab frontera con $65B run-rate y objetivo IPO $2T. El contraste con OpenAI ($25B anualizado con $14B pérdida) demuestra que la economía IA no es determinista.

  2. OpenRouter 50% GPT-5.6 Sol a $2.50/$15. El precio del modelo frontera #1 en SWE-bench ahora está dentro de 2× de Gemini 3.7 Flash. SemiAnalysis advierte que puede ser promocional, no estructural. Quinto vector de optimización: enrutamiento vía gateways.

  3. Stripe adquiere OpenRouter por $7B+. La infraestructura de pagos quiere poseer la capa de selección de modelos IA. El enrutamiento de modelos se consolida en infraestructura de pagos — convirtiéndose en una categoría de procurement.

Actualización — 2026-08-17: Anthropic primer beneficio operativo, OpenAI pérdida de $14B, GPT-5.6 Ultrafast, reversión de precio de DeepSeek — la curva de eficiencia y el marcador de honestidad

Cuatro desarrollos redefinen la tesis de economía de inferencia: el primer punto de prueba de rentabilidad de un laboratorio frontera, el contraste definitorio de economía de IA, la primera aceleración de inferencia a escala de oblea en un modelo frontera, y el primer aumento de precio de un proveedor de bajo coste.

  1. Anthropic alcanzó su primer beneficio operativo — aproximadamente $559 millones sobre $10.9 mil millones de ingresos Q2 2026, más del doble de los $4.8 mil millones de Q1. El principal impulsor fue la caída de costes de cómputo: 71 céntimos por dólar de ingresos en Q1 → 56 céntimos en Q2 — una mejora de 15 puntos en un trimestre. Reducir los costes de serving de 71 a 56 céntimos por dólar de ingresos en un solo trimestre es lo que produjo el cambio hacia la rentabilidad.

  2. La presentación de IPO de OpenAI salió a la luz — aproximadamente $2 mil millones/mes en ingresos (~$25B anualizados) junto con una pérdida proyectada de $14 mil millones para 2026, apuntando a una valoración de más de $1T. El contraste OpenAI-Anthropic es el argumento definitorio: $25B en ingresos con $14B en pérdidas (OpenAI) vs. $10.9B en ingresos con $559M en beneficio (Anthropic). La economía de IA no es determinista — la curva de coste de cómputo (71→56 céntimos por dólar de ingresos) es el diferenciador, no la escala de ingresos.

  3. GPT-5.6 Sol Ultrafast — hasta 14× de velocidad en hardware Cerebras. OpenAI mostró el modo Ultrafast — GPT-5.6 Sol a hasta 14× la velocidad del procesamiento Standard, en hardware Cerebras a escala de oblea. El primer punto de datos de producción concreto para aceleración de inferencia a escala de oblea en un modelo frontera. La frontera de coste tiene ahora cuatro vectores de optimización: routing de modelos (Nemotron Switchyard), optimización de infraestructura (Dynamo 0.4 disaggregated serving), especialización de hardware (Cerebras 14×), y competencia de suelo de precios (Luna $0.20, reversión de DeepSeek).

  4. Aumento de precio de DeepSeek V4 Flash — $0.14 → $0.27 por millón de tokens el 14 de agosto, casi duplicándolo. El primer aumento de precio de un proveedor de modelos abiertos de bajo coste. Marcador de honestidad: la historia de economía de inferencia no es monótonamente decreciente. DeepSeek subió el precio de V4 Flash de $0.14 a $0.27/M. La reversión no invalida la tesis de colapso de coste — confirma que la frontera de coste está fijada por la competencia, no por un único proveedor.

La tesis se refuerza en cuatro ejes: la curva de eficiencia alcanzó la P&L de un laboratorio frontera (Anthropic 71→56 céntimos), el contraste de economía de IA probó no-determinismo (pérdida de $14B de OpenAI vs. beneficio de $559M de Anthropic), el vector de especialización de hardware obtuvo un punto de datos concreto (Cerebras 14×), y la frontera de coste obtuvo su primer aumento de precio (DeepSeek $0.14→$0.27). La restricción vinculante sigue siendo la capa de integración — $10 de trabajo de proceso y gobernanza por cada $1 de gasto en modelo.

Actualización — 2026-08-16: Valoración de $190B de Databricks — la tesis de fundación de infraestructura de datos validada

Databricks cerró una ronda de financiación estratégica a aproximadamente $190B de valoración (agosto 2026) con una tasa de ingresos anualizada de $7B — frente a $5.4B en febrero, una aceleración del 65% a más del 80% de crecimiento interanual. Para la tesis de economía de inferencia, la valoración de Databricks es la validación comercial más fuerte del argumento de fundación de infraestructura de datos: la capa de plataforma de datos está capitalizando ingresos más rápido que la capa de modelos. El crecimiento del 80%+ interanual a tasa de $7B significa que el gasto en infraestructura de datos crece más rápido que el gasto en API de modelos — el modelo es el 10% del coste, la integración es el 90%.

Un agente en segundo plano que monitoriza un buzón de procurement 24/7 y redacta respuestas a cotizaciones solía ser un experimento prohibitivamente caro. En enero de 2026 la inferencia por sí sola habría costado más de $2.000 por semana. A finales de julio cuesta menos de $50. El modelo ya no es la parte cara de un agente de producción — y ese cambio ocurrió más rápido de lo que ninguna previsión predijo, en recortes de precio en tiempo real dentro de una sola generación de modelo. Pero el colapso del coste no desbloqueó la construcción: todavía se necesitan $10 de trabajo de proceso, gobernanza e integración por cada $1 de gasto en modelo. Este artículo mapea lo que el colapso de 1.000× en el coste de inferencia significa para la decisión de arquitectura que todo equipo B2B afronta: si construir agentes de producción always-on, y qué bloquea realmente esa construcción ahora que el modelo ya no es la parte cara.

Actualización — 2026-08-15: DeepSeek Harness Code mode y tarifas por crédito publicadas de HubSpot Q2 2026

  1. DeepSeek Harness Code mode — cinco round trips comprimidos a una llamada. El preset Code genera un TypeScript SDK, comprimiendo una secuencia de cinco round trips a una sola llamada — ~80% menos tokens para tareas multi-paso. 2. HubSpot Q2 2026 tarifas por crédito publicadas. 1 crédito = $0.01. Customer Agent 50 créditos/conversación resuelta ($0.50). Prospecting Agent 100 créditos/lead ($1.00). Data Agent 10 créditos/prompt ($0.10). Content Agent 1,000 créditos/pieza ($10).

Puntos clave

  • OpenAI recortó Luna un 80% a $0.20/$1.20 por millón de tokens el 30 de julio de 2026 — la mayor reducción de precio frontera en un solo día registrada. Amazon Bedrock reflejó los recortes el mismo día, y el modo Fast de Sol ofrece 2.5× velocidad a 2× precio. El colapso de 1.000× en el coste ya no es un arco plurianual; está ocurriendo en recortes de precio en tiempo real dentro de una sola generación de modelos.
  • El 29% del volumen de tokens de producción se ejecuta en modelos open-weight con menos del 4% del gasto (Vercel AI Gateway Production Index, julio 2026) — la disciplina de routing ya es visible en los datos de producción. El modelo más barato capaz por tarea es una decisión de configuración, no un proyecto de investigación.
  • La inferencia es el 67% del cómputo de IA, frente al 33% en 2023, y el 55% del gasto en nube de IA ($37.5B) — el centro de coste pasó de entrenamiento a serving, justo donde los recortes de precio se acumulan. Los agentes always-on que eran prohibitivamente caros hace un año ahora son económicamente viables.
  • $10 de trabajo de proceso, gobernanza e integración por cada $1 de gasto en modelo (xccelera.ai, 2026) — el modelo es el 10% del coste de un sistema de agente de producción. El 90% es la capa de integración: módulos MCP, grafos de conocimiento, trazas de auditoría, checkpoints human-in-the-loop, recuperación de errores. Los modelos más baratos no arreglan esto.
  • Fiddler AI reporta tasas de fallo de agentes del 70–95% en producción — la inferencia más barata no reduce las tasas de fallo; las hace más baratas de producir. La inversión en gobernanza y observabilidad es lo que separa a un agente que se despliega de uno que falla silenciosamente.

El colapso de coste es en tiempo real, no retrospectivo

La formulación estándar de la economía de la inferencia traza un arco plurianual: $20 por millón de tokens a principios de 2023 a menos de $1 hoy, una caída de 20–50×. Esa formulación ahora es engañosa. La caída se está acelerando, no desacelerando. En una sola semana a finales de julio de 2026, tres movimientos de precio impactaron la frontera simultáneamente:

  1. OpenAI Luna -80% (30 de julio): $0.20/$1.20 por millón de tokens. Luna es el modelo de agente en segundo plano por defecto en Ramp, Cognition (Devin Fusion) y Dust. Un agente en segundo plano que monitoriza una cola de procurement 24/7 ahora cuesta céntimos al día en inferencia.
  2. Claude Opus 5 a $5/$25 (24 de julio): la mitad de los $10/$50 de Fable 5. La frontera se abarató sin una regresión de capacidad — Opus 5 lidera SWE-bench Verified con 97.00%.
  3. Gemini 3.6 Flash a $1.50/$7.50 (21 de julio): 17% menos tokens de salida que 3.5 Flash en trabajo agéntico, hasta 65% menos en tareas de horizonte largo. Mismo Intelligence Index 50 — más barato y rápido, no más inteligente.

El patrón entre proveedores es consistente: cada release optimiza precio-rendimiento en el mismo o mayor nivel de inteligencia. La frontera se abarata simultáneamente en la parte alta (Opus 5) y la baja (Luna) del nivel. Un equipo que presupuestó $50.000/mes en inferencia de agentes en enero 2026 puede ejecutar la misma carga por menos de $5.000 en agosto 2026 — sin cambiar la arquitectura del modelo, el prompt o la definición de tarea.

Qué cambió: la inferencia pasó de entrenamiento a serving

En 2023, el cómputo de IA era 67% entrenamiento y 33% inferencia. En 2026, esa proporción se invirtió: la inferencia es ahora el 67% del cómputo de IA y el 55% del gasto en nube de IA. La revisión del forecast de Gartner del 27 de julio sitúa el gasto TI mundial en $6.37T en 2026 (+14.2%), con sistemas de centro de datos creciendo 62.5% hasta $822B e IaaS creciendo 29.3% hasta $287B. John-David Lovelock de Gartner calificó la construcción de cómputo de IA como "el mayor proyecto de infraestructura jamás intentado por la humanidad".

El cambio de gasto de entrenamiento a serving es estructuralmente significativo para la arquitectura de agentes. Los costes de entrenamiento están hundidos — un modelo frontera cuesta cientos de millones en entrenar independientemente de si lo usas. Los costes de serving son variables — escalan con cada invocación de agente, cada llamada a herramienta, cada paso de retrieval. Cuando el serving domina la estructura de costes y los precios de serving caen 80% en un solo día, la economía de los agentes always-on se invierte. Un agente que monitoriza 200 RFQ por semana, consulta tres catálogos de proveedores y redacta respuestas de cotización era marginalmente rentable a $20/M tokens. A $0.20/M tokens, el coste de inferencia es un error de redondeo frente al tiempo de personal que reemplaza.

La proporción 10:1: por qué los modelos más baratos no desbloquean la construcción

El colapso del coste de inferencia resuelve el problema más fácil en el despliegue de agentes de producción. El problema más difícil es la capa de integración.

Los datos empresariales de xccelera.ai de 2026 cuantifican la proporción: por cada $1 invertido en tecnología de IA, las empresas gastan hasta $10 en rediseño de procesos, marcos de gobernanza, reestructuración de personal e integración operativa. El modelo es el 10% del coste de un sistema de agente de producción. El otro 90% es:

  • Módulos MCP que conectan el agente a NetSuite, HubSpot, BigCommerce, ShipStation y catálogos de proveedores — cada uno con su propia autenticación, límites de tasa y brecha semántica entre la superficie del API y lo que el agente realmente necesita saber.
  • Grafos de conocimiento que dan al agente compatibilidad de productos, piezas sustitutas e historial de proveedores — contexto estructurado que un LLM en crudo no tiene.
  • Checkpoints human-in-the-loop para acciones sensibles: aprobación de cotizaciones, emisión de órdenes de compra, comunicación con proveedores. El patrón de kill-switch no es opcional para flujos B2B.
  • Trazas de auditoría y observabilidad: cada llamada a herramienta, cada invocación de modelo, cada decisión registrada y atribuible. OWASP MCP08 (Falta de Auditoría y Telemetría) es un riesgo top-10 de MCP por una razón.
  • Recuperación de errores: lógica de retry, cadenas de fallback, estrategias de timeout para tareas de larga duración. La tasa de fallo del 70–95% en producción de Fiddler AI se debe a errores acumulados, averías de herramientas y alucinaciones — no al coste del modelo.

La inferencia más barata hace cada fallo más barato de producir, no menos probable. La inversión en gobernanza e integración es lo que separa a un agente que se despliega de uno que falla silenciosamente. Un equipo que trata el recorte de Luna como permiso para saltarse el trabajo de integración obtendrá fallos más baratos, no menos fallos.

El artículo incluye un explicador de un minuto que muestra dónde vive realmente el coste de un sistema de agente de producción:

Dónde vive realmente el coste de un agente de producción El modelo es el 10% de la construcción. La integración es el 90%. 10% Inferencia del modelo $0.20/$1.20 por M tokens El otro 90% — integración y gobernanza Módulos MCP NetSuite, HubSpot, BigCommerce, ShipStation Grafos de conocimiento Compatibilidad, sustitutos, historial Human-in-the-loop Aprobación de cotización, kill-switch Auditoría y observabilidad OWASP MCP08, trazas de herramientas -80% Recorte Luna, 30 jul 2026 10:1 Integración vs gasto en modelo (xccelera) 70-95% Tasa de fallo en producción (Fiddler) $6.37T Gasto TI global 2026 (Gartner) ! Conclusión La inferencia más barata hace viables los agentes always-on — pero viabilidad no es fiabilidad. El 90% del coste y riesgo es integración, gobernanza y recuperación de errores. Construye la capa model-flexible primero. Trata la selección de modelo como operación de datos, no despliegue de código. La inferencia es el 67% del cómputo de IA, 55% del gasto en nube — ideabosque.com/library Modelo MCP Grafo de conocimiento Gobernanza Observabilidad

La construcción model-flexible: routing por tarea, intercambio sin despliegue de código

El colapso del coste de inferencia cambia la pregunta de selección de modelo. Cuando la inferencia era cara, la pregunta era "¿qué modelo único podemos permitirnos?" Cuando la inferencia es barata, la pregunta se convierte en "¿qué modelo por tarea, y cómo intercambiar sin reescribir el agente?"

La respuesta es la construcción model-flexible: una arquitectura donde la selección de modelo es un registro de configuración, no un despliegue de código. El patrón tiene tres componentes:

  1. Una capa de routing que selecciona el modelo por tarea. La monitorización en segundo plano usa Luna a $0.20/$1.20. El borrador de cotizaciones usa Opus 5 a $5/$25. La búsqueda de productos usa Gemini 3.6 Flash a $1.50/$7.50. La decisión de routing se basa en complejidad de tarea, requisitos de latencia y coste por invocación — no en qué proveedor eligió primero el equipo. Los datos de producción de Vercel confirman que esto ya ocurre: 29% del volumen de tokens en modelos open-weight con menos del 4% del gasto.

  2. Módulos MCP que son model-agnostic. Las herramientas que el agente llama — consultar NetSuite por inventario, obtener un catálogo de proveedor, redactar una respuesta de cotización, consultar un grafo de conocimiento por compatibilidad — se definen una vez en la capa MCP. El modelo cambia; las herramientas no. Por eso el MCP Module Code Standard trata la estructura del módulo como la interfaz estable y la selección de modelo como una preocupación de tiempo de ejecución.

  3. Una capa de gobernanza que no depende de la fiabilidad del modelo. Los checkpoints human-in-the-loop, las trazas de auditoría y la arquitectura de kill-switch son model-independent. El patrón de gobernanza proporcional — igualar niveles de autonomía al riesgo — funciona igual si el agente corre en Luna u Opus 5. La tasa de fallo del 70–95% de Fiddler no es un problema de modelo; es un problema de sistema. La solución es observabilidad y gobernanza, no un modelo más caro.

Qué confirman los datos de financiación sobre el mercado

La financiación global de startups en H1 2026 alcanzó $510B, con OpenAI y Anthropic por sí solos representando $217B — 43% de toda la financiación de startups. Anthropic recaudó $65B a una valoración de $965B. Aproximadamente el 80% de la inversión de Q2 fue a startups centradas en IA. El capital fluye hacia la capa de modelo.

El análisis de mercado de CRV de 2026 confirma que la capa de aplicación está siendo "depurada" — los wrappers de IA sin profundidad de integración están perdiendo financiación. La implicación para equipos B2B es directa: los proveedores de modelos están financiados para abaratar la inferencia, y las empresas de capa de aplicación que sobreviven son las que resuelven el problema de integración, no las que envuelven un API de modelo. El posicionamiento de IdeaBosque — plataforma más soluciones, con propiedad de código opcional — se sitúa en el 90% de la estructura de coste que la capa de modelo no aborda.

Actualización — 2026-08-03: Precios de Claude Managed Agents — un nuevo eje de coste para la economía de inferencia

Anthropic lanzó Claude Managed Agents el 3 de agosto de 2026 — el primer modelo de precios de plataforma de agentes gestionados de un laboratorio frontera. Los precios añaden una nueva dimensión a la economía de inferencia: el coste de un agente gestionado no es solo tokens sino también el tiempo que ejecuta.

  1. $0.08 por sesión-hora, más tokens. La dimensión de sesión-runtime ($0.08/hora) es un nuevo eje de coste. Un agente gestionado que ejecuta 24/7 acumula ~$19.20/semana en tarifas de sesión antes de cualquier coste de tokens; uno que ejecuta 8 horas/día acumula ~$6.40/semana. La implicación para routing: los agentes de larga duración ahora se priced por duración, no solo por throughput de tokens, y el coste de sesión-hora puede dominar el coste de tokens para workloads de bajo volumen pero always-on (monitorización de inbox, vigilancia de cola).

  2. La estimación propia de Anthropic: $37 por 10.000 tickets de soporte a ~3.700 tokens por conversación. Este es el primer benchmark de coste B2B concreto para una plataforma de agentes gestionados. A $37/10.000 tickets, el coste por ticket del agente es $0.0037 — muy por debajo del coste por ticket de un agente de soporte humano. El benchmark es un punto de referencia para cualquier equipo que modele el coste de un agente de soporte always-on: la plataforma gestionada empaqueta el modelo, el runtime y la orquestación, y priced el bundle por sesión-hora más tokens.

  3. Precios de tokens (entrada/salida por MTok): Claude Opus 5 a $5/$25, Claude Sonnet 5 a $2/$10 (precios introductorios hasta el 31 de agosto de 2026), Claude Haiku 4.5 a $1/$5. La tarifa de sesión del agente gestionado es aditiva al coste de tokens. Para un workload de soporte a ~3.700 tokens/conversación, el coste de tokens en Sonnet 5 (introductorio) es ~$0.037/ticket en entrada + ~$0.037/ticket en salida (asumiendo split aproximadamente igual), y el coste de sesión-hora amortizado a lo largo de 10.000 tickets en una ventana de 8 horas es ~$0.0064/ticket. La propuesta de valor de la plataforma gestionada es que la orquestación, la gestión de estado y la infraestructura de tool-call están empaquetadas — los $0.08/hora es el precio de no construir esa capa uno mismo.

  4. Qué cambia en la decisión de routing. El argumento de construcción model-flexible obtiene una nueva opción: alquilar la plataforma gestionada (sesión-hora + tokens, sin trabajo de integración) vs. self-hostear el modelo en una capa de routing (solo tokens, trabajo de integración completo). El ratio de $10-de-integración-por-$1-de-gasto-de-modelo es el límite de decisión. Un equipo cuyo coste de integración exceda las tarifas de sesión-hora de la plataforma gestionada debería evaluar la ruta gestionada; un equipo cuya integración ya esté construida debería routear tokens al modelo capaz más barato y no pagar tarifa de sesión. La plataforma gestionada es el lado "buy" de la decisión build-vs-buy hecha concreta con una etiqueta de precio.

La tesis se refuerza: la economía de inferencia tiene ahora tres ejes de coste — tokens, sesión-horas e integración. El colapso de coste de tokens de 1.000× hizo los agentes always-on asequibles; los precios de sesión-hora del agente gestionado hacen la decisión build-vs-buy cuantificable. La restricción vinculante sigue siendo la capa de integración, y la plataforma gestionada es una respuesta a ella — a $0.08/hora, la plataforma cobra por exactamente el trabajo de orquestación que el ratio $10:$1 dice que es la parte cara.


Lectura relacionada

Actualización — 2026-08-05: NVIDIA Groq 3 LPU — la dimensión hardware del colapso de costos de inferencia

El colapso de costos de inferencia ahora ocurre en toda la pila de hardware, no solo en la pila de precios de modelos. El Groq 3 LPU de NVIDIA (anunciado en GTC 2026, junto con el sistema Vera Rubin NVL72) afirma 35× más rendimiento de inferencia por megavatio comparado con GPUs basadas en HBM — aproximadamente 150 tokens por vatio para tamaños de modelo comparables.

  1. 35× rendimiento de inferencia por megavatio. El Groq 3 LPU apunta a inferencia de IA agéntica a 1.500 tokens por segundo. Un rack completo entrega 315 PFLOPS, 128 GB de SRAM y 40 PB/s de ancho de banda de memoria.

  2. El colapso de costos es ahora una historia de dos pilas. Este artículo ha rastreado la dimensión de precios de modelos. El Groq 3 LPU añade la dimensión hardware — la misma carga de inferencia cuesta menos de ejecutar porque el chip entrega más tokens por vatio.

  3. Qué cambia en la decisión de enrutamiento. La capa de enrutamiento selecciona el modelo por tarea, y el hardware de inferencia determina el costo por token. Un equipo ejecutando Groq 3 LPUs puede servir un modelo a 35× menor costo energético.


Actualización — 2026-08-06: BenchLM agosto 2026 — Grok 4.5, Nemotron 3 Nano Omni, LFM2.5-2.6B

El leaderboard de BenchLM se actualizó el 5 de agosto de 2026, añadiendo tres puntos de datos listos para decisión a la sección de frontera de costos de este artículo:

  1. Grok 4.5 — 91% de calidad frontera a 88% menos costo de output. Grok 4.5 gana "best near-frontier value" en la actualización de BenchLM de agosto: 91% del puntaje máximo a 88% menos costo de output. La relación 91%/88% es el punto de datos de precio-rendimiento que rediseña las decisiones de despliegue — un modelo que entrega calidad cercana a la frontera a un costo cercano al open-weight. Para la construcción model-flexible, este es el sweet spot de routing: tareas que necesitan calidad de clase frontera pero no costo de clase frontera enrutan a Grok 4.5 en lugar de Opus 5. El espacio de decisión del routing layer opera entre Grok 4.5 (91% a 88% menos costo) y la frontera open-weight (DeepSeek V4-Flash 0731 en Intelligence Index 50, ~60% más barato que Luna).

  2. Nemotron 3 Nano Omni — más rápido a 323 tok/s, 30B total / 3B activo MoE. Nemotron 3 Nano Omni es el modelo más rápido en el leaderboard de BenchLM a 323 tokens por segundo. La arquitectura es un Mixture-of-Experts disperso (30B parámetros totales, 3B activos) — el mismo patrón de arquitectura (MoE disperso) que DeepSeek V4-Flash 0731 usa (284B total / 13B activo). La cifra de 323 tok/s es el colapso de costo a nivel de arquitectura que la actualización de NVIDIA Groq 3 de este artículo describe, pero en la capa del modelo: MoE disperso entrega calidad adyacente a la frontera a una fracción del costo de parámetros activos. La tesis de colapso-de-costo-por-arquitectura ahora está validada en dos capas — hardware (Groq 3 a 35× por megavatio) y arquitectura del modelo (MoE disperso a 3B parámetros activos entregando 323 tok/s).

  3. LFM2.5-2.6B — agentes on-device. LFM2.5-2.6B corre agentes enteramente on-device — la dimensión de despliegue edge del colapso de costo de inferencia. Un modelo de 2.6B parámetros que puede correr un loop de agente en un laptop o teléfono es el extremo de la frontera de costos: costo por token cero, latencia cero, egreso de datos cero. Para la decisión de routing, LFM2.5-2.6B es la opción para flujos de trabajo donde la residencia de datos o la latencia es la restricción vinculante, no el throughput.

El leaderboard BenchAlign de BenchLM muestra la brecha open-weight/frontera en ~17% (MiniMax M3 a 68.8 vs Claude Mythos 5 a 83.04) — más amplia que la brecha de ~11 puntos en el Intelligence Index. La sección de frontera de costos ahora tiene ocho puntos de datos: Luna a $0.20/$1.20, DeepSeek V4-Flash 0731 a $0.14/$0.28, Claude Managed Agents a $0.08/session-hour, Qwen3.8-Max a $2/$6, Grok 4.5 a 91%/88%-menos-costo, Nemotron 3 Nano Omni a 323 tok/s, LFM2.5-2.6B on-device, y NVIDIA Groq 3 LPU a 35× por megavatio.


Actualización — 2026-08-04: Precio de Qwen3.8-Max — la frontera de costo open-weight baja más

El precio de la API de Qwen3.8-Max se confirmó en $2 por 1M tokens de entrada y $6 por 1M tokens de salida, con caché implícita a $0.25/M (QwenCloud, OpenRouter, glbgpt.com, windowsforum.com, 4 de agosto de 2026). Esto subcotiza significativamente a Kimi K3 ($3/$15) — 33% más barato en entrada y 60% más barato en salida — y añade un nuevo dato a la sección de frontera de costo.

  1. $2/$6 por millón de tokens para un modelo de 2.4T parámetros (95B activo MoE). Qwen3.8-Max es la primera release open-weight a escala Max de cualquier laboratorio importante, y el precio lo hace el modelo a escala Max más barato en el mercado de APIs. La frontera de costo ahora tiene cuatro opciones open-weight en puntos de precio distintos: DeepSeek V4-Flash 0731 a $0.14/$0.28 (Intelligence Index 50, el modelo capaz más barato), Qwen3.8-Max a $2/$6 (escala Max, trabajo autónomo de horizonte largo), GLM-5.2 a $0.60/$2.20 (uso defensivo), y Kimi K3 a $3/$15 (capacidad bruta, 93.40% SWE-bench). La decisión de routing es ahora a través de cuatro niveles de precio, no entre open-weight y frontera cerrada.

  2. La ventaja de costo open-weight se acumula contra la frontera cerrada. Claude Opus 5 a $5/$25 es 2.5× más caro que Qwen3.8-Max en entrada y 4.2× en salida — para un modelo que lidera SWE-bench Verified al 97.00% vs el 93.40% de Kimi K3 (Qwen3.8-Max aún no ha sido evaluado por Artificial Analysis). La brecha de costo se está estrechando más rápido que la brecha de benchmark: la frontera open-weight está dentro de 3.6 puntos en SWE-bench mientras es 60-75% más barata. Para una construcción model-flexible, la capa de routing puede ahora seleccionar Qwen3.8-Max para trabajo autónomo de horizonte largo (10+ días de codificación autónoma, 125 horas de reproducción de investigación) a una fracción del costo frontera.

  3. Qué cambia en la decisión de routing. La sección de frontera de costo de este artículo ahora tiene cinco datos: Luna a $0.20/$1.20 (recortado 80% el 30 de julio), DeepSeek V4-Flash 0731 a $0.14/$0.28 (Intelligence Index 50, 31 de julio), Claude Managed Agents a $0.08/session-hour (3 de agosto), y Qwen3.8-Max a $2/$6 (4 de agosto). El patrón es consistente: cada release optimiza precio-rendimiento al mismo o mayor nivel de inteligencia. La frontera se abarata tanto arriba (Opus 5) como abajo (DeepSeek V4-Flash) simultáneamente, y las opciones open-weight añaden nuevos niveles de precio (Qwen3.8-Max a escala Max) que no existían hace una semana. Un equipo que presupuestó $50,000/mes para inferencia de agentes en enero 2026 puede ahora rutar a través de cinco modelos en cinco puntos de precio — el modelo capaz más barato por tarea es una decisión de configuración, no un proyecto de investigación.


Un distribuidor mid-market que opera NetSuite y BigCommerce procesa 200 RFQ por semana. Con precios Luna, un agente que monitoriza la bandeja de entrada, consulta tres catálogos de proveedores vía módulos MCP, verifica un grafo de conocimiento por piezas sustitutas y redacta respuestas de cotización cuesta menos de $50 por semana en inferencia. La misma carga con precios de enero 2026 habría costado más de $2.000. La pregunta del distribuidor ya no es si el agente es asequible — es si la capa de integración está construida. Los módulos MCP, el grafo de conocimiento, el checkpoint de aprobación humana para emisión de cotizaciones y la traza de auditoría para cada llamada a herramienta son el 90% de la construcción. Eso es lo que entrega un engagement con scope definido: la capa de integración y gobernanza que convierte un modelo barato en un agente de producción.

¿Quieres esto construido para tus sistemas?

Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.

Solicitar un proyecto

Descubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.