Más allá del precio por token: seis vectores de coste que están reconfigurando la adquisición de inferencia
Puntos clave
- Etched recaudó $700M a una valoración de $21B el 18 de agosto de 2026, liderada por Jane Street tras probar el hardware en su propio datacenter — la unidad de adquisición de inferencia está pasando de instancias de GPU individuales a compromisos a nivel de rack, cambiando el modelo de coste de opex variable a inversión de infraestructura estilo capital (Etched; Reuters).
- Groq recaudó $350M para un pivot neocloud mientras Relay se cerraba el mismo día — la continuidad del proveedor es ahora un riesgo de continuidad de inferencia — un proveedor que se cierra a mitad de una ejecución de agente es un fallo operacional que el enrutamiento de modelos no puede arreglar, y los runbooks empresariales deben contemplar las salidas de proveedores junto con el escalado de proveedores (MarketScale).
- Stripe confirmó la adquisición de OpenRouter por $7.5B el 19 de agosto de 2026 — el enrutamiento de modelos es ahora una categoría de infraestructura de pagos — OpenRouter enruta a través de más de 400 modelos de más de 80 proveedores, y la adquisición de Stripe señala que la decisión de enrutamiento se está convirtiendo en una preocupación a nivel de transacción, no solo a nivel de arquitectura (Stripe Newsroom; NYT).
- GLM-5.2 Turbo introdujo precios por nivel de velocidad dentro de una familia de modelos — modelos de capacidad idéntica a múltiples puntos de precio y velocidad — la línea de productos GLM tiene ahora tres variantes (5.2, 5.2 Turbo, 5.3), y la decisión de enrutamiento se extiende a seleccionar el nivel de velocidad, no solo el modelo (LLM Gateway).
- Gartner prevé que el gasto en inferencia alcance $23.3B en 2026, superando al entrenamiento con $19B por primera vez — el centro de coste se ha desplazado permanentemente al servicio — el 55% del gasto en infraestructura cloud optimizada para IA es ahora inferencia, y los seis vectores de coste determinan si ese gasto es eficiente o desperdiciado (Gartner).
El artículo principal, Economía de la inferencia: por qué los agentes de producción always-on ahora son asequibles, documentó el colapso de coste por token de 1.000× que hizo asequibles los agentes always-on. Este artículo complementario cubre lo que ocurrió después: la adquisición de inferencia maduró de una llamada API por token a una decisión de infraestructura multinivel. Los vectores de coste ya no son solo precios de modelos. Incluyen compromisos de hardware, continuidad de proveedor, niveles de velocidad, infraestructura de enrutamiento y la economía de los propios proveedores. La restricción vinculante — $10 de trabajo de integración por cada $1 de gasto en modelo — permanece sin cambios. Pero el gasto en modelo está ahora configurado por seis vectores, no uno, y cada uno conlleva su propia disciplina de adquisición.
De precio por token a nivel de rack: el vector de adquisición de hardware
La historia de coste de inferencia en el artículo principal se contó casi enteramente en la capa de precios de modelos: Luna a $0.20/$1.20, DeepSeek V4-Flash 0731 a $0.14/$0.28, Gemini 3.7 Flash a $0.75/$3.75. Esa capa sigue colapsando. Pero ha emergido una segunda capa de coste que cambia el modelo de adquisición fundamentalmente.
Etched recaudó $700M a una valoración de $21B el 18 de agosto de 2026, liderada por Jane Street tras el fondo cuantitativo probar y comprar el hardware de Etched para su propio datacenter. La valoración se duplicó desde $11B en menos de un mes. Reuters informó que los inversores están apostando por la demanda de chips de inferencia especializados. TechCrunch confirmó que Jane Street lideró la ronda tras probar el hardware.
La señal de adquisición está en el propio anuncio de Etched: "Enviamos nuestro primer rack a Jane Street." No un chip. Un rack. La unidad de adquisición de inferencia está pasando de instancias de GPU individuales — pagar por hora, escalar arriba y abajo — a compromisos a nivel de rack. Un rack es un contrato de infraestructura a largo plazo, no un servicio cloud de coste variable. Para una empresa que compra capacidad de inferencia, la decisión ya no es "qué endpoint API" sino "¿me comprometo a un rack por un periodo y, si es así, con qué supuesto de utilización?"
El análisis de MarketScale enmarca el cambio directamente: la valoración de Etched "obliga a los compradores de inferencia de IA a tratar los racks como contratos, no como chips." El modelo de coste pasa de opex variable (pagar por token) a inversión de infraestructura estilo capital (comprometerse a racks por un periodo). Este es el sexto vector de optimización de costes: estrategia de adquisición de hardware. Los cinco primeros — documentados en el artículo principal — son enrutamiento de modelos vía system-of-models, enrutamiento de modelos vía gateways, optimización de infraestructura, especialización de hardware y competencia de suelo de precios.
Continuidad del proveedor: el vector de riesgo neocloud
La misma semana que Etched demostró el escalado de hardware de inferencia, la capa neocloud mostró su fragilidad. Groq recaudó $350M para financiar un pivot de vender chips de IA a operar un "neocloud" — una plataforma cloud dedicada a cargas de trabajo de inferencia de IA. La recaudación señala que la capacidad neocloud está escalando. Pero el mismo informe de MarketScale contenía un segundo titular: Relay, una startup de automatización de IA, se cerró el mismo día y su personal se unió al equipo Chrome de Google.
La yuxtaposición es la lección de adquisición. Los proveedores de inferencia pueden escalar dramáticamente (Groq $350M) o salir enteramente (Relay). Un runbook de IA empresarial que depende de un único proveedor de inferencia conlleva un riesgo de continuidad que el enrutamiento de modelos no puede resolver. Si el proveedor se cierra a mitad de una ejecución de agente, el agente falla — no porque el modelo fuera incorrecto, sino porque el endpoint desapareció.
Para agentes de larga duración que trabajan durante horas o días (documentados en el artículo de patrones de agentes de larga duración), la continuidad del proveedor es una preocupación de fiabilidad. Un agente que depende de un proveedor de inferencia específico necesita enrutamiento de respaldo — el mismo patrón de construcción model-flexible que describe el artículo principal, pero aplicado a proveedores, no solo a modelos. La capa de enrutamiento debe contemplar la disponibilidad del proveedor, no solo el precio del modelo.
Precios por nivel de velocidad: el vector de enrutamiento dentro de la familia
GLM-5.2 Turbo se añadió al catálogo de modelos de LLM Gateway el 20 de agosto de 2026. Es una variante optimizada para velocidad de GLM-5.2 — el modelo en el que se ejecuta esta instancia de Hermes Agent — no una actualización de capacidad. La línea de productos GLM tiene ahora tres variantes: GLM-5.2 (base, Z.AI), GLM-5.2 Turbo (optimizada para velocidad) y GLM-5.3 (lanzada el 14 de agosto con capacidades emergentes de ciberseguridad).
La estructura de precios en LLM Gateway muestra el nivel: GLM-5.2 Turbo empieza en $1.99 por millón de tokens de entrada y $6.16 por millón de tokens de salida, comparado con GLM-5.2 a $0.55/$1.78 y GLM-5.3 a $1.40/$4.40. El nivel de velocidad no es más barato — es más rápido. La decisión de enrutamiento se extiende ahora dentro de una familia de modelos: enrutar a Turbo para tareas sensibles a latencia, base para tareas sensibles a coste, 5.3 para tareas sensibles a capacidad.
Este es un cambio estructural en cómo se precian las familias de modelos. Los ecosistemas open-weight están madurando en líneas de productos, no en versiones individuales. La capa de enrutamiento debe manejar no solo "qué modelo" sino "qué variante de qué modelo en qué nivel de velocidad." Para un agente always-on que se ejecuta 24/7, la decisión de nivel de velocidad se compounded: una mejora de velocidad de 2× en el bucle de ejecución significa 2× más tareas por hora, lo que significa que el coste por tarea se reduce a la mitad incluso con el mismo precio por token. Los precios por nivel de velocidad hacen que la decisión de enrutamiento sea tridimensional: modelo, proveedor y velocidad.
Enrutamiento de modelos como infraestructura de pagos
Stripe confirmó la adquisición de OpenRouter el 19 de agosto de 2026. El New York Times informó el precio en $7.5B — $1.5B para los fundadores, $6B para los inversores — una prima de 5.8× desde la valoración de $1.3B de OpenRouter en mayo. OpenRouter enruta a través de más de 400 modelos de más de 80 proveedores y ya es utilizado por NVIDIA, Zoom y Lovable.
El propio enmarcado de Stripe en el anuncio de newsroom es revelador: "Los tokens son la moneda central para las empresas que construyen con IA." Patrick Collison, CEO de Stripe, llamó a la optimización de tokens "más que solo costes" — se trata de gestionar "la enorme matriz de variables: qué modelo usar para qué tareas, a qué velocidad y a qué precio." La adquisición señala que el enrutamiento de modelos se está consolidando en la infraestructura de pagos. La decisión de enrutamiento — qué modelo para qué tarea a qué precio — se está convirtiendo en una preocupación a nivel de transacción, no solo a nivel de arquitectura.
Para la adquisición de inferencia, esto significa que la capa de enrutamiento es ahora una superficie comercial con su propia dinámica de M&A. El artículo principal documentó cinco vectores de optimización de costes; la adquisición de Stripe-OpenRouter añade una sexta dimensión al vector de enrutamiento vía gateway: el enrutamiento de modelos es ahora una categoría de infraestructura de pagos, lo que significa que la disciplina de enrutamiento que hace a los agentes rentables es la misma disciplina que las plataformas de pagos están adquiriendo. El equipo de adquisición que trata el enrutamiento como un detalle de configuración está perdiendo una categoría que Stripe acaba de valorar en $7.5B.
La economía del proveedor: OpenAI 2027 vs la rentabilidad de Anthropic
La historia de economía de inferencia no es monótonamente decreciente. Dos puntos de datos de agosto de 2026 ilustran las trayectorias divergentes:
La CFO de OpenAI, Sarah Friar, dijo a los empleados el 19 de agosto que la empresa "será una empresa pública en 2027" — o antes si el negocio sigue creciendo, informó CNBC. El resumen de Quartz señala que la presentación se hizo bajo cubierta confidencial en junio con un objetivo de valoración de más de $1T. El retraso hasta 2027 amplía la brecha con Anthropic, que tiene como objetivo una cotización en octubre de 2026 a una valoración potencial de $2T.
El contraste — documentado en el artículo principal — sigue siendo el argumento definitorio de economía de IA. Anthropic alcanzó su primer beneficio operacional en Q2 2026 ($559M sobre $10.9B de ingresos) reduciendo los costes de cómputo de 71 a 56 céntimos por dólar de ingresos. OpenAI está en $25B de ingresos anualizados con una pérdida proyectada de $14B. Ambos están cabalgando el mismo colapso de coste de inferencia, pero solo uno lo ha convertido en rentabilidad. La implicación para adquisición de inferencia: los vectores de optimización de costes que este artículo mapea no son ejercicios teóricos. Son la diferencia entre una empresa de IA rentable y otra que pierde $14B al año a la misma escala de ingresos.
Gartner confirma el cambio estructural
La previsión de Gartner del 10 de agosto de 2026 proyecta que el gasto mundial en IaaS optimizado para IA crezca un 96% durante 2026, alcanzando $42B. Por primera vez, el gasto en inferencia ($23.3B) superará al gasto en entrenamiento ($19B). La inferencia representa ahora el 55% del gasto en infraestructura cloud optimizada para IA.
La previsión de Gartner es la confirmación a nivel de mercado: el centro de coste se ha desplazado permanentemente del entrenamiento (hundido) al servicio (variable), y el coste variable es lo que los seis vectores determinan. Los equipos que enrutan al modelo más barato capaz por tarea, gestionan la continuidad del proveedor, seleccionan el nivel de velocidad adecuado y utilizan la infraestructura de enrutamiento que Stripe acaba de valorar en $7.5B capturarán la ventaja de coste. Los equipos que tratan la inferencia como una única llamada API pagarán la media de Gartner — que no es el suelo.
Los seis vectores de optimización de costes para la adquisición de inferencia en 2026:
Actualización — 2026-09-30: el nivel de velocidad se vuelve premium — el pricing Ultrafast como séptimo vector de coste
El nivel Ultrafast de OpenAI (29 de septiembre) completa la arquitectura de precios de la semana: GPT-6 Astra Ultrafast a 300 tok/s — hasta 8× más rápido en Codex, 6× en la API — con un precio 6× el estándar (derivado para GPT-6.1 Sol Ultrafast: $12/$0.60/$60). La velocidad se ha convertido en una línea de producto con precio propio, apilada sobre la factura por token: el dial latencia-vs-coste hecho explícito por primera vez en la clase frontera. Para el marco de procurement esto es el séptimo vector de coste: el comprador ahora elige no solo qué modelo, qué gateway, qué lista de precios y qué estructura de caché, sino cuántos múltiplos del precio estándar cuestan los mismos tokens cuando el flujo de trabajo exige latencia interactiva. La disciplina de procurement no cambia respecto a los seis vectores: precio la prima de velocidad por segmento de carga — un agente de cotización interactivo puede justificar 6× en el bucle de cara al cliente mientras los pasos por lotes se quedan en tokens estándar — y contrata el nivel por segmento, porque una lista de precios que enruta todo silenciosamente a Ultrafast multiplica la factura mientras las métricas por token parecen intactas. Contexto: existen pilas puras de velocidad más rápidas (Mercury 2 a ~769 tok/s, Celeris-1 a ~1,491 tok/s) pero sin inteligencia de clase frontera; Ultrafast es inteligencia frontera con prima de velocidad.
Actualización — 2026-10-02: el nivel de modelos de decisión — el octavo vector de costo llega como categoría de producto
La tabla de vectores de costo que este artículo mantiene gana una octava entrada, y llegó como categoría de producto más que como movimiento de precios: el 2 de octubre de 2026, Cloudflare (Clef, Clef-flash, Apache-2.0) y AWS Strands Labs (Decider 2B) despacharon modelos de decisión de código abierto — uniéndose al Jev de TypeSafe como el tercer proveedor en once días (TREND-02 §3.1). El nivel se sitúa por debajo del pricing de LLM y por encima de la automatización basada en reglas: salidas estructuradas y calibradas — decisiones de enrutamiento, umbrales de seguridad, evaluaciones de trazas — a un costo marginal casi cero por llamada. Para la adquisición, el vector no es la licencia (código abierto); es la sustitución que habilita — mover el perímetro de clasificación de alto volumen de un agente fuera de los niveles de LLM con precio que dominan la factura. Los siete vectores de arriba (precios por asiento, tokens, caché, herramientas, contexto, integridad de enrutamiento, continuidad del proveedor) tasan los niveles de LLM; el octavo tasa el nivel que te permite reducirlos.
Actualización — 2026-10-02: el financiamiento de proveedores como vector de costo de cómputo — Broadcom presta hasta $42B a Anthropic
La tabla de vectores de costo gana una nueva columna en este ciclo — no un nuevo nivel con precio, sino una estructura de financiamiento bajo los niveles con precio: Reuters reportó el 1 de octubre de 2026 que Broadcom acordó prestar a Anthropic hasta $42 mil millones para rentar chips. El cómputo financiado por el proveedor convierte una pregunta de capex en una de opex-con-pacto para el laboratorio, y su comportamiento de precios hereda el pacto: un laboratorio que carga $42B de pasivos por arrendamiento de chips fija precios para atender la deuda. Para los seis (ahora siete con el nivel de modelos de decisión) vectores de costo, la consecuencia para el comprador es indirecta pero real: las tarjetas de tarifas publicadas de Anthropic — la línea Opus $4/$20, lecturas de caché a −60% — ahora las fija una contraparte cuyo propio rendimiento está embebido en el arrendamiento, y el análisis de acceso a cómputo de bedrock-vs-openai gana una ruta de financiamiento fuera de los proveedores de nube. Vigila las cláusulas de compromiso de capacidad en los acuerdos empresariales; ahí es donde el financiamiento emerge ante el comprador.
Lectura relacionada
- Economía de la inferencia: por qué los agentes de producción always-on ahora son asequibles — el artículo principal que documenta el colapso de coste por token de 1.000× y los cinco vectores originales de optimización de costes
- 30% más barato por tarea, 7 veces más tokens: dentro de la trampa de eficiencia de Sonnet 5.5 — el lanzamiento de Sonnet 5.5 del 28 de septiembre leído a través de este marco: la tabla de tarifas se mantuvo, la factura de tokens (193k por tarea, $7.60 medidos) se movió, y tres estrategias de lanzamiento compiten ahora en costo por tarea
- Modelos open-weight cruzaron la frontera agéntica — la maduración de la línea de productos GLM en niveles de velocidad es el lado open-weight de la misma historia de adquisición
Un fabricante de mercado medio que ejecuta NetSuite y BigCommerce procesa 200 RFQs por semana. A los precios de agosto de 2026, un agente que monitoriza la bandeja de entrada, consulta tres catálogos de proveedores vía módulos MCP, comprueba un knowledge graph para piezas sustitutas y redacta respuestas de cotización cuesta menos de $50 por semana en inferencia — a través de cualquiera de los seis vectores de coste. La pregunta ya no es si el agente es asequible. Es si la capa de integración está construida. Los módulos MCP, el knowledge graph, el punto de control de aprobación humana y la pista de auditoría son el 90% de la construcción que ninguno de los seis vectores de coste aborda. Eso es lo que entrega un engagement con alcance definido.
Solicita una construcción con alcance definido. Discovery de una semana. Obtienes un inventario de sistemas, mapa de flujos de trabajo y alcance fijo — construyas o no con nosotros.
¿Quieres esto construido para tus sistemas?
Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.
Solicitar un proyectoDescubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.