← Todos los escritos

27 de septiembre de 2026 · por Geoff

Economía de tokens: el techo se mantiene alto, la audiencia se encoge y el piso se va a cero

El precio de una capacidad fija cae 13 veces al año mientras el precio del modelo frontera más nuevo subió 5 veces en doce meses. No es una contradicción. Es la forma del mercado, y dice quién termina siendo dueño de la frontera.

versión para máquinas (en inglés): /machine/blog/token-economics.md

Traducción al español; el original en inglés es la versión canónica.

Este es el argumento detrás del Informe de economía de tokens, una página de gráficas y un conjunto de datos que se actualiza cada semana. El ensayo cambia poco; los números cambian seguido. Cada cifra de aquí está en el informe con su fuente.

Dos precios para el mismo token

Hay dos series de precios para los modelos de lenguaje y se mueven en direcciones opuestas.

La primera es el precio de un nivel fijo de capacidad. Lo que GPT-4 podía hacer en marzo de 2023 costaba $37.50 por millón de tokens. En febrero de 2025 ese mismo nivel de capacidad costaba $0.18. En septiembre de 2026 el modelo más barato que pasa la barra cuesta como diez centavos. Epoch AI, que mide esto en cinco benchmarks, pone la caída en 47 % por trimestre, unas 13 veces al año, más rápido que el cómputo, más rápido que la secuenciación de ADN, más rápido de lo que jamás fueron las baterías. Un 75 % en GPQA Diamond costaba treinta centavos por pregunta con o3 y cuatro diezmilésimas de centavo dieciocho meses después. Alcanzar el puntaje de o3 en ARC-AGI-1 costaba $4,560 por tarea en diciembre de 2024 y treinta centavos en agosto de 2026.

La segunda serie es el precio del modelo frontera más nuevo, y tiene forma de U. El nivel tope de OpenAI cayó de $60 por millón de tokens de salida a un piso de $10 con GPT-5 en agosto de 2025. Después subió en cada lanzamiento: $14, $15, $30, $30 y $50 con GPT-6 Astra en septiembre de 2026, con un modo rápido a $100. Anthropic bajó Opus a la tercera parte y luego puso Fable y Mythos por encima, a $50. Google relanzó el nombre Flash a entre 25 y 30 veces su precio de 2024. DeepSeek, el laboratorio que empezó la guerra de precios de 2025, subió su nivel Pro hasta 1,100 %. Todos los proveedores que venden una frontera volvieron a poner un nivel por encima de su tope anterior en menos de doce meses.

Ninguna de las dos series miente. El costo de servir un token es bajo y va cayendo: las estimaciones de abajo hacia arriba ponen el costo marginal cerca de $3 por millón de tokens de salida en H100 alquiladas, contra $15 a $50 de lista; SemiAnalysis pone el margen de inferencia de Anthropic por encima del 70 % en la era Blackwell; y el TPU v7 de Google sirve un modelo de 400 mil millones de parámetros por dieciocho centavos el millón, todo incluido. El techo que sube es una decisión de precios tomada en escasez. La demanda de inferencia crece unas 10 veces al año contra una oferta de cómputo que crece unas 3.4 veces, y cuando la capacidad escasea y tus mejores clientes son insensibles al precio, le pones al modelo más nuevo el precio que el 1 % de arriba está dispuesto a pagar y dejas que la capacidad del año pasado caiga hasta el costo. Eso es exactamente lo que muestran las gráficas.

La audiencia del tope se encoge a medida que mejora

Esta es la afirmación que más me importa, porque es adonde se va la plata después. A medida que los modelos mejoran, la audiencia del nivel más alto se hace más pequeña, no más grande, y el techo se mantiene alto de todas formas.

Los datos de adopción ya lo dicen. Un mes después de su lanzamiento, Claude Fable 5 era el 6 % de los tokens de Anthropic y el 11 % del gasto en Anthropic en los datos de tarjetas de Ramp, mientras el modelo insignia se llevaba el volumen. GPT-6 Astra está detrás de un plan de $200 al mes y OpenAI pausó los registros nuevos por la demanda. El 1 % de los clientes genera el 80 % de los ingresos tanto en OpenAI como en Anthropic. La elasticidad de precio en OpenRouter es casi cero: un recorte del 10 % compra un 0.5 % más de uso. Esas son las huellas de un producto especializado con un comprador estrecho y de bolsillo profundo, no de un producto masivo.

¿Por qué pagan esos compradores? Por lo que hacen con él. Los propios datos de Anthropic muestran que Claude Code, que corre sesiones agénticas largas, usa Opus el 54 % de las veces, mientras que el chat lo usa el 10 %. Los practicantes tienen una regla: un ciclo autónomo sube el modelo un nivel, un humano en el ciclo lo baja un nivel. La aritmética no perdona. Un paso que sale bien el 90 % de las veces es confiable al 57 % en ocho pasos. Un 90 % de punta a punta en un flujo de diez pasos necesita 99 % por paso. Cuando nadie está mirando, los puntos extra del tope son el producto entero.

Ese es el umbral. Hoy, las empresas usan el nivel tope por defecto para cualquier cosa sin supervisión porque ningún modelo más barato es confiable para correr mucho tiempo sin que alguien revise. El trabajo de horizonte temporal de METR, la mejor medición que tenemos, pone el horizonte de 50 % de éxito de la frontera en alrededor de un día laboral a comienzos de 2026, duplicándose más o menos cada cuatro meses. Pero 50 % no es un colega. La propia nota de METR dice que las tareas críticas en confiabilidad necesitan 98 % o más para valer la pena automatizarlas, los horizontes al 80 % son unas cinco veces más cortos, y nada por encima de dieciséis horas es medible en la suite actual. El hito del "pasante de investigación" de OpenAI en septiembre de 2026 necesitó intervención humana en más de la mitad de sus tareas exitosas de cuatro a ocho horas.

Así que el umbral no lo ha cruzado nadie, a ningún precio. En el momento en que se cruce, la imagen se voltea. Cuando un modelo de nivel medio pueda correr durante meses como un verdadero doble digital de un empleado, el default deja de ser "compra el mejor" y pasa a ser "compra lo más barato que pase la barra". Los datos de Epoch dicen que el rezago entre que una capacidad debuta en la frontera y que cuesta 10 veces menos es de cuatro a once meses. Cuando "suficientemente confiable para dejarlo solo" sea una capacidad como cualquier otra, seguirá la misma curva. La frontera conservará su precio moviendo el blanco: horizontes más largos, evaluaciones más duras, tokens de razonamiento cobrados por miles, suscripciones de $200 y $300 que venden resultados en vez de tokens. Su audiencia será la gente cuyos problemas de verdad la necesitan, y cada trimestre hay menos, no más.

Dos complicaciones honestas. Los compradores empresariales también citan escasez de talento y seguridad de datos, no solo confiabilidad, cuando eligen modelos cerrados, y las encuestas atribuyen la mayoría de las fallas de agentes a integración e infraestructura antes que al razonamiento del modelo. Y la sustitución ya está pasando a nivel de solicitud, por enrutadores más que por confianza: el router de Cursor reporta resultados de calidad frontera a un 60 % menos de costo enviando solo los turnos difíciles al modelo caro. La frontera pierde la mayoría de las solicitudes y conserva la mayoría del gasto, por ahora.

El piso se va a cero, pero no como esperaba Occidente

El fondo del mercado ya está al costo del hardware. El propio gpt-oss-120b de pesos abiertos de OpenAI lo alojan dos docenas de proveedores desde $0.03 por millón de tokens de entrada; una docena cobra un idéntico $0.15/$0.60, que es como se ve un commodity. Los diez modelos con más volumen semanal en OpenRouter listan la entrada a $0.84 o menos. Una GPU de gamer que ya tienes sirve tokens en lote a entre 28 y 40 centavos por millón a plena utilización y le gana a una API de $1.70 por encima de más o menos 15 % de utilización; la calculadora de la página del informe te deja meter tus propios números. Gemma 4 corre en una Raspberry Pi. Gemini Nano corre en un teléfono a 19 tokens por segundo. El modelo en dispositivo de Apple activa entre mil y cuatro mil millones de parámetros y hace resúmenes, clasificación y llamadas a herramientas sin salir del dispositivo.

La especialización empuja el piso todavía más abajo. Modelos afinados de menos de ocho mil millones de parámetros le ganaron a GPT-4 en la mayoría de 31 tareas específicas en el estudio LoRA Land, cada uno en una sola GPU de consumo. Los investigadores de NVIDIA sostienen que los modelos pequeños son el default correcto para la mayoría de las subtareas de agentes a una décima o una treintava parte del costo. Productos como Jev, de TypeSafe AI, un modelo de decisión no generativo que responde preguntas de clasificación, enrutamiento y filtrado con salidas tipadas, toman otra ruta al mismo lugar: sacar del modelo general las operaciones bien entendidas, perfeccionarlas y dejar de pagar precios frontera por ellas. Las afirmaciones de costo son del vendedor y un probador temprano lo encontró más caro que Gemini, así que tómalo como una dirección más que como un resultado. La dirección es la correcta.

Lo que no esperaba es quién puso el piso. La participación del código abierto en las empresas cayó del 19 % al 11 % entre 2024 y 2025, Meta lanzó su primer modelo cerrado en abril de 2026, y la verdadera frontera abierta, DeepSeek, Qwen, Kimi, GLM, es china y va unos cuatro meses detrás de la frontera cerrada. El fondo se cayó, y los laboratorios que lo tumbaron están en Hangzhou y Pekín. Eso importa para la última parte.

La frontera se nacionaliza, en silencio

La predicción obvia es que el Estado se toma los laboratorios frontera. Creo que está equivocada en la forma y acertada en el fondo, y los datos muestran la forma que toma en realidad.

Primero viene el muro de capital. Cuatro hyperscalers gastaron unos $141 mil millones en capex en 2023, $360 mil millones en 2025, y tienen guía de $725 a $800 mil millones para 2026 incluyendo a Oracle. Alphabet registró su primer trimestre de flujo de caja libre negativo y levantó $85 mil millones en acciones. OpenAI levantó $122 mil millones a $852 mil millones de valoración; Anthropic $65 mil millones a $965 mil millones; los dos explícitamente para cómputo. Se proyectaba que una sola corrida de entrenamiento frontera cruzara los $1,000 millones en 2027, y ese es el número chiquito. Nadie entra a este mercado con capital de riesgo. Todos los retadores de la cosecha de 2022 fueron absorbidos por un acuerdo de licencia y contratación, Inflection, Adept, Character, Windsurf, o pivotaron, y los entrantes nuevos existen como satélites de Nvidia, SpaceX o los incumbentes. Antimonopolio lo revisó todo y lo aprobó todo.

Segundo viene la propiedad, y no es el Estado. Los fondos soberanos están en todas las tablas de accionistas: SoftBank con el 13 % de OpenAI, con MGX, Amazon y Nvidia detrás; GIC, Temasek y MGX en Anthropic; los fondos catarí, saudí y omaní en xAI; el fondo de la Comisión Europea y Bpifrance en Mistral. La capa de infraestructura es un solo vehículo de $100 mil millones que amarra a BlackRock, Microsoft, MGX, Nvidia y xAI. Del lado público, los gestores de índices tienen entre el 8 y el 20 % de cada gran empresa de IA, aunque los fundadores conservan el control por acciones de doble clase. Busqué vínculos documentados entre los gestores de activos y las agencias de inteligencia y no encontré ninguno; lo documentado es más directo que eso.

Porque el tercer canal es la contratación pública y la coerción, y es donde el Estado de verdad muestra la mano. En 2025 el Pentágono puso a cuatro laboratorios en contratos de prototipo de $200 millones y la GSA metió ChatGPT y Claude en las agencias federales por un dólar cada uno. Cuando Anthropic insistió en dos límites, nada de armas totalmente autónomas y nada de vigilancia masiva doméstica, el gobierno ordenó a todas las agencias dejar de usarlo y lo designó riesgo en la cadena de suministro, sacando a un laboratorio valorado cerca de un billón de dólares del mercado de contratistas de defensa. Un tribunal de distrito lo llamó represalia ilegal; la corte de apelaciones sostuvo la designación en septiembre de 2026. La plantilla de participación accionaria también existe: 9.9 % de Intel, un 15 % de los ingresos de Nvidia en China, una acción de oro en US Steel, y una propuesta reportada de la propia OpenAI de entregar el 5 % a un fondo de riqueza pública como seguro político. El Estado no necesita ser dueño de un laboratorio para controlarlo, y los laboratorios lo saben.

La regulación es el cuarto canal, y el más pequeño, salvo en Europa. Las reglas de la UE para modelos de propósito general presumen riesgo sistémico por encima de un umbral de cómputo que solo cruza un puñado de empresas, y ponen las obligaciones sobre esas empresas. Mistral hizo lobby para suavizar las reglas, firmó el código de prácticas cuando llegó, se sumó a los llamados a pausar la ley, recibió plata pública en sus dos últimas rondas, tiene contratos militares franceses y luxemburgueses, y según la mayoría de las cuentas va un año o más detrás de la frontera. Así se ve una escalera regulatoria recogida detrás de un campeón. En Estados Unidos, la regulación del desarrollo de modelos va cayendo, no subiendo.

Junta los cuatro y la frontera de 2030 no es una industria nacionalizada. Es un puñado de empresas que no pueden existir sin capital de hyperscalers, plata soberana y contratación pública, que pierden a su cliente más grande si ponen condiciones sobre cómo se usan, y que están detrás de un muro de capital que ningún recién llegado puede escalar. La gobernanza llegará como condición de la plata, no como una ley. La puerta se cerrará sin que nadie anuncie que se cerró.

Qué vigilar

Tres números en la página del informe dirán cuándo gira la historia. El horizonte al 80 % de éxito: cuando llegue a una semana de trabajo, el argumento del umbral se vuelve un cronograma, y el nivel medio pasa la misma barra en menos de un año. El rezago entre el debut en la frontera y un equivalente 10 veces más barato: hoy de cuatro a once meses, y si se acorta, la ventana de prima de la frontera se cierra con él. Y la primera participación accionaria de un gobierno en un laboratorio frontera, que convertiría "enredado" en "propiedad".

Los tokens van a seguir abaratándose. La pregunta nunca fue si. Es quién puede vender los que todavía cuestan plata.