La discusión sobre una posible burbuja de inteligencia artificial suele plantearse de una forma demasiado simple: o la IA transforma la economía y las valoraciones actuales están justificadas, o la tecnología está sobrevalorada y todo terminará desinflándose.
Hay una tercera posibilidad, y probablemente sea la más interesante:
la IA puede ser extraordinariamente útil y, al mismo tiempo, existir una burbuja financiera alrededor de su infraestructura y de las expectativas sobre sus márgenes.
Ese es el punto que hace interesante el argumento de un video reciente, The AI Bubble Is Cracking…, que cuestiona la economía detrás de los productos de IA. La tesis más provocadora puede resumirse así: la parte que realmente entrega valor al usuario —la inferencia— puede terminar siendo demasiado cara cuando se intenta escalar.
La afirmación merece matices. El precio de la inferencia ha caído de forma espectacular. Pero al mismo tiempo estamos construyendo sistemas que consumen mucha más inferencia que antes.
Ese aparente contrasentido es el centro del problema.
Entrenar el modelo no es lo mismo que usarlo
Cuando hablamos del costo de la IA conviene separar dos fases.
Entrenamiento es el proceso de construir el modelo. Puede requerir enormes clusters de GPUs, semanas o meses de cómputo y una inversión inicial gigantesca.
Inferencia es lo que ocurre después: cada vez que alguien escribe una pregunta, genera una imagen, ejecuta un agente, analiza un documento o pide al modelo que llame una herramienta.
El entrenamiento se parece a construir una fábrica. La inferencia se parece a producir cada unidad que sale de ella.
Para un producto de software tradicional, atender un usuario adicional puede tener un costo marginal muy pequeño. En un producto basado en modelos generativos, cada interacción puede generar nuevos costos variables: tokens de entrada, tokens de salida, uso de GPU, búsquedas, almacenamiento de contexto, llamadas a herramientas y, en algunos casos, nuevos ciclos de razonamiento.
Eso convierte la inferencia en una parte importante del COGS, el costo directo de entregar el servicio.
Y con los agentes, el problema se vuelve más interesante.
El chatbot hacía una llamada; el agente puede hacer veinte
Un chatbot sencillo puede seguir un flujo parecido a este:
usuario
↓
modelo
↓
respuesta
Un agente puede parecerse más a esto:
usuario
↓
planificación
↓
búsqueda
↓
modelo
↓
herramienta
↓
modelo
↓
otra herramienta
↓
verificación
↓
corrección
↓
respuesta
Y eso es la versión limpia.
En producción aparecen reintentos, contextos largos, resultados de herramientas que se vuelven a introducir en el prompt, validaciones, llamadas paralelas, modelos especializados y, a veces, revisión humana.
Por eso precio por token y costo por tarea completada no son la misma métrica.
Gartner lo describe como el Inference Paradox: aunque la economía por token mejore, la complejidad de las aplicaciones puede crecer todavía más rápido. La firma proyectó en agosto de 2026 que el costo de inferencia por workflow agentic podría aumentar más de cinco veces hasta 2028, precisamente porque los sistemas utilizarán más tokens, más modelos y procesos más sofisticados.
Fuente: Gartner — AI inference costs per agentic workflow
La paradoja se puede expresar así:
costo por token ↓↓↓
pero
tokens por tarea ↑
llamadas por tarea ↑
contexto por tarea ↑
reintentos ↑
verificación ↑
resultado posible:
costo total por tarea ↑
No hay contradicción. Estamos haciendo que cada unidad de inteligencia sea más barata y, al mismo tiempo, consumiendo muchas más unidades de inteligencia.
La métrica que importa no es el token
Durante los primeros años de la IA generativa era natural comparar proveedores por el precio de un millón de tokens.
Para sistemas agentic esa métrica empieza a parecerse al precio del kilovatio-hora cuando lo que realmente queremos saber es cuánto cuesta fabricar un automóvil.
La métrica más útil es algo parecido a:
costo por resultado exitoso =
(modelos + herramientas + retrieval + retries + validación + revisión)
/
tareas completadas correctamente
Dos agentes pueden utilizar el mismo modelo y tener economías completamente distintas.
Uno puede resolver una tarea en tres llamadas.
Otro puede entrar en un loop, releer 100.000 tokens de contexto, ejecutar herramientas innecesarias y necesitar revisión humana.
El precio por token es idéntico. El producto no.
Un trabajo académico publicado en agosto de 2026 intentó precisamente medir la evolución del precio de la “inteligencia” ajustando por calidad. Encontró una fuerte caída del precio de la inferencia cuando se ajusta por capacidad, pero también un resultado especialmente relevante: medido por tarea completada, el precio para el comprador dejó de caer, porque los modelos de razonamiento aumentaron el consumo de tokens más rápido de lo que descendieron los precios unitarios.
Fuente: The Price of Intelligence: A Quality-Adjusted Price Index for AI Services
Ese resultado no demuestra que la IA sea económicamente inviable. Sí demuestra por qué observar únicamente la tabla de precios de una API puede producir una imagen engañosa.
Las empresas ya están descubriendo el problema
McKinsey publicó en julio de 2026 una encuesta de AI FinOps en la que 93% de los participantes cualificados afirmó haber excedido sus presupuestos de IA. La muestra era relativamente pequeña —75 respuestas cualificadas—, por lo que no debe interpretarse como una medición universal del mercado, pero sí como una señal del tipo de problema que están encontrando las empresas.
En el mismo análisis, McKinsey señaló que aproximadamente una quinta parte de los encuestados en otro estudio global había limitado el uso de IA debido a sus costos operativos.
Fuente: McKinsey — Is that AI agent worth it?
Un segundo análisis de McKinsey publicado en agosto pone números a la diferencia entre modelos. A comienzos de julio de 2026, según los precios utilizados por la firma, un modelo frontier podía costar varias decenas de veces más que una alternativa ligera en tokens de salida.
Su conclusión práctica es sencilla: usar siempre el modelo más capaz es una decisión arquitectónica muy cara.
Fuente: McKinsey — Where AI agents pay off
Aquí aparece uno de los grandes cambios respecto al SaaS clásico.
En una aplicación tradicional, una nueva feature puede aumentar el costo de desarrollo, pero una vez desplegada puede atender millones de solicitudes con un costo marginal extremadamente bajo.
En una aplicación AI-native, una feature más potente puede incrementar permanentemente el costo de servir cada solicitud.
La inteligencia se convierte en un recurso que el producto consume.
Entonces, ¿por qué bajan tanto los precios?
Porque también existe un argumento muy fuerte contra la visión más pesimista.
La inferencia se está abaratando a una velocidad extraordinaria gracias a una combinación de:
- mejores aceleradores;
- cuantización;
- batching;
- speculative decoding;
- mejores kernels;
- arquitecturas más eficientes;
- competencia entre proveedores;
- modelos pequeños mucho más capaces;
- mayor utilización del hardware.
Samaritan Research, por ejemplo, encontró que el costo necesario para alcanzar determinados niveles históricos de desempeño cayó entre aproximadamente 9× y 900× por año, dependiendo del benchmark y del nivel de capacidad medido. Para un nivel comparable a GPT-4 en una de sus mediciones, la reducción fue de alrededor de 40× anual.
Fuente: Samaritan Research — LLM inference price trends
Por tanto, afirmar simplemente que “la inferencia es demasiado cara” es incompleto.
La pregunta correcta es:
¿cae el costo de la inferencia más rápido de lo que crece la cantidad de inferencia que queremos consumir?
Ahí está la carrera.
El efecto rebote: cuando algo barato se consume mucho más
Hay una dinámica económica conocida como efecto rebote: hacer más eficiente un recurso puede aumentar su consumo total porque aparecen nuevos usos que antes no eran viables.
Eso parece estar ocurriendo con la IA.
Cuando una llamada al modelo se abarata, el producto no necesariamente mantiene el mismo workflow y disfruta del ahorro. El equipo puede utilizar el presupuesto para:
- añadir razonamiento;
- aumentar el contexto;
- ejecutar verificadores;
- lanzar varios agentes;
- generar múltiples candidatos;
- usar modelos más potentes;
- automatizar tareas que antes ni siquiera intentaba automatizar.
La eficiencia libera demanda.
El resultado puede ser extraño: cada token cuesta menos, pero la factura total sube.
Ese fenómeno no significa que la mejora de eficiencia sea inútil. Al contrario, significa que la IA está encontrando más aplicaciones. El problema aparece cuando el valor económico creado por esos nuevos ciclos de cómputo no crece al mismo ritmo que el gasto.
Aquí es donde la discusión deja de ser sobre APIs y pasa a ser sobre data centers
La economía de un agente individual es solamente una parte de la historia.
Para satisfacer la demanda esperada, Microsoft, Amazon, Alphabet y Meta están construyendo una infraestructura física gigantesca: data centers, redes, sistemas eléctricos, GPUs y nuevas fuentes de generación.
Reuters informó en febrero que estas cuatro compañías planeaban gastar colectivamente más de 600.000 millones de dólares en IA durante 2026.
Fuente: Reuters — US AI boom faces electric shock
Ese gasto no es solamente una apuesta tecnológica. Es una apuesta sobre la demanda futura.
Un data center construido hoy necesita producir suficiente flujo de caja durante años para justificar tierra, energía, refrigeración, networking, deuda y hardware que puede quedar tecnológicamente rezagado mucho antes que un edificio convencional.
Y aquí aparece la característica clásica de una burbuja de infraestructura:
el capital se despliega hoy contra ingresos que todavía tienen que materializarse mañana.
El flujo de caja empieza a importar más que los benchmarks
En julio de 2026, Reuters analizó las estimaciones de LSEG para Microsoft, Alphabet, Amazon, Meta y Oracle. Según esas proyecciones, para 2027 el capex combinado de esas empresas podría superar su free cash flow.
El análisis calculaba además que cada dólar adicional de cash flow operativo estaría acompañado por aproximadamente 1,57 dólares de nuevo gasto de capital.
Fuente: Reuters — AI investment boom puts Big Tech’s free cash flow under pressure
Eso no significa que esas compañías estén en peligro inmediato. Varias poseen negocios extraordinariamente rentables capaces de financiar inversiones enormes.
Pero cambia la pregunta que el mercado termina haciendo.
Durante la primera fase de la carrera bastaba con demostrar:
“Tenemos el mejor modelo.”
Luego:
“Tenemos usuarios.”
Después:
“Tenemos agentes.”
La siguiente pregunta será inevitablemente:
“¿Cuánto retorno produce cada dólar de infraestructura?”
Y esa pregunta es mucho más difícil de responder con benchmarks.
El mercado de deuda ya empieza a pedir una prima
Una señal interesante aparece fuera del mercado de acciones.
Reuters informó el 22 de septiembre de 2026 que los inversores en bonos corporativos estaban comenzando a exigir mayores concesiones a emisores vinculados con IA debido al enorme volumen de financiación que necesita la infraestructura.
Según datos de Goldman Sachs citados por Reuters, la emisión bruta de deuda de los hyperscalers podría alcanzar 420.000 millones de dólares en 2027, alrededor de 60% más que la estimación para 2026.
El artículo también señalaba spreads cercanos a 115 puntos básicos para deuda relacionada con IA frente a unos 78 puntos básicos para el mercado investment-grade más amplio.
Fuente: Reuters — Corporate bond buyers get picky with flood of AI debt
No es una predicción de colapso.
Es algo más mundano y, por eso mismo, importante: el capital empieza a exigir mejor compensación por financiar la expansión.
Cuando eso ocurre, la disciplina económica aumenta.
¿Entonces hay una burbuja?
Depende de qué llamemos burbuja.
Si significa que “la IA no sirve para nada”, la evidencia no encaja bien con esa definición. La tecnología ya produce valor en programación, búsqueda, soporte, análisis, creación de contenido, investigación y automatización.
Si significa que parte de las expectativas financieras puede asumir retornos demasiado rápidos o demasiado altos para el capital que se está desplegando, la pregunta es mucho más razonable.
Las dos afirmaciones pueden coexistir:
la tecnología funciona
+
la adopción crece
+
la productividad puede mejorar
+
algunas inversiones pueden estar sobrevaloradas
=
no hay contradicción
La historia de Internet ofrece un precedente útil. La burbuja dot-com destruyó enormes cantidades de capital y muchas empresas desaparecieron.
Internet, mientras tanto, terminó siendo todavía más importante de lo que gran parte del mercado imaginaba.
Una tecnología puede ganar mientras muchos de sus vehículos financieros pierden.
El verdadero campo de batalla será la arquitectura
Para los equipos que construyen productos con IA, esta discusión tiene una consecuencia mucho más práctica que intentar adivinar cuándo subirá o bajará una acción.
La arquitectura tendrá que optimizar valor por unidad de inferencia.
Eso significa dejar de pensar:
“¿Cuál es el modelo más inteligente?”
y empezar a pensar:
“¿Cuál es el modelo más barato que completa correctamente este paso?”
Un sistema económicamente sano probablemente combinará varios niveles:
clasificación / extracción
↓
modelo pequeño y barato
tarea ambigua
↓
modelo intermedio
razonamiento difícil
↓
modelo frontier
caso crítico
↓
frontier + verificador
A eso se suman caching, deduplicación, límites de contexto, presupuestos por workflow, stop conditions, batching y ejecución local cuando resulte económicamente conveniente.
El futuro de los agentes probablemente no sea un modelo gigantesco haciendo todo.
Será un sistema que decide cuidadosamente cuándo merece la pena comprar inteligencia cara.
Cinco métricas que importan más que el precio por token
Para saber si la economía mejora conviene observar cinco señales:
- Costo por tarea completada correctamente, no solamente por token.
- Margen bruto del producto AI-native, después de inferencia y herramientas.
- Ingresos generados por workflow frente a costo de ejecución.
- Utilización y retorno del capex de infraestructura.
- Free cash flow y costo de financiación de quienes construyen esa infraestructura.
Si esas métricas mejoran mientras la adopción aumenta, la enorme inversión actual puede terminar pareciendo anticipada pero racional.
Si empeoran mientras el capex y la deuda siguen creciendo, la tesis de una burbuja gana fuerza aunque los modelos continúen mejorando.
La conclusión incómoda
La pregunta “¿es la IA una burbuja?” mezcla dos problemas diferentes.
Uno es tecnológico:
¿pueden los modelos hacer cosas suficientemente útiles?
Cada año resulta más difícil responder que no.
El otro es económico:
¿puede toda esa utilidad producir suficientes ingresos y ahorros para justificar el costo de servirla y la infraestructura que estamos construyendo?
Esa respuesta todavía se está escribiendo.
Por eso la tesis más interesante no es que la IA vaya a desaparecer.
Es casi la contraria:
la IA puede convertirse en una infraestructura fundamental de la economía y, precisamente por eso, atraer mucho más capital del que algunos participantes conseguirán recuperar.
Los tokens pueden seguir abaratándose. Los modelos pueden seguir mejorando. Los agentes pueden hacer cada vez más cosas.
Y aun así puede haber una burbuja.
Porque una revolución tecnológica responde a la pregunta “¿qué es posible?”.
Una inversión rentable tiene que responder además a otra:
“¿a qué costo?”
Fuentes
- Awesome — The AI Bubble Is Cracking…
- Gartner — AI inference costs per agentic workflow
- McKinsey — Is that AI agent worth it?
- McKinsey — Where AI agents pay off
- Zhu — The Price of Intelligence
- Samaritan Research — LLM inference price trends
- Reuters — US AI boom faces electric shock
- Reuters — AI investment boom puts Big Tech’s free cash flow under pressure
- Reuters — Corporate bond buyers get picky with flood of AI debt