A finales de 2024, Yu Liu, cofundador de Heidi, se sorprendió cuando descubrió que gastaba hasta US$ 3 millones mensuales en los últimos modelos de OpenAI, Anthropic y Google para impulsar su startup de toma de notas para médicos. "Obteníamos buenos ingresos, pero si restaba nuestros gastos en IA, apenas teníamos margen de ganancia", afirma Liu.
Al principio, Liu pasó por alto los precios exorbitantes, ya que esperaba que los laboratorios de IA los redujeran a medida que la inteligencia artificial se volviera más accesible y económica. Pero eso no ocurrió. Por el contrario, las facturas siguieron acumulándose. A mediados de 2025, se hartó y recurrió a otra startup, Fireworks, con sede en San Mateo, California, que ayudó a Heidi a desarrollar su propia IA, más barata, a partir de los 280 modelos abiertos alojados en el sitio web de Fireworks.
A diferencia de los costosos modelos prefabricados de los grandes laboratorios estadounidenses, los desarrolladores pueden ajustar el rendimiento de estos modelos con sus propios datos y diseñar versiones personalizadas que permiten reducir los costos.

Tras trasladar el 95 % de la carga de trabajo de su startup a modelos especializados de libre acceso, Liu asegura que redujo su factura mensual de IA en casi un 90 %. El cambio representó un ahorro considerable para su empresa, que facturó US$ 4,1 millones en abril. Además, sumó otras ventajas: mientras un modelo estándar demoraba 25 segundos en generar transcripciones durante las horas de mayor demanda, el modelo personalizado de Heidi podía completar esa tarea prácticamente al instante.
El impacto económico de la IA se convirtió en uno de los temas centrales del mundo corporativo estadounidense. Durante los últimos años, las empresas les impusieron a sus empleados una única condición: utilizar la IA al máximo. Sin embargo, los incentivos adquirieron una lógica perversa. Las evaluaciones de desempeño premiaban a los trabajadores que gastaban grandes cantidades de tokens, la unidad estándar para medir el uso de la IA. En las clasificaciones internas, los empleados obsesionados con las bonificaciones y por maximizar el consumo de tokens competían entre sí por títulos como "leyenda de los tokens" y "dios de la IA".
Después llegó la factura. Uber, como es sabido, agotó todo su presupuesto de IA para 2026 en apenas cuatro meses con Claude Code, la herramienta de codificación de Anthropic. Según distintos reportes, Amazon gastó US$ 1,8 millones en un proyecto de Claude que nunca salió al mercado. Salesforce prevé una factura de US$ 300 millones de Anthropic este año. "No es sostenible", afirma Kay Zhu, directora de tecnología de Genspark, empresa dedicada al desarrollo de herramientas de IA para profesionales del conocimiento.
Pero resulta comprensible.
Alarmadas por la velocidad de los avances, las empresas aceleran la adopción de la IA, con capacitación para sus empleados y su incorporación a nuevos productos. "No quieren quedarse atrás", afirma Matt Murphy, socio de Menlo Ventures. Sin embargo, también deben afrontar los elevados costos asociados. La IA es intrínsecamente cara porque consume enormes cantidades de recursos, como GPU, electricidad, agua e inmuebles, y todo eso demanda muchísimo dinero. Un solo centro de datos de un gigavatio puede costar más de US$ 40.000 millones.
Actualmente, Estados Unidos tiene más de 1.500 centros de datos en construcción, con un costo total de US$ 2,3 billones. "Esto modifica significativamente la estructura de costos empresariales", afirma Lin Qiao, CEO y cofundadora de Fireworks. Para las empresas que desarrollan productos basados en IA, esto puede transformarse en un problema evidente a medida que pasan de cientos de usuarios a miles y millones.
Gartner pronostica que el gasto global en IA alcanzará los US$ 2,6 billones este año, equivalente al 2 % del PIB mundial. En agosto, Nvidia cerró un acuerdo con seis gigantes de Wall Street, entre ellos Blackstone y Goldman Sachs, para conseguir US$ 500.000 millones en financiamiento destinado a IA. Todo parte de una premisa: que existirá una demanda casi ilimitada, suficiente para justificar semejante desembolso. Entre OpenAI y Anthropic recaudaron US$ 310.000 millones en financiamiento de capital de riesgo. Lo necesitan porque sus productos de IA resultan extremadamente caros de desarrollar y operar. Ambas crecen a gran velocidad, con ingresos estimados durante los últimos 12 meses de alrededor de US$ 25.000 millones cada una, aunque esa cifra todavía queda muy lejos de todo el dinero que gastan.
"Las empresas ni siquiera saben cuánto gastan en cada consulta. Y si lo supieran, se horrorizarían", afirma Anastasios Angelopoulos, CEO de Arena, un sitio web que evalúa modelos según su rendimiento y precio. Ahora, con billones de dólares destinados al desarrollo de infraestructura, la carrera entre las empresas por reducir los costos de la IA plantea una pregunta decisiva: ¿habrá finalmente suficiente demanda para que las cuentas cierren para los laboratorios de IA de primer nivel?

Después de todo, existen alternativas mucho más económicas frente a los costosos modelos de vanguardia de OpenAI y Anthropic. Empresas chinas como DeepSeek, Alibaba, MiniMax y Moonshot solían quedar rezagadas respecto de los grandes laboratorios estadounidenses, pero recientemente alcanzaron su nivel. Y son baratísimas. Kimi K3 de Moonshot puede generar 1500 páginas, unas 750.000 palabras, de texto por US$ 15, menos de un tercio de los US$ 50 que cobra Anthropic por Fable 5 para completar la misma tarea. Qwen 3.8-Max de Alibaba puede diseñar la página de inicio de un sitio web por US$ 0,12. GPT 5.6 Sol de OpenAI puede hacer lo mismo, aunque por más del triple del precio.
El giro hacia el código abierto avanza con fuerza. Coinbase redujo su gasto en IA aproximadamente a la mitad tras derivar tareas sencillas, como la programación básica, hacia modelos chinos más económicos. DoorDash ahora delega trabajos de "nivel inferior", como la revisión de código, a Kimi K2.6 de Moonshot, entre otros, y reserva el modelo más potente de Anthropic para las tareas más complejas.
El CEO de Airbnb, Brian Chesky, calificó al modelo Qwen de Alibaba como "rápido y económico" y lo utiliza para el chatbot de atención al cliente de la compañía. En agosto, OpenRouter, con sede en Nueva York, cuyo software permite a los desarrolladores acceder a cientos de modelos de IA, informó que el 55 % de los tokens que pasaron por su plataforma correspondieron a modelos chinos, frente al 4,5 % de principios de 2025. "La realidad es que ahora mismo, los mejores modelos abiertos son de China", dice Matan Grinberg, CEO de la startup de codificación de IA Factory, aunque agrega que los modelos de código abierto desarrollados localmente, como Nemotron de Nvidia, también son "bastante buenos".
Los laboratorios estadounidenses tampoco se quedan de brazos cruzados ante esta fuerte competencia. En julio, OpenAI redujo los precios de sus modelos de gama media y baja hasta un 80 %, mientras Anthropic lanzó versiones que costaban la mitad que sus modelos más potentes. En términos generales, el precio de los tokens cayó un 70 % desde principios de año. "Todos deberíamos celebrar que haya más competencia entre los modelos, porque eso significa que todos vamos a obtener la mejor experiencia al menor costo", afirma Grinberg. "Si no existieran los modelos de código abierto, no creo que OpenAI hubiera bajado tanto el precio", agregó.
Incluso con tokens más baratos, los costos pueden dispararse a medida que la IA gana más capacidad. Los mejores modelos actuales ya no son simples chatbots que responden preguntas. Herramientas como Claude Code utilizan docenas, e incluso cientos, de agentes que trabajan en conjunto para resolver problemas, destinan más tiempo a "pensar" y consumen muchos más tokens.
"El número de tokens aumentó más rápido de lo que disminuyó su costo", dice Zhu, de Genspark, quien gasta un 50 % menos en tareas como la creación de diapositivas de PowerPoint después de que su startup, con sede en Palo Alto, adoptó software chino de código abierto. "La gente dice hola y Fable les cobra US$ 5", agrega Angelopoulos. "Es una locura", concluye.
Como respuesta, un grupo de startups ayuda a las empresas a optimizar el uso de la IA. Las soluciones incluyen enrutadores que derivan de forma inteligente el tráfico de IA hacia modelos más económicos y agentes que se instalan de manera discreta en las notebooks de los empleados para supervisar y controlar el gasto en inteligencia artificial.
"Las empresas están empezando a darse cuenta que la inteligencia se convertirá en la partida número uno de los gastos operativos de todos en lo que respecta al trabajo basado en el conocimiento", afirma Alex Atallah, de 34 años, CEO y cofundador de OpenRouter.
Entre estas empresas emergentes, Fireworks, con apenas cuatro años de vida, es quizá una de las que mejor aprovecharon la urgencia de las compañías estadounidenses por controlar su gasto en inteligencia artificial. El software de la empresa ayuda a sus cerca de 10.000 clientes corporativos, entre ellos Uber, Shopify, Upwork y DoorDash, además de startups reconocidas como Cursor, Cognition y Harvey, a desarrollar IA especializada con sus propios datos sobre modelos más económicos, muchas veces de origen chino. Así, no solo consiguen reducir costos, sino también obtener un control mucho más preciso sobre la manera en que funcionan sus modelos.
Con apenas unas líneas de código y una tarjeta de crédito, los desarrolladores pueden probar, optimizar y ejecutar cualquier modelo de código abierto del mundo. Tampoco necesitan preocuparse por conseguir GPU costosas y muy demandadas ni por rediseñar el hardware para que los nuevos modelos funcionen de manera eficiente. Fireworks se ocupa de todo.
Según estimaciones de Forbes, la compañía registró ingresos por aproximadamente US$ 250 millones en 2025. Su valuación se cuadruplicó hasta alcanzar los US$ 17.500 millones en los últimos nueve meses, lo que convirtió a Qiao, de 50 años, en una nueva multimillonaria, con una participación estimada del 6 % valuada en US$ 1.000 millones.
Hija de una contadora y un ingeniero mecánico dedicado al diseño de buques de carga, Qiao creció en Chengdu, China, una ciudad conocida principalmente por sus pandas gigantes. Llegó a Estados Unidos en 2000 para cursar un doctorado en informática en la Universidad de California, Santa Bárbara. Después de pasar por IBM y LinkedIn, trabajó siete años en Meta, donde desarrolló PyTorch, una popular herramienta de código abierto con 2.000 millones de descargas que se utilizó para crear ChatGPT.
En septiembre de 2022, dejó Meta junto con cinco colegas para fundar Fireworks; un séptimo cofundador se sumó desde Google. Eric Vishria, socio de Benchmark, invirtió US$ 25 millones en la ronda de financiamiento Serie A. Ahora, el crecimiento avanza a toda velocidad. Según el ritmo registrado en julio, Fireworks generaría cerca de US$ 1.000 millones en ingresos durante los 12 meses que terminarán en julio de 2027.
La atractiva rentabilidad de los modelos Open-weight también impulsa a OpenRouter. Su software divide una tarea en una serie de pasos y deriva automáticamente cada uno al modelo Open-weight o Frontier más rentable entre 500 opciones. Las tareas menos exigentes, como recuperar un archivo de un directorio, pueden derivarse a un modelo más económico como DeepSeek, mientras que para desafíos de mayor complejidad, como diseñar la arquitectura de software de un nuevo producto, puede justificarse la inversión en Anthropic.

Cada semana, 100 billones de tokens atraviesan el sistema de OpenRouter gracias a clientes como Zoom y Nvidia. Esa información le permite a la startup tener una visión panorámica de qué modelos prefieren los empleados según cómo distribuyen su gasto, explica Atallah, quien cofundó el mercado de NFT OpenSea en 2017. El enrutador de su startup analiza los patrones de gasto de los últimos siete días para decidir a qué modelo derivar cada solicitud. "Lo más interesante de este enrutador es que aprovecha la inteligencia colectiva para funcionar", afirma.
En 2023, Atallah advirtió que pronto existirían miles de modelos más pequeños y económicos después de que un grupo de estudiantes de Stanford entrenara uno llamado Alpaca, basado en el modelo Llama de Meta, por apenas US$ 600. "Parecía que realmente necesitábamos una buena manera de explorar todos estos modelos", explicó.
En agosto, Stripe acordó adquirir OpenRouter por US$ 8.000 millones, según una fuente cercana a la operación. Esto elevaría la fortuna de Atallah, dueño de más del 50 % de la empresa, a unos US$ 4.000 millones. La compañía estaba encaminada a generar más de US$ 100 millones en ingresos este año, con un margen bruto del 90 %, añadió la misma fuente.
El gobierno de Trump evaluó prohibir a las empresas estadounidenses el uso de modelos chinos en sus sistemas, una medida difícil de aplicar porque pueden descargarse de forma gratuita desde internet. Cientos de compañías rechazaron esa posibilidad y advirtieron que quedarían rezagadas mientras el resto del mundo desarrolla inteligencia artificial de código abierto más económica. "No es solo un riesgo para nuestro negocio", afirma Qiao, de Fireworks, "es un riesgo para toda la economía estadounidense", señala.
Un punto central es que Fireworks y OpenRouter mantienen los datos estadounidenses dentro de Estados Unidos. Estas startups funcionan como intermediarias entre los modelos chinos y las compañías del país. "Dondequiera que se cree el modelo, se convierte en un modelo de Fireworks porque nosotros lo gestionamos y lo administramos, nadie más. Estos datos no van a ningún otro lugar", afirma George Hu, presidente de Fireworks. Atallah explica que cualquier trabajo destinado a modelos chinos de peso abierto puede enviarse a centros de datos ubicados fuera de China, lo que permite garantizar la seguridad de los datos de las empresas estadounidenses.
Incluso cuando todo funciona correctamente, la IA resulta costosa. Pero los accidentes son frecuentes. Los agentes que operan en segundo plano pueden quedar fuera de control, desviarse de su objetivo y provocar facturas de cientos de miles de dólares. El agente de reclutamiento interno de Fireworks gastó US$ 24.000 en apenas unos días porque estaba mal configurado en "modo máximo", una opción que le exigía más tiempo para "pensar" y aumentaba el consumo de tokens. Shopify creó los llamados disyuntores para detectar agentes que operan sin supervisión por error. "Nuestra preocupación es el gasto que no podemos justificar, porque el desperdicio suele ser una señal de que algo falla", afirma Farhan Thawar, jefe de ingeniería de Shopify.
Cuando un ejecutivo de alto nivel de una agencia de publicidad empezó a usar la herramienta de toma de notas para reuniones con IA de Genspark, gastó un mes entero de créditos en tan solo unos días. ¿La razón? La herramienta de IA grababa y resumía automáticamente las ocho horas de reuniones a las que asistía a diario. Tras informar del problema, Genspark reemplazó el modelo por una alternativa que costaba un tercio del precio.
Este despilfarro se produce cuando las empresas no tienen forma de rastrear a dónde va su dinero ni qué obtienen a cambio, afirma Jyoti Bansal, CEO y cofundadora de Harness. Esta startup con sede en San Francisco vende software que detecta problemas de calidad, fallos de seguridad y lagunas en el cumplimiento normativo del código. En mayo, el equipo de Bansal lanzó un agente de gestión de costos con IA que se instala en los norebooks de los empleados y registra cada token gastado, el coste por token y si los empleados realmente lograron la tarea que se propusieron realizar con la IA. "Con solo tener visibilidad, la gente puede empezar a solucionar los problemas", afirma Bansal, cuya fortuna asciende a 2300 millones de dólares.
United Airlines desarrolla su propio sistema interno de seguimiento para gestionar los gastos de IA, con aprobaciones humanas destinadas a controlar los costos. Ratna Devarapalli, director de TI de la aerolínea, afirma que el aumento de los precios de herramientas como Microsoft Copilot y el uso excesivo de la IA, a medida que la gente aprende a utilizarla, provocaron un incremento de los costos. "Además, es adictivo", comenta. "Me paso horas en casa usándolo, intentando hacer algo", advierte.
La startup de herramientas para desarrolladores Vercel, cliente de Fireworks con sede en San Francisco, todavía exige a sus ingenieros que utilicen los modelos más avanzados y más potentes, aunque impuso límites de uso. Sin embargo, los modelos abiertos no tienen restricciones. La mayoría de los ingenieros ahora utiliza modelos avanzados para planificar y modelos abiertos ponderados para ejecutar, según afirma el director de tecnología, Malte Ubl. Los empleados de Coinbase y sus gerentes reciben un informe periódico que detalla cuánto gastaron en modelos. "No les impedimos usar muchos modelos, pero les dejamos claro que tendrán que explicar por qué gastaron tanto dinero la semana pasada en un determinado modelo", explica el director de tecnología de Coinbase, Rob Witoff.
Pero ¿qué pasaría si existiera una forma más eficiente de entrenar modelos? Hasani dedicó 11 años a investigar esto, primero en la Universidad Tecnológica de Viena y después en el MIT, con el objetivo de encontrar una respuesta. Sorprendentemente, la clave apareció en un pequeño gusano redondo llamado C. elegans, cuyo cerebro procesa la información de una forma similar al humano. A partir de las señales neuronales del gusano, Hasani descubrió un proceso matemático basado en la suma en lugar de la multiplicación.
A partir de esta idea, su startup con sede en Boston, nacida en el MIT en 2023, desarrolla "redes neuronales líquidas" que procesan datos con mayor eficiencia y no necesitan costosos chips alojados en centros de datos. La empresa está valuada en US$ 4.500 millones y Hasani posee cerca del 20 %.
Los modelos de Liquid AI son lo suficientemente pequeños como para ejecutarse directamente en notebooks y teléfonos celulares. Además, su alojamiento es gratuito. Mercedes-Benz, uno de sus clientes, planea utilizar los modelos de Liquid para el asistente de voz de sus vehículos en Norteamérica. "Las empresas se preguntan: ¿Es posible tener un modelo con la calidad de ChatGPT que se ejecute directamente en mi auto con un chip de US$ 60?", comenta Hasani. La diferencia es significativa frente a los chips de Nvidia, que cuestan US$ 50.000 cada uno.
Todavía estamos en las primeras etapas de la expansión de la IA y queda por delante un costoso período de prueba y error. La economía de esta tecnología cambiará de manera inevitable a medida que los grandes laboratorios compitan cada vez más por precio. Pero algo ya está claro: la IA se convirtió en un gasto permanente dentro del balance, y todo CFO competente de Estados Unidos buscará formas de administrarlo.
*Este artículo fue publicado originalmente por Forbes.com