Skip to content
DigitalNeuron
Negocio e inversión

Análisis: el precio de la IA sigue bajando, entonces, ¿por qué aumentan las facturas?

El costo por token se ha desplomado mientras que el gasto total en IA ha aumentado. Ambas afirmaciones son ciertas, y la brecha entre ellas explica la mayor parte de lo que está sucediendo con la economía de los productos de IA.

Por DigitalNeuron Desk4 min de lectura

Respuesta rápida

¿Por qué aumentan los costos de la IA si el precio por token está bajando?

El precio por token ha caído drásticamente gracias a mejor hardware, modelos destilados más pequeños y optimizaciones de servicio. El consumo ha crecido más rápido: contextos más largos, modelos de razonamiento que generan muchos más tokens por respuesta y agentes que convierten una acción del usuario en docenas de llamadas al modelo. La caída de los precios unitarios con el aumento de las unidades produce facturas más grandes.

Claves

  • Precio unitario a la baja y gasto total al alza son compatibles: el recuento de tokens por tarea ha crecido más rápido de lo que ha bajado el precio.
  • Los modelos de razonamiento y los bucles de agentes son los dos mayores multiplicadores de tokens por acción de usuario.
  • El precio por asiento en una función de IA ilimitada invierte el margen para los usuarios intensivos; por esa razón, los precios vinculados al uso se están extendiendo.
  • El mayor ahorro disponible en la mayoría de los productos es dirigir solicitudes sencillas a un modelo pequeño.

Dos afirmaciones son simultáneamente ciertas y se confunden constantemente como una contradicción: el precio de una unidad de cómputo de IA ha caído drásticamente, y las empresas gastan más en IA que nunca. La brecha entre ellas es donde reside la economía interesante.

Lo que realmente se abarató

Varias fuerzas empujaron el precio por token hacia abajo a la vez:

  • Generaciones de hardware. Cada generación de aceleradores ofrece más rendimiento por vatio y por dólar.
  • Optimizaciones de servicio. Procesamiento por lotes continuo, atención paginada para cachés de clave-valor, decodificación especulativa, cuantización. Estas son victorias de ingeniería, no cambios en el modelo, y se acumulan.
  • Arquitecturas dispersas. Los diseños de mezcla de expertos activan solo una fracción de los parámetros por token, por lo que un modelo muy grande puede costar como uno mucho más pequeño para servir.
  • Destilación. Los modelos pequeños entrenados con las salidas de los grandes ahora manejan una amplia gama de trabajos rutinarios a una fracción del precio.
  • Competencia. Múltiples proveedores creíbles en cada nivel de capacidad, con costos de cambio lo suficientemente bajos como para ser reales.

El resultado es una disminución genuina, de un orden de magnitud, en el precio para un nivel dado de capacidad en unos pocos años. Nadie discute esto.

Lo que se encareció por tarea

Mientras tanto, el número de tokens que consume una sola acción de usuario ha crecido, por cuatro razones:

Contexto más largo. Los productos que antes enviaban un prompt de 500 tokens ahora adjuntan documentos, historial de conversaciones, pasajes recuperados y definiciones de herramientas. Diez mil tokens de entrada por llamada no es algo inusual.

Modelos de razonamiento. Los modelos que producen deliberación interna antes de responder pueden generar muchas veces más tokens de salida por solicitud que un modelo de respuesta directa. La tarifa no cambió; el recuento de tokens sí.

Agentes. Este es el multiplicador más grande. Una instrucción — "conciliar estas cuentas" — se convierte en quince llamadas al modelo, cada una llevando el contexto acumulado. Desde una perspectiva de facturación, no es una solicitud. Son quince, y cada una es más larga que la anterior.

Reintentos y evaluación. Los sistemas de producción reintentan en caso de fallo y ejecutan suites de evaluación continuamente. Ambos son invisibles para los usuarios y visibles en las facturas.

Multiplicar una disminución de precio de 10x por un aumento de 30x en tokens por tarea y la factura se triplica mientras que cada unidad se abarató. Ese es todo el enigma.

Lo que esto hace a los márgenes del producto

El patrón se manifiesta más claramente en el software por asiento. Un asiento cuesta una cantidad fija por mes. Una función de IA adjunta a ese asiento cuesta lo que el usuario consume. La distribución del uso no es normal — una pequeña fracción de usuarios genera una gran mayoría de tokens, y suelen ser los más comprometidos y los menos propensos a darse de baja.

Se han vuelto comunes tres respuestas:

  1. Precios vinculados al uso. Créditos o niveles con límites explícitos. Menos elegante que los precios fijos, y sobrevive al contacto con usuarios intensivos.
  2. Enrutamiento. Un modelo pequeño maneja la mayor parte de las solicitudes; el modelo caro se reserva para las difíciles. En la mayoría de las cargas de trabajo, este es el mayor ahorro disponible, por delante de todas las optimizaciones a nivel de prompt.
  3. Caché y procesamiento por lotes. Los prefijos cacheados reducen el costo de los prompts y documentos repetidos del sistema; los puntos finales por lotes aproximadamente reducen a la mitad el precio de cualquier cosa que no necesite una respuesta inmediata.

El suelo de la infraestructura

Hay un límite a cuánto puede caer esto, y es físico. Servir un modelo requiere aceleradores, ancho de banda de memoria, un edificio, refrigeración y una conexión a la red eléctrica — y en varios mercados importantes, la conexión a la red eléctrica es ahora la restricción principal, con colas de interconexión medidas en años.

Los costos de capital se están amortizando sobre un volumen que tiene que seguir creciendo para justificarlo. Esto funciona mientras la demanda crece. También es por eso que los anuncios de capacidad ahora se leen como documentos de planificación de servicios públicos en lugar de noticias de productos.

Qué observar

Para cualquiera que ejecute un producto de IA, tres números importan más que el precio principal por millón de tokens:

  • Tokens por tarea completada, rastreados a lo largo del tiempo. Esto captura lo que realmente está creciendo.
  • Porcentaje de tráfico atendido por el modelo adecuado más barato. Si está por debajo de la mitad, hay dinero sobre la mesa.
  • Tasa de aciertos de caché en el prefijo estable. Un cambio a nivel de byte en la parte superior de un prompt puede deshabilitar silenciosamente el almacenamiento en caché y aumentar los costos de la noche a la mañana.

El precio unitario seguirá cayendo. Si su factura sigue el mismo camino depende casi por completo de si su recuento de tokens por tarea se mantiene estable — y en una hoja de ruta de producto llena de agentes y contexto más largo, no lo hará por accidente.

Preguntas frecuentes

¿La IA se está volviendo más barata o más cara?
Más barato por unidad de cómputo, más caro por tarea completada en muchos productos, porque las tareas ahora consumen mucha más computación de la que consumían. Qué tendencia sientas depende de si tu uso de tokens por tarea es estable.
¿Por qué los modelos de razonamiento cuestan más de lo que sugiere su tarifa indicada?
Ellos generan tokens de razonamiento internos antes de la respuesta visible, facturados como salida. La tarifa por token se mantiene sin cambios; el número de tokens por solicitud es mucho mayor.
¿Cómo protegen los productos de IA sus márgenes?
Enrutamiento de modelos, caché de prompts, procesamiento por lotes para trabajos no interactivos, longitud de contexto limitada y precios que se escalan con el uso en lugar de asientos.
¿Reduce el costo el autoalojamiento de un modelo de pesos abiertos?
Puede estar a un volumen alto y constante, donde mantienes el hardware ocupado. En volúmenes bajos o pico, los aceleradores inactivos suelen costar más que las llamadas a la API habrían tenido.

Fuentes

  1. API pricing — OpenAI
  2. API pricing — Anthropic
  3. Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
Etiquetaspricingunit economicsinferenceagentsmargins

Lecturas relacionadas

Cómo se calcula realmente el precio de los modelos de IA: tokens, caché y lotes

Casi todas las API de IA facturan por millón de tokens, con precios separados para entrada y salida. La salida suele costar varias veces más que la entrada. La entrada cacheada, el procesamiento por lotes y los modelos más pequeños reducen la factura de forma sustancial, y el coste de una conversación crece con el historial porque la mayoría de las API reenvían el hilo completo en cada turno.

4 min de lectura

Cloudera y Mistral se asocian para impulsar la IA empresarial soberana

Mistral AI y Cloudera anunciaron una alianza que integra los modelos de IA de Mistral con la plataforma de datos híbrida de Cloudera. El acuerdo permite a las empresas ejecutar inferencia en entornos de nube privada, nube pública, on-premise y con espacio de aire (air-gapped), además de entrenar modelos personalizados con datos propios sin perder la titularidad ni de los datos ni de la inteligencia resultante, según informaron las compañías el 10 de septiembre de 2026.

2 min de lectura

Mistral recauda 3.000 millones de euros en una ronda Serie D liderada por Samsung

Mistral anunció una ronda de financiación de serie D por 3.000 millones de euros, liderada por Samsung Electronics, que sitúa la valoración de la empresa tras la operación en más de 21.000 millones de euros. Mistral señaló que utilizará los fondos para ampliar la investigación de frontera, la capacidad de computación y la infraestructura, al tiempo que acelera el crecimiento comercial y su presencia internacional.

2 min de lectura