¿Por qué la IA consume tanta electricidad?
El entrenamiento acapara los titulares, pero el servicio del modelo consume la electricidad a lo largo de la vida útil de un sistema. Aquí es donde realmente va la energía, y por qué la restricción ha pasado de los chips a las conexiones a la red.
Respuesta rápida
¿Por qué la IA consume tanta electricidad?
Los aceleradores de IA consumen mucha más energía por rack que los servidores tradicionales, y esa energía debe ser suministrada, enfriada y pagada continuamente. Entrenar un modelo grande es un pico puntual; servirlo a millones de usuarios es una carga permanente, y la inferencia es lo que domina el uso de energía durante la vida útil de un modelo desplegado.
Claves
- Un rack de IA puede consumir una orden de magnitud más de energía que un rack de servidor convencional, lo que cambia el edificio, no solo la lista de compras.
- El entrenamiento es un pico; la inferencia es una carga permanente. A lo largo de la vida de un modelo, el servicio domina.
- La restricción principal en muchas regiones es ahora la interconexión a la red y los transformadores, no el suministro de chips.
- Las ganancias de eficiencia por token son reales y grandes, pero la demanda ha crecido más rápido, por lo que el consumo total sigue aumentando.
Los centros de datos han consumido cantidades serias de electricidad durante dos décadas. Lo que cambió con la IA es la densidad: cuánta energía demanda un solo rack y, por lo tanto, qué debe ser capaz de suministrar y eliminar un edificio.
Dónde va realmente la energía
Cuatro lugares, en orden descendente:
Los aceleradores. Las GPU y los chips de IA diseñados específicamente están diseñados para mantener miles de unidades aritméticas ocupadas simultáneamente. Un acelerador de gama alta consume varios cientos a más de mil vatios por sí solo, y un nodo de entrenamiento agrupa varios de ellos. Mientras que un rack de servidor convencional podría consumir entre 5 y 15 kW, un rack de IA se especifica en decenas de kilovatios y, en los diseños más nuevos, por encima de los 100 kW.
Movimiento de datos. Los modelos grandes se dividen en muchos chips, que deben intercambiar resultados intermedios constantemente. La memoria de alto ancho de banda y la red de interconexión consumen una parte significativa del total, y a diferencia de la computación, esa parte no disminuye tan rápidamente con cada generación.
Refrigeración. Cada vatio que entra sale en forma de calor. La refrigeración por aire deja de ser práctica alrededor de los 30-40 kW por rack, por lo que la refrigeración líquida ha pasado de ser exótica a estándar en las nuevas salas de IA. La eficiencia se rastrea con PUE (efectividad del uso de energía): potencia total de la instalación dividida por la potencia de TI. Una instalación moderna bien gestionada se sitúa cerca de 1.1-1.2; los sitios más antiguos con refrigeración por aire son considerablemente peores.
Todo lo demás. Pérdidas de conversión de potencia, fuentes de alimentación ininterrumpidas, redes, almacenamiento.
El entrenamiento es un pico, la inferencia es una carga
Entrenar un modelo de vanguardia ejecuta miles de aceleradores al máximo durante semanas. Es caro, visible y finito.
Servir ese modelo es diferente en su naturaleza. Cada solicitud realiza cálculos, y un producto popular maneja millones al día, todos los días, durante años. La energía por solicitud es pequeña; la multiplicación no lo es. Para cualquier modelo en uso real en producción, la energía acumulada de inferencia supera a la energía de entrenamiento bien dentro de su vida útil, y a diferencia del entrenamiento, la carga nunca termina.
Dos cosas aumentan aún más la energía de inferencia:
- Salidas más largas. La generación es secuencial: cada token requiere un pase completo a través del modelo. Los modelos de estilo de razonamiento que producen largas cadenas internas antes de responder realizan proporcionalmente más trabajo por solicitud.
- Agentes. Una instrucción de usuario puede convertirse en docenas de llamadas a modelos más invocaciones de herramientas. Desde la perspectiva del centro de datos, son docenas de solicitudes, no una.
Y una cosa la reduce drásticamente: la elección del modelo. La energía escala con la computación, por lo que servir una tarea con un modelo pequeño en lugar de uno grande no es un ahorro marginal. El enrutamiento (modelo barato primero, escalar solo cuando sea necesario) es la palanca más efectiva que la mayoría de los equipos tienen.
La restricción se trasladó de los chips a la red
Durante un período, el cuello de botella fue el suministro de aceleradores. Cada vez más, es la interconexión eléctrica: la cola para conectar una nueva carga grande a la red de transmisión, y el tiempo de entrega de transformadores y equipos de conmutación. En varios mercados importantes, esas colas se miden en años.
Eso remodela la industria de maneras que vale la pena observar:
- La ubicación sigue a la energía. Los operadores construyen donde existe la generación y la capacidad de la red, en lugar de cerca de los usuarios, lo cual es aceptable para el entrenamiento, pero más difícil para el servicio sensible a la latencia.
- Acuerdos de generación a largo plazo. Los acuerdos de compra de energía a varios años, incluidos los operadores nucleares y geotérmicos, se han convertido en noticias de infraestructura estándar en lugar de anuncios de sostenibilidad.
- Generación y almacenamiento in situ. Generación detrás del medidor para evitar por completo la cola de interconexión.
- Política local. El aumento de los precios de la electricidad y el uso del agua son ahora temas municipales activos dondequiera que se propongan grandes instalaciones.
La eficiencia está mejorando, y el consumo sigue aumentando
Ambas afirmaciones son ciertas, y la tensión confunde mucha cobertura.
La energía por token ha caído drásticamente gracias a un mejor hardware, cuantización, lotes, caché, arquitecturas dispersas que activan solo una parte del modelo por token, y modelos pequeños destilados que manejan el trabajo rutinario. Estas no son ganancias marginales; son grandes.
El consumo total ha aumentado de todos modos, porque el uso ha crecido más rápido que la eficiencia. Este es el patrón de rebote estándar: cuando una unidad de algo se vuelve más barata, se usa más. La eficiencia es necesaria y no es suficiente.
Qué medir realmente
Si opera un servicio y desea un número defendible en lugar de un titular:
- PUE de la instalación, del operador.
- Intensidad de carbono de la red donde y cuándo opera. La misma carga de trabajo puede diferir varias veces entre regiones y entre horas del día.
- Tokens servidos por unidad de energía, rastreados a lo largo del tiempo. Esto captura sus elecciones de modelo y enrutamiento, que son las partes que usted controla.
- Efectividad del uso del agua, si opera en una región con estrés hídrico.
El resumen incómodo: la mayoría de las palancas que reducen el uso de energía de la IA son las mismas que reducen el costo de la IA: modelos más pequeños donde son suficientes, caché, lotes, salidas más cortas. Esa alineación es la razón para ser moderadamente optimista sobre la tendencia por solicitud, y también es la razón por la que la demanda total sigue aumentando.
Preguntas frecuentes
- ¿Cuánta electricidad utiliza una sola consulta de IA?
- Varía en órdenes de magnitud según el tamaño del modelo, la longitud de la salida y el hardware, y la mayoría de las cifras publicadas por consulta única son estimaciones en lugar de mediciones. La comparación útil no es por consulta, sino por implementación: un servicio que maneja millones de solicitudes al día tiene una carga continua de varios megavatios.
- ¿El entrenamiento o la inferencia son responsables de un mayor consumo de energía?
- El entrenamiento es un costo único y grande; la inferencia es un costo menor que se repite indefinidamente. Para cualquier modelo de uso generalizado, la inferencia acumulada supera la energía de entrenamiento mucho antes de su vida útil.
- ¿Usar un modelo más pequeño realmente ayuda?
- Sustancialmente. La energía por token escala con la computación realizada, por lo que dirigir solicitudes fáciles a un modelo pequeño y reservar el grande para solicitudes difíciles reduce tanto el costo como el consumo de energía para la misma carga de trabajo.
- ¿Por qué los centros de datos necesitan tanta agua?
- La refrigeración por evaporación es barata y eficiente, pero consume agua. Los diseños de circuito cerrado y de refrigeración líquida utilizan mucha menos agua mientras consumen más electricidad: los dos recursos se compensan entre sí.
Fuentes
- Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
- Data centre energy use — research programme — Lawrence Berkeley National Laboratory
- Power usage effectiveness (PUE) — The Green Grid