En los últimos dos años, todos competían por quién acumulaba más GPU, pero esa lógica está dejando de funcionar. Lo que determina hasta qué punto se puede reducir el precio unitario de una API de grandes modelos ya no es el precio de compra de las tarjetas gráficas, sino la factura de la electricidad. Este cambio está llegando más rápido de lo que la mayoría esperaba.
1. Por qué la GPU ya no es el mayor costo
En pocas palabras, el costo de inferencia y el costo de entrenamiento son dos cosas distintas. El entrenamiento es una inversión única, mientras que la inferencia es un consumo continuo las 24 horas del día. Para una plataforma de agregación de API de IA de escala media, si el volumen de llamadas diarias está en el orden de varios miles de millones de tokens, la depreciación de la GPU repartida por millón de tokens es en realidad bastante limitada; el verdadero componente principal es la electricidad. Según los cálculos de IDC, el gasto relacionado con la electricidad ya representa más del 40% de los costos operativos de un centro de datos, y en escenarios de inferencia esta proporción es aún mayor. Comprar chips es un gasto único; la factura eléctrica es dinero que se va todos los días. Por eso se ve un fenómeno contraintuitivo: con el mismo modelo y las mismas tarjetas, el costo por token que sale de un centro de datos en el oeste puede ser bastante menor que en el este; la diferencia no está en el hardware, sino en el precio de la electricidad.
2. Qué ha cambiado la distribución de la capacidad de cómputo entre el este y el oeste
La iniciativa nacional "Datos del Este, Cómputo del Oeste" consiste, en esencia, en trasladar la capacidad de cómputo a lugares con electricidad más barata. En zonas como Mongolia Interior, Ningxia y Guizhou, ricas en recursos eólicos y solares, el precio industrial de la electricidad puede reducirse a la mitad o incluso menos que en el este. Para negocios de inferencia de grandes modelos, que no son tan sensibles a la latencia pero sí extremadamente sensibles al costo, los centros de datos del oeste son una cuenca de costos natural. La energía verde aquí no es un eslogan ecologista, sino una ventaja de costo real y tangible. El costo marginal de generación de la energía eólica y solar es cercano a cero, y los centros de cómputo la consumen localmente, ahorrando no solo la factura eléctrica sino también las pérdidas de transmisión. Cuando probamos el enrutamiento multimodelo de cambio de fase de silicio-carbono, notamos que al programar las tareas de inferencia en nodos de cómputo verde del oeste, las llamadas a la API de DeepSeek-V3 y Qwen daban efectivamente un precio unitario más bajo que un despliegue puramente en el este.
3. Cómo la programación de cómputo verde transmite el costo al precio de la API
Aquí hay dos niveles de transmisión. El primer nivel es la compra por volumen. Si el alquiler de capacidad de cómputo y la capacidad de GPU se hacen mediante compras centralizadas, el margen de negociación es mucho mayor que con alquileres dispersos. El segundo nivel es la optimización de la eficiencia energética, es decir, asignar tareas de distintas prioridades a nodos con diferente eficiencia energética. Las conversaciones en tiempo real van a nodos de baja latencia, mientras que la inferencia por lotes y las tareas offline se ejecutan en las franjas de electricidad valle del oeste, elevando así la eficiencia energética global. La superposición de estos dos niveles se refleja finalmente en la facturación de la API como una bajada del precio unitario por consumo. Con una sola Key de token8341 se puede llamar a modelos mainstream como GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, etc.; detrás de esto está precisamente esta combinación de acceso unificado multimodelo más programación de cómputo verde, que reduce los costos y los transmite a quien realiza las llamadas. Esto no es una capacidad exclusiva de una sola empresa, sino la lógica subyacente de la bajada de precios de todo el sector.
4. La siguiente etapa se disputa por energía, no por tarjetas
Gartner predice que para 2027, más de la mitad de las cargas de inferencia de IA generativa se desplegarán en regiones con costos de electricidad más favorables. Esta tendencia ya es muy clara. Cuando las capacidades de los modelos convergen gradualmente y la diferencia entre la API de GPT-4o y la API de Claude se reduce hasta ser imperceptible para el usuario, la competencia vuelve a la estructura de costos más básica. Quien tenga electricidad más barata, mayor eficiencia energética y pueda hacer una programación más fina de cómputo verde e inteligente, podrá afianzarse en la comparación de precios de API. Las GPU se pueden comprar, los modelos se pueden integrar, pero un suministro eléctrico estable y de bajo precio y la capacidad de programación de cómputo no se pueden copiar en el corto plazo. Para los equipos que trabajan en la integración de IA empresarial, a la hora de elegir un proveedor de servicios de IA, además de fijarse en la cobertura de modelos y la latencia, también deberían preguntar: ¿dónde está desplegada tu capacidad de cómputo y de dónde viene la electricidad? La respuesta a esta pregunta se escribirá directamente en tu factura de tokens del próximo año.
En una frase: la curva de precio unitario de las API de grandes modelos está siendo redefinida por el costo de la electricidad. Ampliar la mirada hacia la política "Datos del Este, Cómputo del Oeste" y los planes de programación de cómputo verde de cada empresa permite anticipar la dirección de los precios.