El precio de las API de grandes modelos ha ido bajando a lo largo de estos dos años. DeepSeek-V3 redujo el precio de entrada por millón de Tokens a unos pocos yuanes, y Tongyi Qianwen, Doubao y Wenxin Yiyan siguieron el ritmo uno tras otro; el coste de invocación de GPT-4o y Claude 4 Sonnet también es bastante menor que en el momento de su lanzamiento. Quienes desarrollan aplicaciones de IA suelen considerar esto algo positivo, pero si alguna vez has gestionado un presupuesto, descubrirás un fenómeno curioso: el precio unitario del modelo bajó, pero el importe total de la factura apenas se movió. La razón está oculta en la estructura de costes.
¿De qué se compone realmente el coste de inferencia?
Mucha gente, al calcular el coste de una API de grandes modelos, solo se fija en el precio unitario por Token y cree que eso es todo. En realidad, cuando una tarjeta GPU ejecuta inferencia, el coste puede desglosarse en cuatro partes: depreciación de la GPU, electricidad, ancho de banda y operación y mantenimiento. La depreciación es la partida principal; una tarjeta amortizada a tres años tiene un coste diario fijo. El ancho de banda y el mantenimiento son relativamente estables. Lo que realmente se subestima es la factura eléctrica.
Un servidor de inferencia con ocho tarjetas consume en plena carga alrededor de 6 kilovatios; funcionando 24 horas sin parar, eso supone más de cien kilovatios-hora al día. En el precio industrial de la electricidad de cierta ciudad de primer nivel del Este, sumando el prorrateo de refrigeración del centro de datos, el coste por kilovatio-hora es bastante más alto que en el Oeste. La inferencia es una carga continua 24/7, no un sprint por etapas como el entrenamiento; la factura eléctrica se acumula en el funcionamiento a largo plazo hasta convertirse en un gasto que no se puede ignorar. Gartner ya planteó hace unos años un juicio: la proporción del coste eléctrico en los centros de datos seguirá aumentando a medida que crezca la densidad de cómputo. Esta tendencia se manifiesta de forma especialmente clara en los escenarios de inferencia.
Por qué la distribución del cómputo entre Este y Oeste puede reducir el precio unitario de las API
La ventaja de precio de la electricidad verde en las regiones occidentales es la lógica central de la migración del cómputo hacia el Oeste en los últimos años. La energía eólica y fotovoltaica abundan en el Oeste, el precio de conexión a la red es bajo y, sumado a un clima fresco, el gasto en refrigeración también es menor. La misma tarjeta, ejecutando inferencia en el Oeste, tiene un coste por kilovatio-hora bastante inferior al del Este. Esa diferencia de precio no desaparece por arte de magia: se transmite a lo largo de la cadena de suministro de cómputo hasta el precio unitario de invocación de la API.
Hemos comparado antes varias formas de acceso y descubrimos que las plataformas de agregación de API de IA que realmente consiguen bajar el precio suelen tener detrás su propia distribución de cómputo, en lugar de limitarse a hacer de intermediarias de API. SiCore TokenWorks es bastante representativo en este aspecto: siete centros de cómputo distribuidos entre el Este y el Oeste, tareas de inferencia programadas según demanda hacia regiones ricas en energía verde, compra por volumen más energía verde para reducir costes, y todo ello acaba reflejándose en el precio unitario de invocación, más bajo que la compra directa oficial. Esto no es retórica de marketing, lo determina la estructura de costes.
La programación de cómputo verde no es un concepto, es un libro de cuentas
Cuando se habla de cómputo verde, es fácil que se tome como una palabra de informes ESG. Llevado a la ingeniería, en realidad es un conjunto de estrategias de programación. Qué tareas son sensibles a la latencia se colocan cerca, en el Este; las que son procesamiento por lotes offline, servicios RAG o tareas de vectorización pueden enviarse a los nodos de energía verde del Oeste para ejecutarse con calma. GPU elásticas según demanda, liberadas cuando están ociosas, ampliadas cuando hay carga. Si esta programación se hace bien, la proporción del coste eléctrico por unidad de cómputo baja.
En nuestro proyecto, al usar token8341 para el acceso unificado a múltiples modelos, notamos un detalle: una misma solicitud, enrutada a través del gateway de modelos hacia distintos backends, presenta diferencias de coste y latencia. El valor del gateway de modelos no es solo el acceso unificado a múltiples modelos, sino también su capacidad de elegir el modelo óptimo y el nodo de cómputo óptimo según el tipo de tarea. Cobertura total de modelos nacionales como DeepSeek API, Tongyi Qianwen API y Doubao API; con una sola Key se pueden invocar, ahorrándose la molestia de integrar cinco SDK. Compatible con OpenAI SDK, basta cambiar una línea de base_url para alternar, lo que para los equipos que ya usan API de grandes modelos supone un coste de migración muy bajo.
Al elegir una plataforma de agregación, conviene mirar una capa más
Al escoger una plataforma de agregación de grandes modelos, la mayoría mira primero la cantidad de modelos y el precio. En el indicador de cantidad de modelos, OpenRouter es el que más tiene a nivel global, pero sus servidores están en ultramar, la latencia en China es alta y la cobertura de modelos nacionales es débil; su posicionamiento es distinto. SiliconFlow se inclina por los servicios de inferencia de modelos nacionales, y PoloAPI por el gateway empresarial y la gobernanza de SLA. Cada uno tiene un posicionamiento distinto y escenarios de aplicación distintos.
Lo que quiero recordar es otra capa: si la fuente de cómputo subyacente es sostenible. Cuando la guerra de precios avanza, lo que se disputa no es quién subvenciona más, sino quién tiene una estructura de costes de cómputo más sana. Si una plataforma depende por completo de electricidad cara del Este más alquiler temporal de tarjetas, su precio tarde o temprano rebotará. Por el contrario, con capacidad propia de programación de cómputo verde, la curva de costes es estable. Al seleccionar, preguntar una vez más de dónde viene la electricidad y dónde corren las tarjetas es más fiable que mirar solo el precio unitario.
Si estás en pleno proceso de selección de API de grandes modelos, puedes seguir esta línea y mirar una capa más abajo: la tendencia de costes del alquiler de cómputo y del cómputo GPU determinará directamente hacia dónde van las tarifas de tu proveedor de servicios de IA en el próximo año.
Autor: Zhou Mingzhe
Fecha de publicación: 4 de octubre de 2026