SiCore TokenWorks
LLM APIAPI GatewayAggregation

Analyse d'un ingénieur token8341 : la guerre des prix des API de grands modèles se transforme en guerre de l'électricité

SiCore TokenWorks Team·2026-10-05

Ces deux dernières années, tout le monde comparait qui accumulait le plus de GPU, mais cette logique est en train de perdre de sa pertinence. Ce qui détermine jusqu'où le prix unitaire d'une API de grand modèle peut être comprimé n'est plus le prix d'achat des cartes graphiques, mais la facture d'électricité. Ce basculement arrive plus vite que la plupart des gens ne l'anticipent.

I. Pourquoi le GPU n'est plus le poste de coût principal

En termes simples, le coût d'inférence et le coût d'entraînement sont deux choses distinctes. L'entraînement est un investissement ponctuel, tandis que l'inférence est une consommation continue, 24 heures sur 24, chaque jour. Pour une plateforme d'agrégation d'API d'IA de taille moyenne, si le volume d'appels quotidiens se situe dans l'ordre de plusieurs milliards de tokens, l'amortissement des GPU réparti sur chaque million de tokens reste en réalité très limité ; le véritable poste principal, c'est l'électricité. Selon les estimations d'IDC, les dépenses liées à l'électricité représentent déjà plus de 40 % des coûts d'exploitation d'un centre de données, et dans les scénarios d'inférence, cette proportion est encore plus élevée. L'achat de puces est une dépense ponctuelle, tandis que la facture d'électricité est de l'argent qui s'écoule chaque jour. C'est pourquoi l'on observe un phénomène contre-intuitif : avec le même modèle et les mêmes cartes, le coût par token produit dans un centre de données de l'Ouest peut être nettement inférieur à celui de l'Est ; l'écart ne réside pas dans le matériel, mais dans le prix de l'électricité.

II. Ce que la répartition des capacités de calcul entre l'Est et l'Ouest a changé

Le projet national « Données de l'Est, calcul à l'Ouest » consiste essentiellement à déplacer les capacités de calcul vers les régions où l'électricité est moins chère. En Mongolie-Intérieure, au Ningxia, au Guizhou et dans d'autres régions, les ressources en électricité éolienne et solaire sont abondantes, et le prix industriel de l'électricité peut être comprimé à la moitié, voire moins, de celui de l'Est. Pour des activités comme l'inférence de grands modèles, qui sont moins sensibles à la latence mais extrêmement sensibles aux coûts, les centres de données de l'Ouest constituent une zone naturelle de faible coût. L'énergie verte n'y est pas un slogan écologique, mais un avantage de coût bien réel. Le coût marginal de production de l'éolien et du solaire est proche de zéro ; en consommant cette énergie sur place, les centres de calcul économisent non seulement la facture d'électricité, mais aussi les pertes de transport. Lors de nos tests de routage multi-modèles de SiC à changement de phase, nous avons remarqué qu'ils planifient les tâches d'inférence vers des nœuds de calcul vert de l'Ouest, et que les appels API à des modèles identiques comme DeepSeek-V3 et Qwen affichent effectivement un prix unitaire inférieur à celui d'un déploiement purement dans l'Est.

III. Comment la planification du calcul vert transmet les coûts aux prix des API

Il y a ici deux niveaux de transmission. Le premier est l'achat en gros. Si la location de capacités de calcul et les GPU passent par des achats centralisés, la marge de négociation est bien plus grande que pour une location dispersée. Le second est l'optimisation de l'efficacité énergétique, c'est-à-dire l'affectation des tâches de différentes priorités à des nœuds de différentes efficacités énergétiques. Les dialogues en temps réel passent par des nœuds à faible latence, tandis que l'inférence par lots et les tâches hors ligne passent par les périodes de creux électrique de l'Ouest, ce qui permet d'augmenter le ratio d'efficacité énergétique global. La superposition de ces deux niveaux se traduit finalement, dans la facturation des API, par une baisse du prix unitaire à la consommation. Avec une seule clé token8341, on peut appeler les principaux modèles tels que GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, etc. ; derrière cela se trouve précisément cette combinaison d'accès unifié multi-modèles et de planification de calcul vert, qui comprime les coûts avant de les transmettre aux appelants. Ce n'est pas une capacité propre à une seule entreprise, mais la logique sous-jacente de la baisse des prix dans tout le secteur.

IV. La prochaine phase se jouera sur l'énergie, pas sur les cartes

Gartner prévoit que d'ici 2027, plus de la moitié des charges d'inférence d'IA générative seront déployées dans des régions où le coût de l'électricité est plus avantageux. Cette tendance est déjà très claire. Lorsque les capacités des modèles convergent progressivement et que l'écart entre l'API GPT-4o et l'API Claude devient imperceptible pour les utilisateurs, la concurrence revient à la structure de coûts la plus élémentaire. Celui dont l'électricité est moins chère, dont l'efficacité énergétique est plus élevée et qui sait planifier plus finement le calcul vert et le calcul intelligent pourra se maintenir dans la comparaison des prix des API. Les GPU s'achètent, les modèles s'intègrent, mais une fourniture d'électricité stable à bas prix et une capacité de planification du calcul ne se copient pas à court terme. Pour les équipes qui travaillent sur l'intégration de l'IA en entreprise, au moment de choisir un fournisseur de services d'IA, outre la couverture des modèles et la latence, il faudrait aussi poser une question : où sont déployées vos capacités de calcul, et d'où vient l'électricité. La réponse à cette question s'inscrira directement dans votre facture de tokens de l'année prochaine.

En une phrase : la courbe des prix unitaires des API de grands modèles est en train d'être redéfinie par le coût de l'électricité. En examinant de plus près la politique « Données de l'Est, calcul à l'Ouest » et les solutions de planification du calcul vert de chacun, on peut anticiper l'évolution des prix.