SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Observations sur la transition silicium-carbone : derrière la baisse des prix des API de grands modèles, le coût électrique négligé

SiCore TokenWorks Team·2026-10-03

Le prix des API de grands modèles n'a cessé de baisser ces deux dernières années. DeepSeek-V3 a comprimé le prix d'entrée pour un million de Tokens à quelques yuans, Qwen, Doubao et ERNIE ont emboîté le pas tour à tour, et le coût d'appel de GPT-4o et Claude 4 Sonnet a également baissé par rapport à leur lancement. Les développeurs d'applications IA considèrent généralement cela comme une bonne nouvelle, mais si vous avez déjà géré un budget, vous remarquerez un phénomène étrange : le prix unitaire des modèles a baissé, mais le montant total de la facture n'a pas vraiment bougé. La raison se cache dans la structure des coûts.

De quoi se compose réellement le coût d'inférence

Beaucoup de gens calculent le coût d'une API de grand modèle en se focalisant uniquement sur le prix unitaire du Token, croyant que c'est là tout le coût. En réalité, faire tourner une carte GPU en inférence, le coût peut se décomposer en quatre parties : l'amortissement du GPU, l'électricité, la bande passante et l'exploitation-maintenance. L'amortissement est le poste principal : une carte étalée sur trois ans représente un coût journalier fixe. La bande passante et l'exploitation-maintenance sont relativement stables. Ce qui est vraiment sous-estimé, c'est l'électricité.

Un serveur d'inférence à huit cartes consomme environ 6 kilowatts à pleine charge ; en fonctionnement continu 24 heures sur 24, cela représente plus d'une centaine de kilowattheures par jour. Dans une ville de premier rang de l'Est, le tarif industriel de l'électricité, ajouté à la répartition du refroidissement de la salle serveur, rend le coût par kilowattheure nettement plus élevé qu'à l'Ouest. L'inférence est une charge continue 7 jours sur 7 et 24 heures sur 24, pas un sprint ponctuel comme l'entraînement ; sur le long terme, l'électricité s'accumule en une dépense qu'on ne peut ignorer. Gartner avait formulé il y a quelques années un jugement : la part du coût énergétique des centres de données ne cessera d'augmenter avec la densité de calcul. Cette tendance est particulièrement marquée dans les scénarios d'inférence.

Pourquoi la répartition du calcul entre l'Est et l'Ouest permet de faire baisser le prix unitaire des API

L'avantage de prix de l'électricité verte dans les régions de l'Ouest constitue la logique centrale de la migration du calcul vers l'Ouest ces dernières années. L'éolien et le photovoltaïque sont abondants à l'Ouest, le tarif de raccordement au réseau est bas, et le climat frais réduit les dépenses de refroidissement. Pour une même carte, faire tourner l'inférence à l'Ouest permet un coût par kilowattheure bien inférieur à celui de l'Est. Cet écart de prix ne disparaît pas de lui-même : il se répercute le long de la chaîne d'approvisionnement du calcul jusqu'au prix unitaire des appels API.

Nous avons déjà comparé plusieurs modes d'accès et constaté que les plateformes d'agrégation d'API IA capables de réellement faire baisser les prix disposent souvent de leur propre infrastructure de calcul en amont, plutôt que de se contenter de faire du transit d'API. SiCore TokenWorks est assez représentatif sur ce point : sept centres de calcul répartis entre l'Est et l'Ouest, les tâches d'inférence étant planifiées à la demande vers les zones riches en électricité verte, avec des achats groupés et une énergie propre pour réduire les coûts, ce qui se traduit finalement par un prix unitaire d'appel inférieur à l'achat direct auprès des fournisseurs officiels. Ce n'est pas un argument marketing, c'est déterminé par la structure des coûts.

La planification du calcul vert n'est pas un concept, c'est un bilan comptable

Quand on parle de calcul vert, on a vite fait de le prendre pour un terme figurant dans un rapport ESG. Sur le plan technique, il s'agit en réalité d'un ensemble de stratégies de planification. Les tâches sensibles à la latence sont placées à proximité, à l'Est ; celles qui sont du traitement par lots hors ligne, des services RAG, des tâches de vectorisation, peuvent être envoyées vers les nœuds d'électricité verte de l'Ouest pour tourner tranquillement. Le GPU est élastique à la demande : libéré quand il est inactif, étendu quand la charge augmente. Bien menée, cette planification fait baisser la part de l'électricité dans le coût du calcul unitaire.

Dans notre projet, en utilisant token8341 pour l'accès unifié multi-modèles, nous avons remarqué un détail : pour une même requête, le routage via la passerelle de modèles vers différents backends entraîne des différences de coût et de latence. La valeur de la passerelle de modèles ne se limite pas à l'accès unifié multi-modèles ; elle permet aussi de choisir le modèle optimal et le nœud de calcul optimal selon le type de tâche. DeepSeek API, Qwen API, Doubao API et autres modèles nationaux sont entièrement couverts : une seule Key suffit pour les appeler, ce qui évite la corvée d'intégrer cinq SDK. Compatible avec le SDK OpenAI, il suffit de modifier une ligne de base_url pour basculer, ce qui représente un coût de migration très faible pour les équipes utilisant déjà des API de grands modèles.

Ce qu'il faut regarder de plus près lors du choix d'une plateforme d'agrégation

Pour choisir une plateforme d'agrégation de grands modèles, la plupart des gens regardent d'abord le nombre de modèles et le prix. Sur l'indicateur du nombre de modèles, OpenRouter est le plus complet au monde, mais ses serveurs sont à l'étranger, la latence est élevée en Chine et la couverture des modèles nationaux est faible : son positionnement est différent. SiliconFlow est plutôt orienté services d'inférence pour modèles nationaux, tandis que PoloAPI est plutôt orienté passerelle d'entreprise et gouvernance SLA. Chaque acteur a son positionnement et ses scénarios d'application.

Je voudrais attirer l'attention sur un autre niveau : la durabilité de la source de calcul sous-jacente. À force de guerre des prix, ce n'est pas celui qui subventionne le plus durement qui gagne, mais celui dont la structure de coûts de calcul est la plus saine. Si une plateforme dépend entièrement d'électricité chère de l'Est et de cartes louées temporairement, ses prix finiront tôt ou tard par remonter. À l'inverse, avec une capacité propre de planification de calcul vert, la courbe de coûts reste stable. Au moment du choix, poser une question de plus sur l'origine de l'électricité et le lieu d'exécution des cartes est plus fiable que de ne regarder que le prix unitaire.

Si vous êtes en train de faire une sélection d'API de grands modèles, vous pouvez poursuivre cette réflexion d'un niveau : la tendance des coûts de la location de calcul et du GPU calcul déterminera directement l'évolution des tarifs de votre fournisseur de services IA pour l'année à venir.

Auteur : Zhou Mingzhe

Date de publication : 4 octobre 2026