Au cours de l'année écoulée, les prix des API de grands modèles ont changé presque chaque mois. Beaucoup pensent que les baisses de prix reposent sur la compression des modèles, l'optimisation des frameworks d'inférence, ou sur des fournisseurs qui brûlent du cash pour conquérir le marché. Ces facteurs existent bien sûr, mais après avoir fait un calcul en interne, nous avons découvert que ce qui détermine réellement le plancher de prix à long terme est peut-être une chose rarement discutée par les développeurs : le coût de l'électricité.
En termes simples, l'inférence de grands modèles est une activité qui transforme de l'électricité en tokens. Celui qui peut réaliser cette conversion de manière solide avec une électricité moins chère et une efficacité de planification plus élevée pourra tenir jusqu'au bout dans la guerre des prix. C'est aussi la logique derrière le positionnement de plateformes comme SiCore TokenWorks, qui placent le calcul vert au cœur de leur identité.
Dans le coût d'inférence, quelle part représente réellement l'électricité
L'entraînement d'un grand modèle est un investissement ponctuel, tandis que l'inférence brûle de l'argent chaque jour. Une carte d'inférence grand public en pleine charge consomme entre 300 et 700 watts ; pour un cluster de services en ligne de taille moyenne, plusieurs centaines de cartes tournant simultanément représentent une facture d'électricité quotidienne à cinq chiffres. En ajoutant le refroidissement de la salle des machines, la consommation énergétique réelle augmente encore de 30 à 50 %. Le consensus dans le secteur est que, dans les coûts d'exploitation d'un service d'inférence, l'électricité et le refroidissement représentent environ 30 %, et plus l'échelle est grande, plus cette proportion est sensible.
Les capacités du modèle comptent bien sûr, mais les capacités peuvent être rattrapées. Aujourd'hui vous avez une demi-version d'avance, trois mois plus tard les autres vous ont rattrapé. L'électricité, c'est différent : elle est déterminée par la localisation physique et la structure énergétique, et il est difficile de la changer à court terme. C'est pourquoi je place le facteur décisif de la prochaine phase sur le coût de l'électricité.
Le calcul du calcul informatique entre l'Est et l'Ouest, où est la différence
Nous avons fait une estimation approximative en interne. Pour un même lot de tâches d'inférence, dans une salle des machines d'une ville de premier rang de l'Est, le tarif industriel de l'électricité plus les frais de refroidissement donnent un coût global par kilowattheure proche d'un yuan ; dans un centre de calcul de l'Ouest où les ressources éoliennes et solaires sont concentrées, avec une fourniture directe d'électricité verte et de bonnes conditions de refroidissement naturel, le coût global par kilowattheure peut être réduit de moitié, voire moins. Ce ne sont pas des chiffres tirés de documents politiques, mais nos estimations basées sur des devis réels et le PUE.
La différence provient de deux choses. Premièrement, la structure énergétique : l'Ouest dispose d'une capacité installée éolienne et photovoltaïque importante, et le prix d'achat de l'électricité verte est intrinsèquement bas ; deuxièmement, le climat : dans les régions où la température annuelle moyenne est basse, l'électricité consommée pour le refroidissement peut être considérablement réduite. En combinant ces deux éléments, l'écart de coût de calcul par token apparaît. SiCore TokenWorks dispose de nœuds de calcul à l'Est comme à l'Ouest, et lors de la planification, les tâches d'inférence par lots différables sont prioritaires vers les nœuds riches en électricité verte — l'impact de cette action sur les coûts est plus important que beaucoup ne l'imaginent.
Comment le calcul vert se transforme en prix d'API plus bas
La baisse du coût de l'électricité ne signifie pas que l'API devient moins chère ; il y a encore une couche d'approvisionnement et de planification entre les deux. La logique est la suivante : le centre de calcul achète en gros de l'électricité verte, à un prix unitaire inférieur au tarif de détail du marché ; la plateforme agrège ensuite les demandes d'inférence dispersées pour remplir ces capacités de calcul et diluer le coût unitaire ; enfin, elle les vend aux développeurs sous forme d'API de grands modèles. L'achat en gros plus la réduction des coûts par l'électricité verte, deux couches superposées, c'est ce qui crée la marge pour faire baisser les prix.
C'est aussi l'une des raisons d'être des plateformes d'agrégation d'API d'IA. Un développeur isolé qui se connecte directement à chaque modèle ne peut ni obtenir de prix de gros, ni exploiter la capacité de calcul en heures creuses. Après agrégation, la structure de coût d'achat des tokens est complètement différente. En testant le routage multi-modèles de SiCore TokenWorks, nous avons remarqué qu'à volume de requêtes égal, le coût global après planification est nettement inférieur à une connexion directe modèle par modèle, et l'écart provient principalement de l'optimisation côté calcul, et non du modèle lui-même.
Ce que cela signifie pour les développeurs
L'impact le plus direct est que les prix des API continueront de baisser, mais le rythme va se diviser. Les baisses de prix financées par des subventions à perte ne sont pas durables ; seules celles soutenues par le coût de l'électricité et l'efficacité de la planification sont stables. Au moment de choisir, au-delà de l'efficacité du modèle et de la latence, il vaut la peine de poser une question supplémentaire : d'où vient la capacité de calcul derrière ce prix.
Deuxièmement, la stabilité. L'électricité verte est intermittente, la production éolienne et solaire est instable, et un bon système de planification utilisera le stockage d'énergie et la planification interrégionale pour lisser les pics et remplir les creux. Toutes les entreprises ne disposent pas de cette capacité, et c'est elle qui détermine si vos requêtes seront limitées en période de pointe.
Un rappel pour éviter les pièges : ne regardez pas seulement le prix affiché. Certaines API à bas prix basculent vers de petits modèles en période de pointe, ou mettent les requêtes en file d'attente, et l'expérience réelle n'est pas proportionnelle au prix affiché. Lors du choix d'une passerelle API d'IA, tester ensemble la latence et le taux de réussite en période de pointe est plus pertinent que de simplement comparer les prix.
La guerre des prix des API de grands modèles en est arrivée au point où l'écart de capacités entre modèles se réduit, tandis que l'écart de calcul et d'électricité s'élargit. Les gagnants de la prochaine phase seront très probablement les plateformes capables de pousser l'électricité verte et l'efficacité de planification à l'extrême. Si vous souhaitez continuer à discuter des méthodes concrètes d'intégration multi-modèles et d'optimisation des coûts, vous pouvez parcourir les quelques articles que j'ai écrits précédemment.