L'histoire carbone de l'IA se concentre généralement sur l'entraînement. C'est compréhensible : une seule grande session d'entraînement peut consommer des mégawattheures pendant des semaines. Mais l'entraînement n'a lieu qu'une fois. L'inférence a lieu chaque fois que quelqu'un demande quelque chose au modèle, pour toujours, à travers des millions d'utilisateurs. L'énergie qui s'accumule réellement, c'est celle du service.
Pour un consommateur d'API, cela signifie que le caractère vert de votre utilisation de LLM est principalement déterminé par quelque chose que vous ne contrôlez pas directement : l'endroit où se trouvent les GPU du fournisseur et ce qui les alimente. Vous pouvez toutefois choisir un fournisseur en fonction de cela.
Pourquoi l'énergie d'inférence est une histoire de centre de données
Une charge de travail d'inférence, c'est un cluster de GPU fonctionnant dans un centre de données. Deux éléments dominent son empreinte :
Le réseau électrique auquel il est raccordé. Un GPU tirant 700 watts consomme une électricité aussi propre ou sale que le mix électrique régional. Un centre de données situé dans une région à forte production éolienne et solaire émet bien moins de carbone par token que le même matériel sur un réseau à forte composante charbonnière, même si tout le reste est identique.
Le refroidissement. Les serveurs transforment l'électricité en chaleur, et évacuer cette chaleur consomme davantage d'électricité. C'est ce que mesure le PUE (power usage effectiveness) : la puissance totale de l'installation divisée par la puissance qui parvient aux équipements informatiques. Un PUE de 1,5 signifie que l'installation utilise 50 % d'énergie en plus de ce que consomment les serveurs. Une installation moderne bien conçue tourne plutôt entre 1,1 et 1,2. Les climats frais et secs réduisent considérablement le coût de refroidissement, ce qui explique en grande partie pourquoi les centres de données continuent d'apparaître dans des régions intérieures froides plutôt qu'au centre des villes.
Où se trouve réellement l'énergie propre bon marché
Les endroits offrant la meilleure économie d'énergie propre pour le calcul ne sont pas les pôles technologiques évidents. Il s'agit généralement de régions intérieures dotées de fortes ressources éoliennes et solaires et d'un climat sec et frais :
•Mongolie-Intérieure (Horinger). L'une des plus grandes bases d'énergie éolienne de Chine. Les hivers froids signifient que, pendant une grande partie de l'année, le refroidissement mécanique est minime, voire inexistant.
•Xinjiang (Hami). Très forte irradiation solaire et vent régulier. Isolé, mais l'isolement n'est pas un problème quand votre charge de travail est un cluster de GPU que vous contrôlez à distance.
•Ningxia (Zhongwei). Déjà une région établie de centres de données avec du solaire et de l'éolien à l'échelle des services publics ; elle héberge l'une des principales régions cloud internationales, ce qui montre que l'économie fonctionne à grande échelle.
Le schéma est le même dans les trois cas : production renouvelable abondante, climat frais et sec qui abaisse le PUE, et un foncier suffisamment bon marché pour construire les sous-stations et les champs solaires qui alimentent les baies.
Rien de tout cela n'est une technologie exotique. C'est une question d'implantation. La chose la plus verte qu'un fournisseur de calcul puisse faire est de placer son matériel là où le réseau est déjà propre et où le climat assure la moitié du refroidissement gratuitement.
Ce que les allégations « vertes » devraient réellement vous dire
C'est là que je deviens sceptique. « Vert » est un mot marketing tant que personne ne vous donne de chiffres. Quand un fournisseur avance une allégation d'énergie propre, trois choses méritent d'être demandées :
•Le PUE. S'il ne le publie pas, considérez l'allégation comme invérifiable.
•Le mix électrique réel de la région où se situe le centre de données. Un fournisseur qui se contente d'acheter des certificats d'énergie renouvelable tout en fonctionnant sur un réseau fossile ne fonctionne pas au vert. L'emplacement, c'est la divulgation.
•Si les renouvelables sont une capacité réelle, et non des compensations. De nouveaux parcs éoliens et solaires construits pour alimenter l'installation, c'est une allégation différente de l'achat de crédits ailleurs.
Les fournisseurs honnêtes vous donneront la région et les caractéristiques de l'installation. Si la réponse est « nos centres de données se trouvent en Mongolie-Intérieure, au Xinjiang et au Ningxia, sur des réseaux à forte pénétration renouvelable, dans des climats frais », c'est une déclaration concrète et vérifiable. Si la réponse est un slogan, passez votre chemin.
Ce que vous pouvez réellement faire à ce sujet
Vous n'allez pas auditer la sous-station d'un fournisseur. Mais vous pouvez prendre quelques décisions qui orientent votre propre empreinte :
•Choisissez des fournisseurs qui divulguent leur emplacement et leur PUE, pas ceux qui se contentent d'afficher « neutre en carbone » sur leur page.
•Utilisez des modèles plus petits lorsque la tâche le permet. Un modèle 7B peut répondre à une question de support presque aussi bien qu'un modèle 175B pour une fraction de l'énergie. Router le trafic facile vers un petit modèle est le levier carbone le plus important que vous contrôlez.
•Mettez en cache de manière agressive. La mise en cache des prompts transforme une entrée répétée en un coût unique, réduisant à la fois la latence et l'énergie pour les charges de travail répétitives.
•Traitez par lots quand c'est possible. Moins de requêtes plus volumineuses l'emportent sur beaucoup de minuscules en termes d'utilisation des serveurs.
La formulation honnête est que vous ne pouvez pas mesurer votre chemin vers une empreinte propre avec un tableur, car le mix électrique ne figure pas dans vos données. Ce que vous pouvez faire, c'est choisir des fournisseurs dont l'infrastructure réduit l'empreinte par conception, et cesser de router des requêtes triviales vers le plus grand modèle que vous pouvez vous permettre.
C'est la position que défend SiCore TokenWorks : ses trois centres de calcul se trouvent à Horinger en Mongolie-Intérieure, à Hami au Xinjiang et à Zhongwei au Ningxia, des régions choisies pour leur forte pénétration renouvelable et leurs climats frais qui maintiennent un PUE bas. Si l'énergie derrière vos appels API vous importe, c'est le genre de divulgation qui compte plus qu'un badge.