Het koolstofverhaal van AI gaat meestal over training. Dat is begrijpelijk: één grote trainingsrun kan wekenlang megawattuur verbruiken. Maar training gebeurt één keer. Inferentie gebeurt elke keer dat iemand het model iets vraagt, voor altijd, over miljoenen gebruikers. De energie die zich daadwerkelijk opstapelt, is de energie van het serveren.
Voor een API-consument betekent dat dat de groenheid van je LLM-gebruik grotendeels wordt bepaald door iets wat je niet direct onder controle hebt: waar de GPU's van de provider staan en wat ze van stroom voorziet. Je kunt echter wel een provider op basis daarvan kiezen.
Waarom inferentie-energie een datacenterverhaal is
Een inferentieworkload is een GPU-cluster dat in een datacenter draait. Twee dingen domineren de voetafdruk:
Het stroomnet waarop het is aangesloten. Een GPU die 700 watt trekt, gebruikt stroom die even schoon of vuil is als de regionale elektriciteitsmix. Een datacenter in een regio met veel wind en zon stoot per token veel minder koolstof uit dan dezelfde hardware op een kolenintensief net, zelfs als al het andere identiek is.
Koeling. Servers zetten elektriciteit om in warmte, en het afvoeren van die warmte kost meer elektriciteit. Dat is wat PUE (power usage effectiveness) meet: het totale faciliteitsvermogen gedeeld door het vermogen dat de IT-apparatuur bereikt. Een PUE van 1,5 betekent dat de faciliteit 50% extra energie gebruikt bovenop wat de servers verbruiken. Een goed ontworpen moderne faciliteit zit dichter bij 1,1 tot 1,2. Koele, droge klimaten verlagen de koelingskosten drastisch, wat een belangrijke reden is waarom datacenters blijven opduiken in koude binnenlandse regio's in plaats van in stadscentra.
Waar goedkope schone stroom echt te vinden is
De plekken met de beste schone-energie-economie voor compute zijn niet de voor de hand liggende techhubs. Het zijn vaak binnenlandse regio's met sterke wind- en zonnebronnen en een droog, koel klimaat:
•Binnen-Mongolië (Horinger). Een van China's grootste windenergiebases. Koude winters betekenen dat een groot deel van het jaar weinig of geen mechanische koeling nodig is.
•Xinjiang (Hami). Zeer hoge zonne-instraling en gestage wind. Afgelegen, maar afgelegen is prima wanneer je workload een GPU-cluster is dat je op afstand beheert.
•Ningxia (Zhongwei). Al een gevestigde datacenterregio met grootschalige zon en wind; het herbergt een van de grote internationale cloudregio's, wat je vertelt dat de economie op schaal werkt.
Het patroon is in alle drie hetzelfde: overvloedige hernieuwbare opwekking, een koel droog klimaat dat de PUE verlaagt, en grond die goedkoop genoeg is om de onderstations en zonnevelden te bouwen die de racks voeden.
Niets hiervan is exotische technologie. Het is locatiekeuze. Het groenste wat een compute-provider kan doen, is zijn hardware plaatsen waar het net al schoon is en het klimaat de helft van de koeling gratis doet.
Wat "groene" claims je eigenlijk zouden moeten vertellen
Hier word ik sceptisch. "Groen" is een marketingwoord totdat iemand je cijfers geeft. Wanneer een provider een claim over schone energie doet, zijn er drie dingen die het waard zijn om op te vragen:
•PUE. Als ze die niet publiceren, behandel de claim dan als niet verifieerbaar.
•De werkelijke netmix van de regio waar het datacenter staat. Een provider die slechts hernieuwbare-energiecertificaten koopt terwijl hij op een fossiel net draait, draait niet groen. De locatie is de openbaarmaking.
•Of de hernieuwbare energie echte capaciteit is, geen compensaties. Nieuwe wind- en zonne-energie gebouwd om de faciliteit te voeden is een andere claim dan het kopen van kredieten elders.
Eerlijke providers geven je de regio en de faciliteitskenmerken. Als het antwoord is "onze datacenters staan in Binnen-Mongolië, Xinjiang en Ningxia, op netten met een hoog aandeel hernieuwbare energie, in koele klimaten", dan is dat een concrete, controleerbare uitspraak. Als het antwoord een slogan is, ga verder.
Wat je er daadwerkelijk aan kunt doen
Je gaat niet het onderstation van een provider auditen. Maar je kunt een paar beslissingen nemen die je eigen voetafdruk kantelen:
•Kies providers die locatie en PUE openbaar maken, niet degene die alleen "koolstofneutraal" op de pagina drukken.
•Gebruik kleinere modellen waar de taak het toelaat. Een 7B-model kan een supportvraag bijna net zo goed beantwoorden als een 175B-model, tegen een fractie van de energie. Gemakkelijk verkeer naar een klein model routeren is de grootste koolstofhefboom die je beheert.
•Cache agressief. Prompt-caching verandert herhaalde input in een eenmalige kost, wat zowel latentie als energie voor repetitieve workloads vermindert.
•Batch wanneer je kunt. Minder, grotere verzoeken verslaan veel kleine verzoeken op serverbenutting.
De eerlijke framing is dat je je niet naar een schone voetafdruk kunt rekenen met een spreadsheet, omdat de netmix niet in je data zit. Wat je kunt doen, is providers kiezen wier infrastructuur de voetafdruk by design kleiner maakt, en stoppen met het routeren van triviale verzoeken naar het grootste model dat je je kunt veroorloven.
Dat is het standpunt dat SiCore TokenWorks inneemt: de drie compute-centers staan in Binnen-Mongolië Horinger, Xinjiang Hami en Ningxia Zhongwei, regio's gekozen vanwege een hoog aandeel hernieuwbare energie en koele klimaten die de PUE laag houden. Als je geeft om de energie achter je API-calls, is dat het soort openbaarmaking dat er meer toe doet dan een badge.