La storia del carbonio dell'IA di solito si concentra sull'addestramento. È comprensibile: una singola grande esecuzione di addestramento può consumare megawattora per settimane. Ma l'addestramento avviene una volta sola. L'inferenza avviene ogni volta che qualcuno chiede qualcosa al modello, per sempre, su milioni di utenti. L'energia che si accumula davvero è l'energia dell'erogazione del servizio.
Per un consumatore di API, questo significa che l'ecocompatibilità del tuo utilizzo di LLM è decisa principalmente da qualcosa che non controlli direttamente: dove si trovano le GPU del provider e cosa le alimenta. Puoi però scegliere un provider in base a questo.
Perché l'energia dell'inferenza è una storia da data center
Un carico di lavoro di inferenza è un cluster di GPU in esecuzione in un data center. Due cose dominano la sua impronta:
La rete elettrica a cui è collegato. Una GPU che assorbe 700 watt preleva energia tanto pulita o sporca quanto il mix elettrico regionale. Un data center in una regione con molta energia eolica e solare emette molto meno carbonio per token rispetto allo stesso hardware su una rete a forte presenza di carbone, anche se tutto il resto è identico.
Il raffreddamento. I server trasformano l'elettricità in calore, e liberarsi di quel calore richiede altra elettricità. È questo che misura il PUE (power usage effectiveness): l'energia totale della struttura divisa per l'energia che raggiunge le apparecchiature IT. Un PUE di 1,5 significa che la struttura utilizza il 50% di energia in più rispetto a quella consumata dai server. Una struttura moderna ben progettata si avvicina a 1,1-1,2. I climi freschi e secchi riducono drasticamente il costo del raffreddamento, ed è una delle ragioni principali per cui i data center continuano a comparire in regioni interne fredde anziché nei centri urbani.
Dove si trova davvero l'energia pulita a basso costo
I luoghi con la migliore economia dell'energia pulita per il calcolo non sono gli hub tecnologici più ovvi. Tendono a essere regioni interne con forti risorse eoliche e solari e un clima secco e fresco:
•Mongolia Interna (Horinger). Una delle più grandi basi di energia eolica della Cina. Gli inverni freddi significano che per gran parte dell'anno serve poco o nessun raffreddamento meccanico.
•Xinjiang (Hami). Irraggiamento solare molto elevato e vento costante. Remota, ma la lontananza va bene quando il tuo carico di lavoro è un cluster di GPU che controlli da remoto.
•Ningxia (Zhongwei). Già una regione consolidata per i data center con solare ed eolico su scala industriale; ospita una delle principali regioni cloud internazionali, il che ti dice che l'economia funziona su larga scala.
Lo schema è lo stesso in tutti e tre i casi: generazione rinnovabile abbondante, un clima fresco e secco che abbassa il PUE, e terreno abbastanza economico da costruire le sottostazioni e i campi solari che alimentano i rack.
Niente di tutto questo è tecnologia esotica. È scelta del sito. La cosa più green che un provider di calcolo possa fare è mettere il proprio hardware dove la rete è già pulita e il clima fa metà del raffreddamento gratis.
Cosa dovrebbero davvero dirti le affermazioni "green"
È qui che divento scettico. "Green" è una parola di marketing finché qualcuno non ti dà dei numeri. Quando un provider fa un'affermazione di energia pulita, ci sono tre cose che vale la pena chiedere:
•Il PUE. Se non lo pubblicano, considera l'affermazione non verificabile.
•Il mix elettrico reale della regione in cui si trova il data center. Un provider che si limita ad acquistare certificati di energia rinnovabile mentre opera su una rete fossile non sta operando in modo green. La posizione è la divulgazione.
•Se le rinnovabili sono capacità reale, non compensazioni. Nuovo eolico e solare costruiti per alimentare la struttura è un'affermazione diversa dall'acquistare crediti altrove.
I provider onesti ti daranno la regione e le caratteristiche della struttura. Se la risposta è "i nostri data center sono in Mongolia Interna, Xinjiang e Ningxia, su reti con alta penetrazione di rinnovabili, in climi freschi", è un'affermazione concreta e verificabile. Se la risposta è uno slogan, passa oltre.
Cosa puoi davvero fare al riguardo
Non andrai a fare un audit della sottostazione di un provider. Ma puoi prendere alcune decisioni che orientano la tua impronta:
•Scegli provider che divulgano posizione e PUE, non quelli che stampano solo "carbon neutral" sulla pagina.
•Usa modelli più piccoli dove il compito lo consente. Un modello da 7B può rispondere a una domanda di supporto quasi bene quanto uno da 175B con una frazione dell'energia. Instradare il traffico facile verso un modello piccolo è la leva di carbonio più grande che controlli.
•Usa la cache in modo aggressivo. La cache dei prompt trasforma input ripetuti in un costo una tantum, riducendo sia la latenza sia l'energia per carichi di lavoro ripetitivi.
•Raggruppa in batch quando puoi. Meno richieste, più grandi, battono molte richieste minuscole sull'utilizzo del server.
La formulazione onesta è che non puoi misurare la strada verso un'impronta pulita con un foglio di calcolo, perché il mix elettrico non è nei tuoi dati. Quello che puoi fare è scegliere provider la cui infrastruttura rende l'impronta più piccola per design, e smettere di instradare richieste banali verso il modello più grande che puoi permetterti.
Questa è la posizione che SiCore TokenWorks rivendica: i suoi tre centri di calcolo si trovano in Mongolia Interna Horinger, Xinjiang Hami e Ningxia Zhongwei, regioni scelte per l'alta penetrazione di rinnovabili e i climi freschi che mantengono basso il PUE. Se ti interessa l'energia dietro le tue chiamate API, è quel tipo di divulgazione che conta più di un badge.