SiCore TokenWorks
LLM APIAPI GatewayAggregation

Green AI: LLM-Inferenz mit sauberer Energie betreiben

SiCore TokenWorks Team·2026-09-03

Die CO2-Geschichte der KI dreht sich normalerweise um das Training. Das ist verständlich: Ein einzelner großer Trainingslauf kann über Wochen hinweg Megawattstunden verbrauchen. Doch das Training findet einmal statt. Die Inferenz findet jedes Mal statt, wenn jemand das Modell etwas fragt – für immer, über Millionen von Nutzern hinweg. Die Energie, die sich tatsächlich kumuliert, ist die Energie des Servings.

Für einen API-Nutzer bedeutet das, dass die Grüne Qualität Ihrer LLM-Nutzung größtenteils von etwas entschieden wird, das Sie nicht direkt kontrollieren: wo die GPUs des Anbieters stehen und womit sie betrieben werden. Sie können jedoch einen Anbieter genau danach auswählen.

Warum Inferenzenergie eine Rechenzentrums-Geschichte ist

Eine Inferenz-Workload ist ein GPU-Cluster, das in einem Rechenzentrum läuft. Zwei Dinge dominieren seinen Fußabdruck:

Das Stromnetz, an das es angeschlossen ist. Eine GPU, die 700 Watt zieht, bezieht Strom, der so sauber oder schmutzig ist wie der regionale Strommix. Ein Rechenzentrum in einer Region mit viel Wind- und Solarenergie emittiert pro Token weit weniger CO2 als dieselbe Hardware an einem kohlelastigen Netz – selbst wenn alles andere identisch ist.

Kühlung. Server verwandeln Strom in Wärme, und diese Wärme abzuführen kostet weiteren Strom. Das misst PUE (Power Usage Effectiveness): die gesamte Anlagenleistung geteilt durch die Leistung, die die IT-Geräte erreicht. Ein PUE von 1,5 bedeutet, dass die Anlage 50 % zusätzliche Energie über den Serververbrauch hinaus nutzt. Eine gut konzipierte moderne Anlage liegt eher bei 1,1 bis 1,2. Kühles, trockenes Klima senkt die Kühlkosten drastisch – ein wichtiger Grund, warum Rechenzentren immer wieder in kalten Binnenregionen statt in Stadtzentren entstehen.

Wo günstige saubere Energie tatsächlich zu finden ist

Die Orte mit der besten Ökostrom-Ökonomie für Compute sind nicht die offensichtlichen Tech-Hubs. Es sind tendenziell Binnenregionen mit starken Wind- und Solarressourcen und einem trockenen, kühlen Klima:

•Innere Mongolei (Horinger). Eine der größten Windkraftbasen Chinas. Kalte Winter bedeuten, dass über weite Teile des Jahres wenig oder gar keine mechanische Kühlung nötig ist.

•Xinjiang (Hami). Sehr hohe Sonneneinstrahlung und stetiger Wind. Abgelegen, aber abgelegen ist in Ordnung, wenn Ihre Workload ein GPU-Cluster ist, das Sie remote steuern.

•Ningxia (Zhongwei). Bereits eine etablierte Rechenzentrumsregion mit Solar- und Windkraft in Versorgungsmaßstab; hier befindet sich eine der großen internationalen Cloud-Regionen, was zeigt, dass die Ökonomie im großen Maßstab funktioniert.

Das Muster ist in allen drei Fällen dasselbe: reichlich erneuerbare Erzeugung, ein kühles trockenes Klima, das den PUE senkt, und Land, das günstig genug ist, um die Umspannwerke und Solarfelder zu bauen, die die Racks versorgen.

Nichts davon ist exotische Technologie. Es ist Standortwahl. Das Grünste, was ein Compute-Anbieter tun kann, ist, seine Hardware dorthin zu stellen, wo das Netz bereits sauber ist und das Klima die Hälfte der Kühlung kostenlos übernimmt.

Was „grüne" Behauptungen Ihnen tatsächlich sagen sollten

Hier werde ich skeptisch. „Grün" ist ein Marketingwort, solange niemand Ihnen Zahlen liefert. Wenn ein Anbieter eine Ökostrom-Behauptung aufstellt, lohnt es sich, drei Dinge zu verlangen:

•PUE. Wenn er ihn nicht veröffentlicht, behandeln Sie die Behauptung als nicht überprüfbar.

•Den tatsächlichen Netzstrommix der Region, in der das Rechenzentrum steht. Ein Anbieter, der lediglich Herkunftsnachweise für erneuerbare Energie kauft, während er an einem fossilen Netz läuft, betreibt kein grünes Rechenzentrum. Der Standort ist die Offenlegung.

•Ob die erneuerbaren Energien echte Kapazität sind und nicht Kompensationen. Neu gebaute Wind- und Solarkraft, die die Anlage versorgt, ist eine andere Aussage als der Kauf von Zertifikaten anderswo.

Ehrliche Anbieter nennen Ihnen die Region und die Eigenschaften der Anlage. Wenn die Antwort lautet: „Unsere Rechenzentren stehen in der Inneren Mongolei, in Xinjiang und Ningxia, an Netzen mit hohem Anteil erneuerbarer Energien, in kühlen Klimazonen", dann ist das eine konkrete, überprüfbare Aussage. Wenn die Antwort ein Slogan ist, gehen Sie weiter.

Was Sie tatsächlich dagegen tun können

Sie werden nicht das Umspannwerk eines Anbieters prüfen. Aber Sie können ein paar Entscheidungen treffen, die Ihren eigenen Fußabdruck verändern:

•Wählen Sie Anbieter, die Standort und PUE offenlegen, nicht solche, die einfach „klimaneutral" auf die Seite drucken.

•Nutzen Sie kleinere Modelle, wo die Aufgabe es erlaubt. Ein 7B-Modell kann eine Support-Frage fast so gut beantworten wie ein 175B-Modell – bei einem Bruchteil der Energie. Leichten Traffic an ein kleines Modell zu routen, ist der größte CO2-Hebel, den Sie kontrollieren.

•Cachen Sie aggressiv. Prompt-Caching verwandelt wiederholte Eingaben in einmalige Kosten und senkt sowohl Latenz als auch Energie für repetitive Workloads.

•Batchen Sie, wenn möglich. Weniger, größere Anfragen schlagen viele winzige bei der Serverauslastung.

Die ehrliche Einordnung ist, dass Sie sich nicht per Tabellenkalkulation zu einem sauberen Fußabdruck messen können, weil der Netzstrommix nicht in Ihren Daten steht. Was Sie tun können, ist, Anbieter zu wählen, deren Infrastruktur den Fußabdruck by design kleiner macht, und aufzuhören, triviale Anfragen an das größte Modell zu routen, das Sie sich leisten können.

Das ist die Position, die SiCore TokenWorks einnimmt: Seine drei Compute-Zentren stehen in Horinger in der Inneren Mongolei, Hami in Xinjiang und Zhongwei in Ningxia – Regionen, die wegen ihres hohen Anteils erneuerbarer Energien und ihres kühlen Klimas ausgewählt wurden, das den PUE niedrig hält. Wenn Ihnen die Energie hinter Ihren API-Aufrufen wichtig ist, dann ist diese Art der Offenlegung wichtiger als ein Abzeichen.