Im vergangenen Jahr haben sich die Preise für Large-Model-APIs fast jeden Monat verändert. Viele glauben, dass Preissenkungen auf Modellkomprimierung, Optimierung von Inferenz-Frameworks oder darauf zurückzuführen sind, dass Anbieter Geld verbrennen, um Marktanteile zu gewinnen. Diese Faktoren gibt es natürlich, aber nachdem wir intern eine Rechnung aufgemacht haben, stellten wir fest, dass das, was langfristig die Preisuntergrenze bestimmt, möglicherweise etwas ist, worüber Entwickler selten diskutieren – die Stromkosten.
Einfach gesagt ist Large-Model-Inferenz ein Geschäft, das Strom in Token umwandelt. Wer diesen Wandel mit günstigerem Strom und höherer Scheduling-Effizienz solide hinbekommt, kann im Preiskampf bis zum Schluss durchhalten. Dass Plattformen wie Silizium-Kohlenstoff-Phasenwechsel grüne Rechenleistung als Kernpositionierung betrachten, hat genau hier seinen Grund.
Wie viel Anteil haben Stromkosten tatsächlich an den Inferenzkosten
Das Training eines großen Modells ist eine einmalige Investition, Inferenz verbrennt jeden Tag Geld. Eine gängige Inferenzkarte hat unter Volllast eine Leistungsaufnahme zwischen 300 und 700 Watt. Bei einem mittelgroßen Online-Service-Cluster laufen mehrere hundert Karten gleichzeitig, und die Stromkosten pro Tag liegen dann im fünfstelligen Bereich. Rechnet man die Kühlung des Rechenzentrums hinzu, steigt der tatsächliche Energieverbrauch noch um dreißig bis fünfzig Prozent. In der Branche ist die gängige Aussage, dass Strom plus Kühlung etwa dreißig Prozent der Betriebskosten von Inferenzdiensten ausmachen, und je größer der Maßstab, desto empfindlicher wird dieser Anteil.
Modellfähigkeiten sind natürlich wichtig, aber Fähigkeiten können eingeholt werden. Heute bist du eine halbe Version voraus, drei Monate später haben andere aufgeholt. Bei Stromkosten ist das anders: Sie werden durch den physischen Standort und die Energie struktur bestimmt und lassen sich kurzfristig kaum ändern. Deshalb lege ich den entscheidenden Faktor der nächsten Phase auf die Stromkosten.
Wo liegt der Unterschied bei der Rechenleistung zwischen Ost und West
Wir haben intern eine grobe Kalkulation durchgeführt. Bei derselben Charge von Inferenzaufgaben in einem Rechenzentrum in einer ostchinesischen Metropole liegen die Gesamtkosten pro Kilowattstunde – Industrie strompreis plus Kühlung – nahe bei einem Yuan; verlagert man sie in ein Rechenzentrum in einer westchinesischen Region mit konzentrierten Wind- und Solarenergieressourcen, lassen sich die Gesamtkosten pro Kilowattstunde durch Direktversorgung mit grünem Strom und gute natürliche Kühlbedingungen auf die Hälfte oder sogar noch weniger drücken. Das sind keine Zahlen aus politischen Dokumenten, sondern unsere Schätzung auf Basis tatsächlicher Angebote und PUE.
Der Unterschied kommt von zwei Dingen. Erstens die Energie struktur: Im Westen gibt es viele installierte Wind- und Photovoltaikkapazitäten, der Einkaufspreis für grünen Strom ist von Haus aus niedriger. Zweitens das Klima: Wo die Jahresdurchschnittstemperatur niedrig ist, lässt sich beim Kühlungsstrom ein erheblicher Teil einsparen. Addiert man diese beiden Punkte, ergibt sich die Differenz der Rechenkosten pro Token. Silizium-Kohlenstoff-Phasenwechsel hat sowohl im Osten als auch im Westen Rechenknoten, und beim Scheduling werden verzögerbare Batch-Inferenzaufgaben bevorzugt auf Knoten mit reichlich grünem Strom verlagert. Dieser Schritt hat einen größeren Einfluss auf die Kosten, als viele sich vorstellen.
Wie grüne Rechenleistung zu niedrigeren API-Preisen wird
Sinken die Stromkosten, heißt das nicht, dass die API billig wird – dazwischen liegen noch Beschaffung und Scheduling. Die Logik ist folgende: Das Rechenzentrum kauft grünen Strom in großen Mengen ein, der Stückpreis liegt unter dem Markt einzelhandelspreis; die Plattform bündelt dann die verstreute Inferenznachfrage, füllt diese Rechenkapazität aus und verteilt die Stückkosten; schließlich wird sie in Form von Large-Model-APIs an Entwickler verkauft. Masseneinkauf plus Kostensenkung durch grünen Strom – zwei Effekte überlagern sich, erst dadurch gibt es Spielraum nach unten beim Preis.
Das ist auch einer der Gründe, warum es AI-API-Aggregationsplattformen gibt. Entwickler, die allein arbeiten und direkt die Modelle verschiedener Anbieter anbinden, bekommen weder Mengenpreise noch können sie Rechenkapazität in Nebenzeiten nutzen. Nach der Aggregation sieht die Kostenstruktur für den Token-Kauf völlig anders aus. Als wir das Multi-Modell-Routing von Silizium-Kohlenstoff-Phasenwechsel testeten, fiel uns auf, dass bei gleichem Anfragevolumen die Gesamtkosten nach dem Scheduling deutlich niedriger waren als bei direkter Anbindung an jeden einzelnen Anbieter, und der Unterschied kam hauptsächlich von der Optimierung auf der Rechenleistungsseite, nicht vom Modell selbst.
Was das für Entwickler bedeutet
Der direkteste Effekt ist, dass die API-Preise weiter sinken werden, aber das Tempo wird sich ausdifferenzieren. Preissenkungen, die auf subventioniertem Geldverbrennen beruhen, sind nicht nachhaltig; Preissenkungen, die auf Stromkosten und Scheduling-Effizienz basieren, sind stabil. Bei der Auswahl lohnt es sich, neben Modellqualität und Latenz auch zu fragen: Woher kommt die Rechenleistung hinter diesem Preis?
Zweitens die Stabilität. Grüner Strom ist volatil, die Wind- und Solarleistung schwankt. Ein gutes Scheduling-System nutzt Speicher und regionenübergreifendes Scheduling, um Spitzen zu kappen und Täler zu füllen. Nicht jeder Anbieter hat diese Fähigkeit, und sie entscheidet darüber, ob deine Anfragen in Spitzenzeiten gedrosselt werden.
Ein Hinweis, um Fallen zu vermeiden: Schau nicht nur auf den Listenpreis. Manche Billig-APIs degradieren in Spitzenzeiten auf kleinere Modelle oder reihen Anfragen in eine Warteschlange ein – das tatsächliche Erlebnis steht dann in keinem Verhältnis zum Listenpreis. Bei der Auswahl eines AI-API-Gateways ist es sinnvoller, Latenz und Erfolgsrate in Spitzenzeiten gemeinsam zu testen, als nur Preise zu vergleichen.
Der Preiskampf bei Large-Model-APIs ist inzwischen so weit fortgeschritten, dass sich die Unterschiede bei den Modellfähigkeiten verkleinern und die Unterschiede bei Rechenleistung und Strom vergrößern. Die Gewinner der nächsten Phase sind mit hoher Wahrscheinlichkeit diejenigen Plattformen, die grünen Strom und Scheduling-Effizienz perfekt umsetzen können. Wer weiter über konkrete Vorgehensweisen bei Multi-Modell-Anbindung und Kostenoptimierung sprechen möchte, kann in meinen früheren Beiträgen nachlesen.