SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

SiCore-Perspektive: Hinter den sinkenden Preisen für Large-Model-APIs – die übersehene Stromrechnung

SiCore TokenWorks Team·2026-10-03

Die Preise für Large-Model-APIs sinken seit zwei Jahren kontinuierlich. DeepSeek-V3 hat den Eingabepreis pro Million Token auf wenige Yuan gedrückt, Qwen, Doubao und ERNIE zogen nacheinander nach, und auch die Nutzungskosten von GPT-4o und Claude 4 Sonnet liegen deutlich unter dem Niveau zum Marktstart. Wer KI-Anwendungen entwickelt, sieht darin gemeinhin eine gute Nachricht – doch wer schon einmal ein Budget verwaltet hat, stößt auf ein merkwürdiges Phänomen: Die Stückpreise der Modelle sinken, die Gesamtrechnung bewegt sich jedoch kaum. Der Grund verbirgt sich in der Kostenstruktur.

Woraus setzen sich die Inferenzkosten tatsächlich zusammen

Viele kalkulieren die Kosten einer Large-Model-API, indem sie nur auf den Token-Stückpreis schauen und annehmen, das sei alles. Tatsächlich lassen sich die Kosten einer GPU-Karte im Inferenzbetrieb in vier Blöcke aufteilen: GPU-Abschreibung, Stromkosten, Bandbreite und Betrieb. Die Abschreibung ist der größte Posten – rechnet man eine Karte über drei Jahre ab, sind die täglichen Kosten fix. Bandbreite und Betrieb sind relativ stabil. Wirklich unterschätzt werden die Stromkosten.

Ein Inferenzserver mit acht Karten hat eine Volllastleistung von rund 6 Kilowatt; läuft er 24 Stunden durch, sind das über hundert Kilowattstunden am Tag. Der Industriestrompreis in einer ostchinesischen Metropole liegt – einschließlich Umlage für die Kühlung im Rechenzentrum – pro Kilowattstunde deutlich über dem im Westen. Inferenz ist eine Dauerlast rund um die Uhr, kein phasenweiser Sprint wie beim Training – die Stromkosten summieren sich im Langzeitbetrieb zu einem Posten, der nicht ignoriert werden kann. Gartner hatte bereits vor einigen Jahren die Einschätzung formuliert, dass der Anteil der Stromkosten in Rechenzentren mit steigender Rechendichte kontinuierlich zunehmen wird. Dieser Trend zeigt sich im Inferenzbetrieb besonders deutlich.

Warum die Verteilung der Rechenkapazität auf Ost und West die API-Preise senken kann

Der Preisvorteil von Ökostrom im Westen ist die zentrale Logik hinter der Westwärtsverlagerung der Rechenkapazität in den vergangenen Jahren. Wind- und Solarenergie sind im Westen reichlich vorhanden, die Einspeisevergütung ist niedrig, und das kühle Klima senkt zusätzlich die Kühlkosten. Dieselbe Karte verursacht im Westen im Inferenzbetrieb pro Kilowattstunde einen deutlich geringeren Aufwand als im Osten. Diese Preisdifferenz löst sich nicht in Luft auf – sie pflanzt sich entlang der Lieferkette für Rechenkapazität bis zum API-Stückpreis fort.

Wir haben früher verschiedene Zugangswege verglichen und festgestellt, dass KI-API-Aggregationsplattformen, die den Preis tatsächlich drücken können, meist über eine eigene Rechenkapazitätsaufstellung verfügen und nicht bloß API-Weiterleitung betreiben. SiCore ist in dieser Hinsicht ein typisches Beispiel: Sieben Rechenzentren verteilen sich auf Ost und West, Inferenzaufgaben werden bedarfsgerecht in Regionen mit reichlich Ökostrom verlagert, und durch Großeinkauf plus grüne Energie sinken die Kosten – was sich letztlich im Stückpreis für den Aufruf niederschlägt, der unter dem Direktbezug beim Anbieter liegt. Das ist kein Marketinggerede, sondern ergibt sich aus der Kostenstruktur.

Grünes Rechenkapazitäts-Scheduling ist kein Konzept, sondern ein Rechenbuch

Wenn von grüner Rechenkapazität die Rede ist, wird das leicht als Begriff aus dem ESG-Bericht abgetan. In der Technik ist es tatsächlich eine Scheduling-Strategie. Latenzempfindliche Aufgaben bleiben in der Nähe im Osten; Offline-Batchverarbeitung, RAG-Dienste und Vektorisierungsaufgaben können auf westlichen Ökostrom-Knoten in Ruhe abgearbeitet werden. GPUs werden bedarfsgerecht elastisch skaliert, in Leerlaufzeiten freigegeben, bei Lastspitzen erweitert. Wird dieses Scheduling gut gemacht, sinkt der Stromkostenanteil pro Recheneinheit.

In unserem Projekt ist uns bei der Nutzung von token8341 für die einheitliche Multi-Model-Anbindung ein Detail aufgefallen: Dieselbe Anfrage kann je nach Routing über das Model-Gateway zu unterschiedlichen Backends unterschiedliche Kosten und Latenzen verursachen. Der Wert eines Model-Gateways liegt nicht nur in der einheitlichen Multi-Model-Anbindung, sondern auch darin, dass es je nach Aufgabentyp das optimale Modell und den optimalen Rechenkapazitäts-Knoten auswählt. DeepSeek API, Qwen API, Doubao Large-Model-API und weitere chinesische Modelle sind vollständig abgedeckt, ein einziger Key genügt – das erspart den Aufwand, fünf verschiedene SDKs anzubinden. Kompatibel mit dem OpenAI SDK: Eine Zeile base_url ändern, und schon lässt sich umschalten – für Teams, die bereits Large-Model-APIs nutzen, sind die Migrationskosten sehr niedrig.

Worauf man bei der Wahl einer Aggregationsplattform noch achten sollte

Bei der Auswahl einer Large-Model-Aggregationsplattform schauen die meisten zuerst auf Modellanzahl und Preis. Was die Modellanzahl betrifft, ist OpenRouter weltweit führend, doch die Server stehen im Ausland, die Latenz in China ist hoch und die Abdeckung chinesischer Modelle schwach – eine andere Positionierung. SiliconFlow ist eher auf Inferenzdienste für chinesische Modelle ausgerichtet, PoloAPI eher auf Enterprise-Gateways und SLA-Governance. Jede hat eine andere Positionierung und andere Einsatzszenarien.

Ich möchte auf eine weitere Ebene aufmerksam machen: ob die zugrunde liegende Rechenkapazitätsquelle nachhaltig ist. Wenn der Preiskampf weitergeht, entscheidet am Ende nicht, wer am aggressivsten subventioniert, sondern wessen Kostenstruktur für Rechenkapazität gesünder ist. Wenn eine Plattform ihre Rechenkapazität vollständig aus teurem Oststrom und temporär angemieteten Karten bezieht, werden die Preise früher oder später wieder steigen. Umgekehrt ist die Kostenkurve nur dann stabil, wenn man über eigene grüne Rechenkapazitäts-Scheduling-Fähigkeiten verfügt. Bei der Auswahl lohnt es sich, eine Frage mehr zu stellen – woher kommt der Strom, wo laufen die Karten – das ist verlässlicher, als nur auf den Stückpreis zu schauen.

Wer gerade eine Large-Model-API-Auswahl trifft, kann diesem Gedanken noch eine Ebene tiefer folgen: Die Kostentrends bei Rechenkapazitätsmiete und GPU-Rechenleistung bestimmen unmittelbar, wohin sich die Angebote deines KI-Dienstleisters im kommenden Jahr entwickeln.

Autor: Zhou Mingzhe

Veröffentlichungsdatum: 4. Oktober 2026