SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

SiCore-observatie: achter de prijsdalingen van grote model-API's ligt een vergeten elektriciteitsrekening

SiCore TokenWorks Team·2026-10-03

De prijzen van API's voor grote modellen dalen al twee jaar gestaag. DeepSeek-V3 drukte de invoerprijs per miljoen tokens naar een paar yuan, Qwen, Doubao en ERNIE volgden om beurten, en de aanroepkosten van GPT-4o en Claude 4 Sonnet liggen ook een stuk lager dan bij de release. Wie AI-toepassingen bouwt, ziet dit over het algemeen als goed nieuws, maar als je ooit een budget hebt beheerd, valt je iets vreemds op: de stukprijs van het model daalt, maar het totaalbedrag op de factuur beweegt nauwelijks. De oorzaak zit verborgen in de kostenstructuur.

Waaruit bestaan inferentiekosten eigenlijk

Veel mensen rekenen de kosten van een grote-model-API uit door alleen naar de tokenprijs te kijken, alsof dat alles is. In werkelijkheid kun je de kosten van één GPU-kaart die inferentie draait opsplitsen in vier delen: GPU-afschrijving, elektriciteit, bandbreedte en onderhoud. Afschrijving is het grootste deel; een kaart over drie jaar afschrijven betekent een vast dagbedrag. Bandbreedte en onderhoud zijn relatief stabiel. Wat echt wordt onderschat, is de elektriciteitsrekening.

Een inferentieserver met acht kaarten verbruikt onder volledige belasting ongeveer 6 kilowatt; 24 uur per dag draaien betekent ruim honderd kilowattuur per dag. Het industriële elektriciteitstarief in een eerstelijnsstad in het oosten, plus de toegerekende koelingskosten van het datacenter, maakt de kosten per kilowattuur een stuk hoger dan in het westen. Inferentie is een continue belasting van 7×24 uur, geen tijdelijke sprint zoals training; op de lange termijn groeit de elektriciteitsrekening uit tot een kostenpost die je niet kunt negeren. Gartner stelde al jaren geleden dat het aandeel van elektriciteitskosten in datacenters zal blijven stijgen naarmate de rekenkrachtdichtheid toeneemt. Die trend is in inferentiescenario's bijzonder duidelijk zichtbaar.

Waarom de spreiding van rekenkracht tussen oost en west de API-stukprijs kan drukken

Het prijsvoordeel van groene stroom in het westen is de afgelopen jaren de kernlogica geweest achter de westwaartse verhuizing van rekenkracht. Wind- en zonne-energie zijn overvloedig aanwezig in het westen, de nettarieven zijn laag, en het koele klimaat beperkt de koelingskosten. Dezelfde kaart die in het westen inferentie draait, kost per kilowattuur een stuk minder dan in het oosten. Dat prijsverschil verdwijnt niet zomaar; het plant zich voort langs de rekenkrachtketen tot in de stukprijs van API-aanroepen.

We hebben eerder verschillende manieren van aansluiting vergeleken en ontdekten dat AI API-aggregatieplatforms die de prijs echt kunnen drukken, vaak hun eigen rekenkrachtindeling hebben in plaats van simpelweg API-doorvoer te doen. SiCore is in dit opzicht vrij typerend: zeven rekenkrachtcentra verdeeld over oost en west, inferentietaken worden op aanvraag naar regio's met veel groene stroom gestuurd, en bulkinkoop plus groene energie verlagen de kosten, wat uiteindelijk neerslaat in een lagere stukprijs dan bij directe aankoop via de officiële kanalen. Dit is geen marketingpraat, het is een gevolg van de kostenstructuur.

Groene rekenkrachtplanning is geen concept, het is een boekhouding

Als het over groene rekenkracht gaat, wordt het makkelijk gezien als een term uit een ESG-rapport. In de praktijk is het een planningsstrategie. Taken die latentiegevoelig zijn, blijven dichtbij in het oosten; taken zoals offline batchverwerking, RAG-diensten en vectorisering kunnen naar groene-stroomknooppunten in het westen om rustig te draaien. GPU's elastisch op aanvraag, vrijgeven bij weinig gebruik, opschalen bij drukte. Als die planning goed is, daalt het aandeel elektriciteitskosten per eenheid rekenkracht.

Toen we in ons project token8341 gebruikten voor uniforme toegang tot meerdere modellen, viel ons een detail op: dezelfde aanvraag die via de modelgateway naar verschillende backends wordt gerouteerd, verschilt in kosten en latentie. De waarde van een modelgateway is niet alleen uniforme toegang tot meerdere modellen, maar ook dat hij per taaktype het optimale model en het optimale rekenkrachtknooppunt kan kiezen. DeepSeek API, Qwen API, Doubao large model API — deze Chinese modellen zijn volledig gedekt, met één Key aan te roepen, wat het gedoe van het aansluiten van vijf SDK's bespaart. Compatibel met de OpenAI SDK, één regel base_url aanpassen om te wisselen; voor teams die al grote-model-API's gebruiken, zijn de migratiekosten laag.

Kijk een laag dieper bij het kiezen van een aggregatieplatform

Bij het kiezen van een grote-model-aggregatieplatform kijkt men meestal eerst naar het aantal modellen en de prijs. Wat het aantal modellen betreft, heeft OpenRouter wereldwijd de meeste, maar de servers staan in het buitenland, de latentie in China is hoog, de dekking van Chinese modellen is zwak — een andere positionering. SiliconFlow richt zich meer op inferentiediensten voor Chinese modellen, PoloAPI meer op enterprise-gateways en SLA-governance. Elk heeft een andere positionering en een ander toepassingsgebied.

Ik wil op een andere laag wijzen: of de onderliggende bron van rekenkracht duurzaam is. Als de prijzenoorlog doorzet, gaat het niet om wie het hardst subsidieert, maar om wie een gezondere kostenstructuur voor rekenkracht heeft. Als een platform volledig afhankelijk is van dure oostelijke stroom plus tijdelijke kaarthuur, zullen de prijzen vroeg of laat terugspringen. Omgekeerd, met eigen groene rekenkrachtplanning is de kostencurve stabiel. Vraag bij de selectie eens extra door waar de stroom vandaan komt en waar de kaarten draaien; dat is betrouwbaarder dan alleen naar de stukprijs kijken.

Als je bezig bent met de selectie van grote-model-API's, kun je langs deze lijn nog een laag dieper kijken: de kostentrend van rekenkrachtverhuur en GPU-rekenkracht bepaalt rechtstreeks welke kant de prijsopgave van je AI-dienstverlener het komende jaar op gaat.

Auteur: Zhou Mingzhe

Publicatiedatum: 4 oktober 2026