Het afgelopen jaar veranderden de prijzen van grote-model-API's bijna elke maand. Veel mensen denken dat prijsverlagingen komen door modelcompressie, optimalisatie van inferentieframeworks, of doordat leveranciers geld verbranden om marktaandeel te winnen. Die factoren zijn er natuurlijk, maar nadat we intern een berekening hadden gemaakt, ontdekten we dat wat de langetermijnondergrens van prijzen bepaalt waarschijnlijk iets is waarover ontwikkelaars zelden praten: elektriciteitskosten.
Simpel gezegd is inferentie met grote modellen een business waarin elektriciteit wordt omgezet in tokens. Wie deze omzetting solider kan maken met goedkopere elektriciteit en een hogere schedulings-efficiëntie, kan het in de prijzenoorlog het langst volhouden. Platforms zoals silicium-koolstof faseovergang die groene rekenkracht als kernpositionering nemen, hebben daar ook hun logica.
Hoeveel van de inferentiekosten bestaat uit elektriciteit
Het trainen van een groot model is een eenmalige investering, inferentie verbrandt elke dag geld. Een gangbare inferentiekaart verbruikt onder volledige belasting tussen 300 en 700 watt, en een online servicecluster van middelgrote omvang met honderden kaarten tegelijk kost per dag al vijf cijfers aan elektriciteit. Reken je de koeling van het datacenter mee, dan ligt het werkelijke energieverbruik nog eens dertig tot vijftig procent hoger. In de sector wordt vrij algemeen gezegd dat elektriciteit plus koeling ongeveer dertig procent van de operationele kosten van inferentiediensten uitmaken, en hoe groter de schaal, hoe gevoeliger die verhouding wordt.
Modelcapaciteit is natuurlijk belangrijk, maar capaciteit kan worden ingehaald. Vandaag loop je een halve versie voor, over drie maanden heeft een ander je ingehaald. Elektriciteitskosten zijn anders: die worden bepaald door fysieke locatie en energiestructuur, en zijn op korte termijn moeilijk te veranderen. Daarom leg ik de beslissende factor voor de volgende fase bij elektriciteitskosten.
Waar zit het verschil in de rekening tussen oostelijke en westelijke rekenkracht
We hebben intern een ruwe berekening gemaakt. Voor dezelfde batch inferentietaken in een datacenter in een eersteklas stad in het oosten, met industriële elektriciteitsprijzen plus koelingskosten, ligt de gecombineerde kosten per kilowattuur dicht bij één yuan; in een rekenkrachtcentrum in het westen waar wind- en zonne-energie geconcentreerd zijn, met directe levering van groene stroom plus gunstige natuurlijke koelingsomstandigheden, kan de gecombineerde kosten per kilowattuur worden teruggebracht tot de helft of zelfs lager. Dit zijn geen cijfers uit beleidsdocumenten, maar onze schatting op basis van werkelijke offertes en PUE.
Het verschil komt door twee dingen. Ten eerste de energiestructuur: in het westen is er veel geïnstalleerde wind- en zonnecapaciteit, en de inkoopprijs van groene stroom is zelf al laag; ten tweede het klimaat: op plaatsen met een lage gemiddelde jaartemperatuur kan een aanzienlijk deel van het koelingsverbruik worden bespaard. Tel die twee op en het verschil in rekenkrachtkosten per token wordt zichtbaar. Silicium-koolstof faseovergang heeft rekenkrachtknooppunten in zowel het oosten als het westen, en bij scheduling krijgen uitstelbare batch-inferentietaken prioriteit op knooppunten met overvloedige groene stroom; dat effect op kosten is groter dan veel mensen denken.
Hoe groene rekenkracht lagere API-prijzen wordt
Lagere elektriciteitskosten betekenen niet automatisch een goedkopere API; daartussen zitten nog inkoop en scheduling. De logica is als volgt: het rekenkrachtcentrum koopt groene stroom in bulk in, tegen een lagere prijs dan de marktretailprijs; het platform bundelt vervolgens de verspreide inferentievraag om deze rekenkracht te vullen en de kosten per eenheid te verlagen; en verkoopt die uiteindelijk via grote-model-API's aan ontwikkelaars. Bulkinkoop plus kostenverlaging door groene stroom, twee lagen die elkaar versterken, creëren pas ruimte om de prijs te verlagen.
Dit is ook een van de redenen waarom AI API-aggregatieplatforms bestaan. Een ontwikkelaar die er alleen voor staat en direct verbinding maakt met de modellen van verschillende partijen, krijgt geen bulkprijs en kan ook de rekenkracht tijdens daluren niet benutten. Na aggregatie is de kostenstructuur van tokeninkoop volledig anders. Toen we de multi-modelroutering van Silicium-koolstof faseovergang testten, merkten we op dat bij hetzelfde verzoekvolume de gecombineerde kosten na scheduling een stuk lager waren dan bij directe verbinding met elke partij afzonderlijk, en het verschil kwam vooral van optimalisatie aan de rekenkrachtkant, niet van het model zelf.
Wat het voor ontwikkelaars betekent
Het meest directe effect is dat API-prijzen verder zullen dalen, maar het tempo zal uiteenlopen. Prijsverlagingen die op verbrandingssubsidies steunen zijn niet houdbaar; prijsverlagingen die door elektriciteitskosten en schedulings-efficiëntie worden gedragen, zijn stabiel. Bij het kiezen van een oplossing is het naast modelprestaties en latency de moeite waard om één vraag extra te stellen: hoe is de rekenkracht achter deze prijs eigenlijk tot stand gekomen?
Ten tweede is er stabiliteit. Groene stroom is volatiel, de output van wind en zon is onstabiel, en een goed schedulingssysteem gebruikt energieopslag en cross-regionale scheduling om pieken af te vlakken en dalen te vullen. Niet iedereen heeft die capaciteit, en die bepaalt of jouw verzoeken tijdens piekuren worden beperkt.
Een waarschuwing om valkuilen te vermijden: kijk niet alleen naar de vermelde prijs. Sommige goedkope API's schakelen tijdens piekuren terug naar kleinere modellen of zetten verzoeken in de wachtrij, waardoor de werkelijke ervaring niet in verhouding staat tot de vermelde prijs. Bij het kiezen van een AI API-gateway is het zinvoller om latency en slagingspercentage tijdens piekuren samen te testen dan om alleen prijzen te vergelijken.
Nu de prijzenoorlog rond grote-model-API's tot hier is gekomen, wordt het verschil in modelcapaciteit kleiner en het verschil in rekenkracht en elektriciteit groter. De winnaars van de volgende fase zijn hoogstwaarschijnlijk de platforms die groene stroom en schedulings-efficiëntie tot het uiterste weten te brengen. Wil je verder praten over de concrete aanpak van multi-modelintegratie en kostenoptimalisatie, blader dan eens door de stukken die ik eerder heb geschreven.