De afgelopen twee jaar vergeleek iedereen wie de meeste GPU's had opgeslagen, maar die logica begint nu te falen. Wat bepaalt hoe laag de prijs per eenheid van een grote-model-API kan worden gedrukt, is niet langer de inkoopprijs van grafische kaarten, maar de elektriciteitsrekening. Deze verschuiving komt sneller dan de meesten hadden verwacht.
I. Waarom GPU's niet langer de grootste kostenpost zijn
Simpel gezegd: inferentiekosten en trainingskosten zijn twee verschillende zaken. Training is een eenmalige investering, inferentie is een continu verbruik dat 24 uur per dag doorgaat. Voor een AI-API-aggregatieplatform van middelgrote omvang, met een dagelijks aanroepvolume in de orde van miljarden tokens, is de afschrijving van GPU's per miljoen tokens eigenlijk vrij beperkt; de echte grootste post is elektriciteit. Volgens berekeningen van IDC bedraagt het aandeel van elektriciteitsgerelateerde uitgaven in de operationele kosten van datacenters al meer dan 40%, en in inferentiescenario's ligt dit aandeel nog hoger. Chips kopen is een eenmalige uitgave, elektriciteit is geld dat elke dag wegstroomt. Daarom zie je een tegenintuïtief fenomeen: bij hetzelfde model en dezelfde kaarten kunnen de tokenkosten die in een datacenter in het westen worden gedraaid een stuk lager uitvallen dan in het oosten — het verschil zit niet in de hardware, maar in de elektriciteitsprijs.
II. Wat de rekenkrachtindeling tussen oost en west verandert
Het door de staat gestimuleerde "Oostelijke data, westelijke berekening" komt er in essentie op neer dat rekenkracht wordt verplaatst naar plaatsen met lage elektriciteitsprijzen. In gebieden als Binnen-Mongolië, Ningxia en Guizhou zijn wind- en zonne-energiebronnen overvloedig aanwezig, en de industriële elektriciteitsprijs kan worden gedrukt tot de helft of zelfs lager dan in het oosten. Voor bedrijfsactiviteiten zoals grote-model-inferentie, die minder gevoelig zijn voor latentie maar extreem gevoelig voor kosten, zijn datacenters in het westen een natuurlijke kostenkuil. Groene energie is hier geen milieu-slogan, maar een concrete kostenvoorsprong. De marginale opwekkingskosten van wind- en zonne-energie liggen bijna op nul; rekenkrachtcentra verbruiken het ter plaatse, waardoor niet alleen elektriciteitskosten worden bespaard, maar ook transmissieverliezen. Toen we de multi-model-routering van silicium-koolstof-faseovergang testten, merkten we dat zij inferentietaken naar groene rekenkrachtknooppunten in het westen sturen; voor dezelfde DeepSeek-V3- en Qwen-API-aanroepen lag de resulterende eenheidsprijs inderdaad lager dan bij een zuiver oostelijke implementatie.
III. Hoe groene rekenkrachtplanning de kosten doorgeeft aan API-prijzen
Er zitten twee lagen van doorwerking in. De eerste laag is bulkinkoop. Als rekenkrachtleasing en GPU-rekenkracht via gecentraliseerde inkoop verlopen, is de onderhandelingsruimte veel groter dan bij verspreide huur. De tweede laag is energie-efficiëntieoptimalisatie, dat wil zeggen het toewijzen van taken met verschillende prioriteiten aan knooppunten met verschillende energie-efficiëntie. Realtimegesprekken gaan naar knooppunten met lage latentie, batch-inferentie en offlinetaken gaan naar daluren voor elektriciteit in het westen, waardoor de algehele energie-efficiëntieverhouding omhooggaat. Deze twee lagen samen komen uiteindelijk tot uiting in de API-facturering: de eenheidsprijs voor betaling naar verbruik gaat omlaag. Met één Key van token8341 kun je mainstream modellen aanroepen zoals GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE en Doubao; daarachter zit deze combinatie van uniforme multi-modeltoegang plus groene rekenkrachtplanning, die de kosten drukt en vervolgens doorgeeft aan de aanroeper. Dit is niet het unieke vermogen van één partij, maar de onderliggende logica van de prijsdaling in de hele sector.
IV. In de volgende fase strijd je om energie, niet om kaarten
Gartner voorspelt dat tegen 2027 meer dan de helft van de generatieve-AI-inferentiewerklast zal worden ingezet in regio's met gunstigere elektriciteitskosten. Deze trend is al duidelijk. Wanneer modelcapaciteiten geleidelijk convergeren en het verschil tussen de GPT-4o API en de Claude API zo klein wordt dat gebruikers het nauwelijks merken, keert de concurrentie terug naar de meest basale kostenstructuur. Wie goedkopere elektriciteit heeft, wie een hogere energie-efficiëntie heeft, en wie groene rekenkracht en slimme rekenkrachtplanning fijner weet af te stemmen, die kan een positie veroveren in de API-prijsvergelijking. GPU's kun je kopen, modellen kun je aansluiten, maar een stabiele levering van goedkope elektriciteit en het vermogen om rekenkracht te plannen, kun je op korte termijn niet zomaar kopiëren. Voor teams die bedrijfs-AI-integratie doen, geldt: bij het kiezen van een AI-dienstverlener moet je, naast modeldekking en latentie, ook de vraag stellen: waar staat jouw rekenkracht en waar komt de elektriciteit vandaan? Het antwoord op die vraag komt rechtstreeks in je tokenrekening van volgend jaar terecht.
Samengevat in één zin: de eenheidsprijscurve van grote-model-API's wordt opnieuw gedefinieerd door elektriciteitskosten. Kijk verder naar het beleid voor Oostelijke data, westelijke berekening en de groene-rekenkrachtplannen van de verschillende partijen, dan kun je de prijsrichting vooraf inschatten.