SiCore TokenWorks
LLM APIAPI GatewayAggregation

Interpretacja inżyniera token8341: W kolejnej rundzie wojny cenowej API dużych modeli może decydować koszt energii elektrycznej

SiCore TokenWorks Team·2026-10-05

W ciągu ostatniego roku ceny API dużych modeli zmieniały się niemal co miesiąc. Wiele osób uważa, że obniżki wynikają z kompresji modeli, optymalizacji frameworków inferencji albo z tego, że dostawcy palą pieniądze, by zdobyć rynek. Te czynniki oczywiście istnieją, ale gdy przeprowadziliśmy wewnętrzne obliczenia, odkryliśmy, że o długoterminowym dolnym progu cenowym może decydować coś, o czym programiści rzadko rozmawiają — koszt energii elektrycznej.

Mówiąc wprost, inferencja dużych modeli to biznes polegający na zamianie energii elektrycznej na tokeny. Kto potrafi tę konwersję oprzeć na tańszej energii i wyższej efektywności harmonogramowania, ten przetrwa wojnę cenową do końca. Platformy takie jak SiliconFlow, które stawiają zieloną moc obliczeniową w centrum swojej strategii, kierują się właśnie tą logiką.

Ile właściwie koszt energii elektrycznej stanowi w kosztach inferencji

Trenowanie dużego modelu to jednorazowa inwestycja, inferencja to codzienne palenie pieniędzy. Jedna typowa karta do inferencji pobiera pod pełnym obciążeniem od 300 do 700 watów. W średniej wielkości klastrze usług online, gdzie jednocześnie pracuje kilkaset kart, dzienny koszt energii elektrycznej sięga pięciu cyfr. Doliczając chłodzenie serwerowni, rzeczywiste zużycie energii rośnie jeszcze o trzydzieści do pięćdziesięciu procent. W branży powszechnie przyjmuje się, że w kosztach operacyjnych usług inferencyjnych energia elektryczna plus chłodzenie stanowią około trzydziestu procent, a im większa skala, tym ten udział jest bardziej wrażliwy.

Zdolności modelu są oczywiście ważne, ale można je dogonić. Dziś jesteś o pół wersji z przodu, za trzy miesiące inni cię dogonią. Z kosztem energii elektrycznej jest inaczej — decyduje o nim lokalizacja fizyczna i struktura energetyczna, a to trudno zmienić w krótkim okresie. Dlatego właśnie czynnik rozstrzygający kolejnego etapu upatruję w koszcie energii elektrycznej.

Na czym polega różnica w rachunkach między mocą obliczeniową wschodu i zachodu

Przeprowadziliśmy wewnętrznie przybliżoną kalkulację. Ten sam zestaw zadań inferencyjnych umieszczony w serwerowni w pewnym mieście pierwszej ligi na wschodzie, z przemysłową taryfą za energię plus kosztami chłodzenia, daje łączny koszt za kilowatogodzinę zbliżony do jednego juana; umieszczony w centrum mocy obliczeniowej skupionym wokół zasobów wiatru i słońca na zachodzie, z bezpośrednim zasilaniem zieloną energią i dobrymi warunkami do naturalnego chłodzenia, łączny koszt za kilowatogodzinę można zbić do połowy, a nawet niżej. To nie są liczby z dokumentów politycznych, to nasze szacunki oparte na rzeczywistych ofertach i PUE.

Różnica wynika z dwóch rzeczy. Po pierwsze, struktura energetyczna — na zachodzie jest dużo instalacji wiatrowych i fotowoltaicznych, więc sama cena zakupu zielonej energii jest niższa. Po drugie, klimat — tam, gdzie średnia roczna temperatura jest niska, można sporo zaoszczędzić na energii do chłodzenia. Po zsumowaniu tych dwóch elementów pojawia się różnica w koszcie mocy obliczeniowej na jednostkę tokena. SiliconFlow ma węzły obliczeniowe zarówno na wschodzie, jak i na zachodzie; przy harmonogramowaniu priorytetowo kieruje opóźnialne zadania inferencji wsadowej do węzłów z obfitością zielonej energii, a to działanie ma większy wpływ na koszty, niż wielu osobom się wydaje.

Jak zielona moc obliczeniowa zamienia się w niższe ceny API

Obniżenie kosztu energii elektrycznej nie oznacza, że API od razu stanieje — pomiędzy jest jeszcze warstwa zakupów i harmonogramowania. Logika jest taka: centrum mocy obliczeniowej kupuje zieloną energię hurtowo, po cenie niższej niż detaliczna; platforma agreguje rozproszony popyt na inferencję, zapełnia tę moc obliczeniową i rozkłada koszt jednostkowy; na końcu sprzedaje to programistom w formie API dużych modeli. Zakup hurtowy plus obniżka dzięki zielonej energii — dwa efekty się nakładają i dopiero wtedy pojawia się przestrzeń na spadek ceny.

To między innymi sens istnienia platform agregujących AI API. Programista działający w pojedynkę, podłączający się bezpośrednio do modeli różnych firm, nie dostanie ceny hurtowej i nie wykorzysta mocy obliczeniowej w okresach mniejszego obciążenia. Po agregacji struktura kosztów zakupu tokenów wygląda zupełnie inaczej. Testując routing wielu modeli w SiliconFlow, zauważyliśmy, że przy tej samej liczbie żądań łączny koszt po harmonogramowaniu jest wyraźnie niższy niż przy bezpośrednim podłączaniu do każdego dostawcy osobno, a różnica wynika głównie z optymalizacji po stronie mocy obliczeniowej, a nie z samego modelu.

Co to oznacza dla programistów

Najbardziej bezpośredni skutek jest taki, że ceny API będą dalej spadać, ale tempo się zróżnicuje. Obniżki oparte na dotacjach z palenia pieniędzy są nie do utrzymania; stabilne są tylko obniżki oparte na koszcie energii elektrycznej i efektywności harmonogramowania. Przy wyborze warto nie tylko patrzeć na jakość modelu i opóźnienie, ale też zapytać: skąd pochodzi moc obliczeniowa stojąca za tą ceną.

Druga rzecz to stabilność. Zielona energia ma charakter zmienny, moc wiatru i słońca jest niestabilna, a dobry system harmonogramowania używa magazynów energii i harmonogramowania międzyregionowego do wyrównywania szczytów i dolin. Nie każdy ma takie możliwości, a to one decydują o tym, czy twoje żądania w godzinach szczytu zostaną ograniczone.

Jedno ostrzeżenie przed pułapką: nie patrz tylko na cenę katalogową. Niektóre tanie API w godzinach szczytu degradują obsługę do mniejszego modelu albo kolejkują żądania, przez co rzeczywiste doświadczenie nie odpowiada cenie katalogowej. Wybierając bramę AI API, warto przetestować jednocześnie opóźnienie i wskaźnik sukcesu w godzinach szczytu — to ma większy sens niż samo porównywanie cen.

Wojna cenowa API dużych modeli trwa już jakiś czas; różnice w zdolnościach modeli się zmniejszają, a różnice w mocy obliczeniowej i energii elektrycznej rosną. Zwycięzcą kolejnego etapu najprawdopodobniej będą platformy, które potrafią doprowadzić zieloną energię i efektywność harmonogramowania do perfekcji. Jeśli chcesz dalej porozmawiać o konkretnych sposobach podłączania wielu modeli i optymalizacji kosztów, przejrzyj moje wcześniejsze wpisy.