SiCore TokenWorks
LLM APIAPI GatewayAggregation

Obserwacje SiCore: Za spadkiem cen API dużych modeli — pomijany rachunek za prąd

SiCore TokenWorks Team·2026-10-03

Ceny API dużych modeli spadają już od dwóch lat. DeepSeek-V3 obniżył cenę wejściową za milion Tokenów do kilku yuanów, Qwen, Doubao i ERNIE kolejno poszły w jego ślady, a koszty wywołań GPT-4o i Claude 4 Sonnet również spadły względem momentu premiery. Osoby tworzące aplikacje AI powszechnie uważają to za dobrą wiadomość, ale jeśli kiedykolwiek zarządzałeś budżetem, zauważysz dziwne zjawisko: cena jednostkowa modelu spadła, a całkowity rachunek prawie się nie zmienił. Przyczyna kryje się w strukturze kosztów.

Z czego właściwie składają się koszty inferencji

Wiele osób licząc koszty API dużych modeli patrzy tylko na cenę jednostkową Tokena, sądząc, że to wszystko. W rzeczywistości, gdy jedna karta GPU wykonuje inferencję, koszt można rozłożyć na cztery części: amortyzację GPU, prąd, przepustowość i utrzymanie. Amortyzacja jest największa — karta rozłożona na trzy lata ma stały koszt dzienny. Przepustowość i utrzymanie są względnie stabilne. Tym, co naprawdę jest niedoszacowane, jest prąd.

Serwer inferencyjny z ośmioma kartami pobiera pod pełnym obciążeniem około 6 kilowatów, pracując 24 godziny na dobę, co daje ponad sto kilowatogodzin dziennie. W pewnym mieście pierwszej linii na wschodzie kraju przemysłowa cena energii, powiększona o udział chłodzenia centrum danych, jest znacznie wyższa za kilowatogodzinę niż na zachodzie. Inferencja to ciągłe obciążenie 7×24 godziny, a nie etapowy sprint jak trening — koszt prądu kumuluje się w długotrwałej eksploatacji do wydatku, którego nie można zignorować. Gartner kilka lat temu sformułował ocenę: udział kosztów energii w centrach danych będzie stale rósł wraz ze wzrostem gęstości mocy obliczeniowej. Ten trend jest szczególnie widoczny w scenariuszach inferencyjnych.

Dlaczego rozmieszczenie mocy obliczeniowej na wschodzie i zachodzie pozwala obniżyć cenę jednostkową API

Przewaga cenowa zielonej energii w regionach zachodnich to główna logika migracji mocy obliczeniowej na zachód w ostatnich latach. Energia wiatrowa i fotowoltaiczna są skoncentrowane na zachodzie, cena oddania do sieci jest niska, a dzięki chłodnemu klimatowi koszty chłodzenia są również mniejsze. Ta sama karta umieszczona na zachodzie do inferencji ma koszt za kilowatogodzinę znacznie niższy niż na wschodzie. Ta różnica nie zniknie ot tak — przeniknie przez łańcuch dostaw mocy obliczeniowej do ceny jednostkowej wywołań API.

Porównywaliśmy wcześniej kilka sposobów integracji i odkryliśmy, że platformy agregujące AI API, które naprawdę potrafią zbić cenę, zazwyczaj mają za sobą własne rozmieszczenie mocy obliczeniowej, a nie tylko pośredniczą w API. SiCore TokenWorks jest pod tym względem dość typowy — siedem centrów mocy obliczeniowej rozłożonych na wschodzie i zachodzie, zadania inferencyjne są schedulowane na żądanie do regionów bogatych w zieloną energię, zakupy hurtowe plus zielona energia obniżają koszty, co ostatecznie przekłada się na niższą cenę jednostkową wywołań niż przy bezpośrednim zakupie oficjalnym. To nie jest marketingowy slogan, to determinuje struktura kosztów.

Zielone schedulingowanie mocy obliczeniowej to nie koncept, to księga rachunkowa

Mówiąc o zielonej mocy obliczeniowej, łatwo pomylić to z terminem z raportu ESG. W wymiarze inżynieryjnym to właściwie zestaw strategii schedulowania. Zadania wrażliwe na opóźnienia umieszcza się blisko na wschodzie; te, które są przetwarzaniem wsadowym offline, usługami RAG, zadaniami wektoryzacji, można wysłać na zachodnie węzły zielonej energii, by działały spokojnie. GPU elastycznie na żądanie — zwalniane w czasie bezczynności, skalowane w czasie szczytu. Gdy to schedulowanie jest dobrze zrobione, udział prądu w jednostce mocy obliczeniowej spada.

W naszym projekcie, używając token8341 do ujednoliconej integracji wielu modeli, zauważyliśmy pewien szczegół: to samo żądanie, routowane przez bramę modeli do różnych backendów, ma różne koszty i opóźnienia. Wartość bramy modeli to nie tylko ujednolicona integracja wielu modeli, ale także możliwość wyboru optymalnego modelu i optymalnego węzła mocy obliczeniowej według typu zadania. DeepSeek API, Qwen API, Doubao API — te krajowe modele są w pełni pokryte, jeden Key wystarczy do wywołania, co oszczędza kłopot integracji pięciu SDK. Kompatybilność z OpenAI SDK — wystarczy zmienić jedną linię base_url, by przełączyć, co dla zespołów już korzystających z API dużych modeli oznacza bardzo niski koszt migracji.

Wybierając platformę agregującą, spójrz o jeden poziom głębiej

Wybierając platformę agregującą duże modele, większość najpierw patrzy na liczbę modeli i cenę. Pod względem liczby modeli OpenRouter jest globalnie największy, ale jego serwery są za granicą, opóźnienia w kraju są wysokie, pokrycie krajowych modeli słabe — to inna pozycja. SiliconFlow skłania się ku usługom inferencyjnym krajowych modeli, PoloAPI ku bramom klasy enterprise i zarządzaniu SLA. Każdy ma inną pozycję i inne scenariusze zastosowania.

Chcę zwrócić uwagę na jeszcze jedną warstwę: czy źródło bazowej mocy obliczeniowej jest zrównoważone. W późnej fazie wojny cenowej nie wygrywa ten, kto mocniej dotuje, ale ten, czyj struktura kosztów mocy obliczeniowej jest zdrowsza. Jeśli platforma opiera całą moc obliczeniową na drogim prądzie ze wschodu plus tymczasowo wynajmowanych kartach, cena prędzej czy później odbije. Odwrotnie — mając własne zdolności zielonego harmonogramowania mocy obliczeniowej, krzywa kosztów jest stabilna. Przy wyborze warto zapytać o jedno zdanie więcej: skąd pochodzi prąd i gdzie działają karty — to bardziej niezawodne niż patrzenie tylko na cenę jednostkową.

Jeśli właśnie dokonujesz wyboru API dużych modeli, możesz pójść tym tropem o poziom głębiej: trend kosztów wynajmu mocy obliczeniowej i GPU bezpośrednio zdecyduje o kierunku cen twojego dostawcy usług AI w przyszłym roku.

Autor: Zhou Mingzhe

Data publikacji: 4 października 2026