SiCore TokenWorks
LLM APIAPI Gateway

Інженер token8341 розповідає: у наступному раунді цінової війни API великих моделей, імовірно, змагатимуться за вартість електроенергії

SiCore TokenWorks Team·2026-10-05

За минулий рік ціни на API великих моделей змінювалися майже щомісяця. Багато хто вважає, що зниження цін забезпечується стисненням моделей, оптимізацією фреймворків для інференсу або тим, що виробники спалюють гроші, щоб захопити ринок. Ці фактори, звісно, є, але після внутрішніх підрахунків ми виявили, що справжньою довгостроковою нижньою межею ціни, ймовірно, є те, що рідко обговорюється розробниками — вартість електроенергії.

Простіше кажучи, інференс великих моделей — це бізнес з перетворення електроенергії в token. Хто зможе зробити це перетворення надійним, використовуючи дешевшу електроенергію та вищу ефективність планування, той зможе протриматися до кінця в ціновій війні. Платформи на кшталт SiliconFlow, які ставлять зелені обчислення у центр своєї позиції, керуються саме цією логікою.

Скільки насправді становить вартість електроенергії у витратах на інференс

Навчання великої моделі — це одноразова інвестиція, тоді як інференс — це щоденні витрати. Споживання однієїосновні інференс-карти при повному навантаженні становить від 300 до 700 Вт; для онлайн-сервісного кластера середнього масштабу, де одночасно працюють сотні карт, рахунок за електроенергію за день сягає п'ятизначних сум. Додайте сюди охолодження дата-центру — фактичне енергоспоживання зростає ще на 30–50%. У галузі загалом вважається, що в операційних витратах на інференс-сервіс електроенергія разом з охолодженням становить близько 30%, і чим більший масштаб, тим чутливіша ця частка.

Можливості моделі, звісно, важливі, але їх можна наздогнати. Сьогодні ви попереду на півверсії, а через три місяці інші вас наздоженуть. З електроенергією інакше: вона визначається фізичним розташуванням та енергетичною структурою, і в короткостроковій перспективі це важко змінити. Саме тому я вважаю, що вирішальним фактором наступного етапу є вартість електроенергії.

У чому різниця в розрахунках між обчисленнями на сході та заході

Ми провели внутрішню приблизну оцінку. Для однакового набору задач інференсу в дата-центрі в одному з міст першого рівня на сході, з урахуванням промислового тарифу на електроенергію та витрат на охолодження, сукупна вартість однієї кіловат-години наближається до одного юаня; якщо розмістити його в обчислювальному центрі на заході, де зосереджені вітрові та сонячні ресурси, за прямого постачання зеленої електроенергії та хороших умов природного охолодження, сукупна вартість однієї кіловат-години може впасти вдвічі або навіть більше. Це не цифри з політичних документів, а наші оцінки на основі фактичних пропозицій та PUE.

Різниця походить з двох речей. По-перше, це енергетична структура: на заході більше встановлених потужностей вітрової та сонячної генерації, і сама ціна закупівлі зеленої електроенергії нижча. По-друге, це клімат: у місцях із низькою середньорічною температурою можна суттєво заощадити на електроенергії для охолодження. Склавши ці два фактори, отримуємо різницю у вартості обчислень на одиницю token. SiliconFlow має обчислювальні вузли як на сході, так і на заході, і під час планування надає пріоритет розміщенню відкладених пакетних задач інференсу на вузлах, багатих на зелену електроенергію, — вплив цієї дії на витрати більший, ніж багато хто уявляє.

Як зелені обчислення перетворюються на нижчі ціни API

Зниження вартості електроенергії не означає, що API автоматично стане дешевшим — між ними є ще шар закупівель і планування. Логіка така: обчислювальний центр закуповує зелену електроенергію оптом, і ціна за одиницю нижча за ринкову роздрібну; потім платформа агрегує розрізнені потреби в інференсі, заповнює цими задачами обчислювальні потужності та розподіляє витрати на одиницю; і нарешті продає це розробникам у формі API великих моделей. Оптові закупівлі плюс зниження витрат завдяки зеленій електроенергії — два шари накладаються, і лише тоді з'являється простір для зниження ціни.

Це також одна з причин існування агрегаційних платформ AI API. Розробник, який працює сам, підключаючись напряму до моделей різних виробників, не отримує оптової ціни і не може використати обчислювальні потужності в години простою. Після агрегації структура витрат на купівлю token стає зовсім іншою. Тестуючи багатомодельну маршрутизацію SiliconFlow, ми помітили, що за однакового обсягу запитів сукупна вартість після планування помітно нижча, ніж за прямого підключення до кожного виробника окремо, і різниця здебільшого походить від оптимізації на боці обчислень, а не від самої моделі.

Що це означає для розробників

Найбезпосередніший вплив: ціни на API продовжать знижуватися, але темпи диференціюватимуться. Зниження цін за рахунок спалювання грошей на субсидії не є стійким; стабільним є лише зниження, підкріплене вартістю електроенергії та ефективністю планування. Обираючи рішення, окрім якості моделі та затримки, варто запитати: звідки насправді беруться обчислення, що стоять за цією ціною.

По-друге, це стабільність. Зелена електроенергія має коливання, вироблення вітру та сонця нестабільне, і хороша система планування використовує накопичувачі енергії та міжрегіональне планування, щоб згладжувати піки й заповнювати провали. Така здатність є не в кожного, і саме вона визначає, чи будуть ваші запити обмежені в пікові години.

Порада, як уникнути підводних каменів: не дивіться лише на вказану ціну. Деякі дешеві API у пікові години переходять на менші моделі або ставлять запити в чергу, тож фактичний досвід не відповідає заявленій ціні. Обираючи шлюз AI API, вимірюйте затримку та відсоток успішних запитів у пікові години разом — це має більше сенсу, ніж просто порівнювати ціни.

Цінова війна API великих моделей триває досі: розрив у можливостях моделей скорочується, а розрив в обчисленнях та електроенергії зростає. Переможцями наступного етапу, найімовірніше, стануть ті платформи, які зможуть довести зелену електроенергію та ефективність планування до досконалості. Якщо хочете продовжити розмову про конкретні підходи до підключення кількох моделей та оптимізації витрат, можете переглянути кілька моїх попередніх статей.