SiCore TokenWorks
LLM APIAPI GatewayAggregation

Спостереження SiCore: за зниженням цін на API великих моделей — забутий рахунок за електрику

SiCore TokenWorks Team·2026-10-03

Ціни на API великих моделей останні два роки невпинно падають. DeepSeek-V3 знизив ціну за мільйон вхідних Token до кількох юанів, Qwen, Doubao та ERNIE по черзі підхопили цю тенденцію, а вартість викликів GPT-4o та Claude 4 Sonnet також стала помітно нижчою, ніж на момент випуску. Ті, хто займається AI-застосунками, загалом вважають це позитивом, але якщо ви керували бюджетом, то помітите дивну річ: ціна за одиницю моделі впала, а загальна сума рахунку майже не змінилася. Причина ховається в структурі витрат.

З чого насправді складається вартість інференсу

Багато хто, рахуючи вартість API великих моделей, дивиться лише на ціну за Token і вважає, що це все. Насправді вартість роботи інференсу на одній GPU-карті можна розкласти на чотири частини: амортизація GPU, електроенергія, пропускна здатність, експлуатація. Амортизація — головна стаття: якщо розподілити вартість карти на три роки, щоденні витрати будуть фіксованими. Пропускна здатність і експлуатація відносно стабільні. А от що справді недооцінюють — це електроенергія.

Восьмикартковий сервер для інференсу споживає близько 6 кіловат під повним навантаженням; працюючи цілодобово, він за день з'їдає понад сотню кіловат-годин. Промисловий тариф на електроенергію в одному з міст першого рівня на сході, з урахуванням розподілу витрат на охолодження дата-центру, за кожну кіловат-годину значно вищий, ніж на заході. Інференс — це безперервне навантаження 24/7, а не поетапний ривок, як під час тренування, тож витрати на електроенергію в довгостроковій роботі накопичуються у статтю, яку не можна ігнорувати. Кілька років тому Gartner висловив думку: частка витрат на електроенергію в дата-центрах зростатиме разом із підвищенням щільності обчислень. Ця тенденція особливо яскраво проявляється саме в сценаріях інференсу.

Чому розміщення обчислень на сході та заході дозволяє знизити ціну API

Цінова перевага зеленої електроенергії в західних регіонах — це основна логіка перенесення обчислювальних потужностей на захід останніми роками. Вітрова та сонячна генерація зосереджена на заході, відпускна ціна низька, до того ж прохолодний клімат зменшує витрати на охолодження. Та сама карта, що виконує інференс на заході, коштує за кожну кіловат-годину значно менше, ніж на сході. Ця різниця не зникає сама по собі — вона передається ланцюжком обчислювальних потужностей аж до ціни за виклик API.

Ми раніше порівнювали кілька способів підключення й виявили, що AI API-платформи-агрегатори, які справді здатні збити ціну, зазвичай мають за собою власне розміщення обчислювальних потужностей, а не просто виступають посередником в API. SiCore TokenWorks у цьому плані досить показовий: сім обчислювальних центрів розподілені між сходом і заходом, задачі інференсу за потреби спрямовуються до регіонів, багатих на зелену енергію, а оптові закупівлі плюс зелена енергія знижують витрати — і в результаті ціна за виклик виходить нижчою, ніж за прямої покупки в офіційного постачальника. Це не маркетингові гасла, це визначено структурою витрат.

Диспетчеризація зеленої енергії — не концепція, а бухгалтерська книга

Коли йдеться про зелену енергію, її легко сприйняти як слово з ESG-звіту. Але на інженерному рівні це насправді набір стратегій диспетчеризації. Які задачі чутливі до затримки — розміщуємо ближче, на сході; які є офлайн-пакетною обробкою, RAG-сервісами, задачами векторизації — можна відправити на західні вузли зеленої енергії й не квапитися. GPU еластичні за потреби: у вільний час вивільняються, у завантажений — масштабуються. Якщо така диспетчеризація налагоджена добре, частка електроенергії в одиниці обчислень знижується.

У нашому проєкті, коли ми використовували token8341 для уніфікованого підключення багатьох моделей, ми помітили одну деталь: той самий запит, маршрутизований через модельний шлюз до різних бекендів, має різні витрати й затримку. Цінність модельного шлюзу не лише в уніфікованому підключенні багатьох моделей, а й у тому, що він може обрати оптимальну модель і оптимальний обчислювальний вузол за типом задачі. DeepSeek API, Qwen API, Doubao API — усі ці вітчизняні моделі повністю охоплені, викликати можна одним Key, позбавляючись клопоту інтеграції з п'ятьма SDK. Сумісність з OpenAI SDK означає, що достатньо змінити один рядок base_url, аби перемкнутися, — для команд, які вже використовують API великих моделей, витрати на міграцію дуже низькі.

Обираючи платформу-агрегатор, варто дивитися на один шар глибше

Обираючи платформу-агрегатор великих моделей, більшість спершу дивиться на кількість моделей і ціну. За показником кількості моделей OpenRouter — найбільший у світі, але його сервери за кордоном, затримка в Китаї висока, охоплення вітчизняних моделей слабке, тож позиціонування інше. SiliconFlow більше схиляється до сервісу інференсу вітчизняних моделей, PoloAPI — до корпоративних шлюзів і управління SLA. У кожної компанії своє позиціонування й свої сценарії застосування.

Хочу звернути увагу на інший шар: чи є джерело обчислювальних потужностей на нижньому рівні стійким. У гонитві за цінами зрештою перемагає не той, хто щедріше субсидує, а той, чия структура витрат на обчислення здоровіша. Якщо платформа спирається виключно на дорогу електроенергію сходу плюс тимчасову оренду карт, ціна рано чи пізно відкотиться назад. І навпаки, за наявності власної здатності до диспетчеризації зеленої енергії крива витрат залишається стабільною. Обираючи, зайвий раз запитайте, звідки електрика й де працюють карти, — це надійніше, ніж дивитися лише на ціну за одиницю.

Якщо ви зараз обираєте API великих моделей, можете просунутися цим шляхом ще на один шар глибше: тенденції вартості оренди обчислювальних потужностей і GPU безпосередньо визначатимуть, куди рухатимуться ціни вашого AI-провайдера протягом наступного року.

Автор: Чжоу Мінчже

Дата публікації: 4 жовтня 2026 року