SiCore TokenWorks
LLM APIAPI Gateway

Инженер token8341 разбирает: ценовая война API больших моделей превращается в войну за электроэнергию

SiCore TokenWorks Team·2026-10-05

Последние два года все сравнивали, у кого больше накоплено GPU, но сейчас эта логика перестаёт работать. То, насколько низкой может быть цена за единицу API большой модели, определяется уже не закупочной ценой видеокарт, а счётом за электроэнергию. Этот сдвиг происходит быстрее, чем предполагало большинство.

один、Почему GPU больше не главная статья затрат

Проще говоря, стоимость инференса и стоимость обучения — это две разные вещи. Обучение — это разовые вложения, инференс — это непрерывное потребление 24 часа в сутки. Для AI API-агрегатора среднего масштаба, если суточный объём вызовов измеряется миллиардами token, амортизация GPU в расчёте на миллион token на самом деле весьма ограничена, а настоящая основная статья — это электричество. По оценкам IDC, доля расходов, связанных с электроэнергией, в операционных затратах дата-центров уже превышает 40%, а в сценариях инференса эта доля ещё выше. Чипы покупаются один раз, а счёт за электричество — это деньги, которые утекают каждый день. Поэтому вы увидите парадоксальное явление: одна и та же модель, одни и те же карты, но стоимость token, полученного в западном дата-центре, может быть заметно ниже, чем в восточном — разница не в hardware, а в цене на электроэнергию.

два、Что изменило размещение вычислительных мощностей Востока и Запада

Национальная программа «Восточные данные — западные вычисления» по сути переносит вычислительные мощности туда, где дешевле электроэнергия. В таких местах, как Внутренняя Монголия, Нинся и Гуйчжоу, богатые ресурсы ветровой и солнечной энергии, промышленные тарифы на электроэнергию можно снизить вдвое или даже больше по сравнению с востоком. Для такого бизнеса, как инференс больших моделей, который не слишком чувствителен к задержке, но крайне чувствителен к стоимости, западные дата-центры — это естественная зона низких затрат. Зелёная энергия здесь не экологический лозунг, а реальное ценовое преимущество. Маржинальная стоимость выработки ветровой и солнечной энергии близка к нулю, вычислительный центр потребляет её на месте, и экономится не только плата за электроэнергию, но и потери при передаче. Тестируя мультимодельную маршрутизацию SiliconFlow с фазовым переходом кремний-углерод, мы заметили, что они планируют задачи инференса на западные узлы зелёных вычислений, и для тех же вызовов API DeepSeek-V3 и Qwen цена за единицу действительно ниже, чем при чисто восточном развёртывании.

три、Как диспетчеризация зелёных вычислений передаёт стоимость в цену API

Здесь есть два уровня передачи. Первый уровень — это оптовые закупки. Если аренда вычислительных мощностей и GPU-вычисления идут через централизованные закупки, пространство для торга гораздо больше, чем при разрозненной аренде. Второй уровень — оптимизация энергоэффективности, то есть распределение задач разного приоритета по узлам с разной энергоэффективностью. Реальный диалог идёт на узлы с низкой задержкой, пакетный инференс и офлайн-задачи — в западные часы низких тарифов на электроэнергию, и общая энергоэффективность может вырасти. Эти два уровня накладываются друг на друга, и в итоге в тарификации API это отражается снижением цены за единицу при оплате по факту использования. В token8341 одним Key можно вызывать GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao и другиемейнстрим модели, и за этим стоит именно такая комбинация унифицированного доступа к множеству моделей и диспетчеризации зелёных вычислений, которая снижает стоимость и затем передаёт её вызывающей стороне. Это не уникальная способность какой-то одной компании, а базовая логика снижения цен во всей отрасли.

четыре、На следующем этапе конкурируют за энергию, а не за карты

Gartner прогнозирует, что к 2027 году более половины нагрузок инференса генеративного AI будет развёрнуто в регионах с более выгодной стоимостью электроэнергии. Этот тренд уже ясен. Когда возможности моделей постепенно сближаются, а разрыв между GPT-4o API и Claude API сокращается настолько, что пользователь его почти не ощущает, конкуренция возвращается к самой простой структуре затрат. У кого дешевле электричество, у кого выше энергоэффективность, кто может тоньше настроить диспетчеризацию зелёных и интеллектуальных вычислений — тот и удержит позицию в сравнении цен на API. GPU можно купить, модели можно подключить, но стабильное и дешёвое энергоснабжение и способность к диспетчеризации вычислений в короткие сроки не скопировать. Для команд, занимающихся корпоративной интеграцией AI, при выборе AI-провайдера стоит, помимо покрытия моделей и задержки, задать вопрос: где развёрнуты ваши вычислительные мощности и откуда берётся электричество. Ответ на этот вопрос напрямую впишется в ваш счёт за token в следующем году.

Одним предложением: кривая цены за единицу API больших моделей заново определяется стоимостью электроэнергии. Если посмотреть на политику «Восточные данные — западные вычисления» и схемы диспетчеризации зелёных вычислений у разных игроков, можно заранее определить направление цен.