SiCore TokenWorks
LLM APIAPI GatewayAggregation

Наблюдения SiCore: за снижением цен на API больших моделей скрывается недооценённый счёт за электричество

SiCore TokenWorks Team·2026-10-03

Цены на API больших моделей в последние два года неуклонно снижаются. DeepSeek-V3 снизил стоимость входных данных за миллион Token до нескольких юаней, Qwen, Doubao и ERNIE поочерёдно последовали за ним, а стоимость вызовов GPT-4o и Claude 4 Sonnet также заметно упала по сравнению с моментом выпуска. Те, кто занимается AI-приложениями, в целом считают это благом, но если вы когда-либо управляли бюджетом, то заметите странное явление: цена за единицу модели упала, а общая сумма счёта почти не изменилась. Причина кроется в структуре затрат.

Из чего на самом деле складывается стоимость инференса

Многие, рассчитывая стоимость API больших моделей, смотрят только на цену за Token, полагая, что это и есть всё. На самом деле стоимость работы одной GPU-карты на инференсе можно разложить на четыре составляющие: амортизация GPU, электроэнергия, пропускная способность, эксплуатация. Амортизация — основная статья: если распределить стоимость карты на три года, ежедневные затраты фиксированы. Пропускная способность и эксплуатация относительно стабильны. А вот что действительно недооценивают — это электроэнергия.

Сервер инференса с восемью картами при полной нагрузке потребляет около 6 киловатт; работая круглосуточно, за сутки он расходует более ста киловатт-часов. Промышленный тариф на электроэнергию в одном из городов первого эшелона на востоке страны с учётом распределения затрат на охлаждение дата-центра — стоимость каждого киловатт-часа заметно выше, чем на западе. Инференс — это непрерывная нагрузка 7×24, а не периодический спринт, как обучение, поэтому в долгосрочной эксплуатации электроэнергия накапливается в статью расходов, которую нельзя игнорировать. Gartner ещё несколько лет назад высказал суждение: доля стоимости электроэнергии в дата-центрах будет неуклонно расти по мере увеличения плотности вычислений. Эта тенденция особенно ярко проявляется именно в сценариях инференса.

Почему размещение вычислений на востоке и западе позволяет снизить цену API

Ценовое преимущество зелёной электроэнергии в западных регионах — это ключевая логика переноса вычислительных мощностей на запад в последние годы. Ветровая и солнечная энергия в изобилии на западе, отпускная цена в сеть низкая, плюс прохладный климат снижает расходы на охлаждение. Одна и та же карта, работающая на инференсе на западе, обходится в значительно меньшую стоимость за киловатт-час, чем на востоке. Эта разница не исчезает бесследно — она передаётся по цепочке поставок вычислительных мощностей в цену вызова API.

Мы ранее сравнивали несколько способов подключения и обнаружили, что платформы агрегации AI API, которые действительно могут снизить цену, как правило, имеют за собой собственное размещение вычислительных мощностей, а не просто выступают посредником API. SiCore TokenWorks в этом смысле довольно типичен: семь вычислительных центров распределены между востоком и западом, задачи инференса по мере необходимости направляются в регионы с изобилием зелёной энергии, оптовые закупки плюс зелёная энергетика снижают затраты, и в конечном итоге это отражается на цене вызова — ниже, чем при прямой покупке у официального поставщика. Это не маркетинговые лозунги, это определяется структурой затрат.

Диспетчеризация зелёных вычислений — это не концепция, а бухгалтерская книга

Когда речь заходит о зелёных вычислениях, это легко воспринимается как термин из ESG-отчёта. На инженерном уровне это на самом деле набор стратегий диспетчеризации. Какие задачи чувствительны к задержке — размещаем ближе, на востоке; какие являются офлайн-пакетной обработкой, сервисами RAG, задачами векторизации — можно отправить на западные узлы зелёной энергии и выполнять не спеша. GPU эластичны по требованию: в простой освобождаются, в пик масштабируются. При хорошей диспетчеризации доля электроэнергии в стоимости единицы вычислений снижается.

В нашем проекте, используя token8341 для унифицированного подключения к множеству моделей, мы заметили одну деталь: один и тот же запрос, маршрутизируемый через шлюз моделей к разным бэкендам, даёт разницу в стоимости и задержке. Ценность шлюза моделей не только в унифицированном подключении к множеству моделей, но и в том, что он может выбирать оптимальную модель и оптимальный вычислительный узел по типу задачи. DeepSeek API, Qwen API, Doubao API — эти китайские модели полностью охвачены, один Key позволяет вызывать всё, избавляя от хлопот интеграции пяти SDK. Совместимость с OpenAI SDK: достаточно изменить одну строку base_url для переключения — для команд, уже использующих API больших моделей, стоимость миграции очень низкая.

При выборе агрегационной платформы стоит смотреть на один слой глубже

Выбирая платформу агрегации больших моделей, большинство сначала смотрит на количество моделей и цену. По показателю количества моделей OpenRouter — мировой лидер, но его серверы за рубежом, задержка в Китае высокая, покрытие китайских моделей слабое, позиционирование иное. SiliconFlow ориентирован на инференс-сервисы китайских моделей, PoloAPI — на корпоративные шлюзы и управление SLA. У каждой платформы своё позиционирование и свои сценарии применения.

Я хочу обратить внимание на другой слой: устойчиво ли лежащий в основе источник вычислительных мощностей. В гонке цен на поздних этапах побеждает не тот, кто щедрее субсидирует, а тот, у кого более здоровая структура затрат на вычисления. Если у платформы все вычислительные мощности держатся на дорогой электроэнергии востока плюс временной аренде карт, цена рано или поздно отскочит. И наоборот, при наличии собственных возможностей диспетчеризации зелёных вычислений кривая затрат остаётся стабильной. При выборе стоит лишний раз спросить, откуда берётся электричество и где работают карты, — это надёжнее, чем смотреть только на цену за единицу.

Если вы как раз занимаетесь выбором API больших моделей, можно продолжить эту логику и посмотреть на один слой глубже: тренды стоимости аренды вычислительных мощностей и GPU-вычислений напрямую определят направление цен вашего AI-провайдера в будущем году.

Автор: Чжоу Минчжэ

Дата публикации: 4 октября 2026 года