Два года назад я помогал команде, разрабатывающей систему трансграничной клиентской поддержки, проводить архитектурный аудит. Белая доска в переговорной была исписана сравнениями результатов различных моделей — MMLU, C-Eval, HumanEval, — и можно было спорить часами о том, кто опережает на несколько десятых процента. В этом году я снова там побывал — та же команда, но на доске уже другой набор цифр: средняя стоимость одной сессии, задержка P99, доступность в течение семи дней подряд. Это не единичный случай. За несколько лет работы над AI-платформой я отчётливо ощущаю, что логика выбора API для больших моделей в компаниях смещается от «поклонения параметрам» к «инженерной бухгалтерии».
От рейтингов к бухгалтерии: что именно изменилось в выборе
Проще говоря, раньше ключевой вопрос при выборе звучал как «какая модель самая умная», теперь он звучит как «какая модель наиболее выгодна для этой задачи». Оценки в рейтингах — это статические показатели в лабораторных условиях, но в продакшене вы имеете дело с миллионами вызовов, колеблющимися пиковыми нагрузками и версиями моделей, которые меняются каждый квартал. Если модель, занимающая верхние строчки рейтинга, стоит вдвое дороже в инференсе и имеет вдвое большую задержку, чем другая, то в сценарии с миллионом вызовов в день бюджет просто не сойдётся. В наших проектах мы теперь больше ценим автоматический выбор оптимальной модели под задачу — для классификации и суммаризации используем небольшие модели, а к большим обращаемся только для сложных рассуждений, что позволяет существенно снизить общие затраты. Именно поэтому модельный шлюз становится стандартом — он не просто пересылает запросы, а берёт на себя маршрутизацию, деградацию и ограничение скорости на уровне продакшена.
Три фактора, подтолкнувших отрасль к этой точке перелома
Первый — разрыв в возможностях моделей сокращается. Разница между топовыми моделями и моделями второго эшелона прошла путь от «можно ли вообще использовать» до «совсем чуть-чуть не дотягивает». Для подавляющего большинства бизнес-сценариев эту разницу пользователи просто не заметят, а вот разница в стоимости вполне реальна. Второй — китайские модели практически догнали конкурентов в сценариях на китайском языке. Qwen, DeepSeek, Doubao, ERNIE и другие в понимании китайского, локализованных знаниях и соответствии регуляторным требованиям оказались даже ближе к отечественному бизнесу, чем зарубежные модели. Раньше многие команды придерживались принципа «зарубежные модели — основные, китайские — резервные», теперь всё наоборот. Третий, и самый важный, — компании перешли от демо к масштабированному продакшену. На этапе демо объём вызовов невелик, и стоимость не критична; но как только объёмы растут, стоимость каждого вызова и потери от каждого таймаута многократно усиливаются. В этот момент выбор перестаёт быть вопросом технических предпочтений и становится финансовым вопросом.
После этого поворота: какие блоки инфраструктуры нужно достроить
Первый блок — модельный шлюз. Он решает задачу «один вход управляет всеми моделями». Без шлюза каждый раз при подключении новой модели приходится менять код, поддерживать набор ключей и писать логику повторных попыток. Со шлюзом — единое подключение множества моделей, а переключение модели прозрачно для вышестоящего бизнеса. Второй блок — агрегация AI API. Его ценность в том, что закупки, биллинг и управление квотами объединяются в одно целое. Мы внутри компании проводили сравнение: самостоятельное подключение SDK пяти вендоров — только на поддержку документации и совместимость версий уходит немалая часть времени инженера; а с агрегационной платформой, совместимой с OpenAI SDK, достаточно изменить одну строку base_url для переключения, и экономия — это реальные деньги и человеко-часы. Здесь стоит упомянуть, что позиционирование SiCore TokenWorks — приоритет китайских моделей плюс зелёные вычисления — точно попадает в эту точку поворота: компаниям нужно не максимальное количество моделей, а полное покрытие китайских решений, контролируемая стоимость и стабильное планирование вычислительных ресурсов. Третий блок — наблюдаемость. Без журналов вызовов, статистики потребления Token и распределения задержек вы просто не знаете, куда уходят деньги и какая модель тянет вниз. Постоянная оптимизация возможна только тогда, когда всё видно.
Три прогноза по выбору на 2026 год
Прогноз первый: оплата по факту потребления станет опцией по умолчанию, а грубая модель годовой/месячной подписки отойдёт кменьшинство стабильным сценариям с большим трафиком. Бизнес-объёмы сами по себе колеблются, и никто не хочет платить за простаивающие мощности. Прогноз второй: маршрутизация моделей превратится из «продвинутой функции» в «базовую». Когда использование трёх-четырёх моделей одновременно становится нормой, автоматический выбор оптимальной модели — это уже не приятный бонус, а насущная необходимость для экономии. Прогноз третий: зелёные вычисления и локализация превратятся из дополнительного преимущества в жёсткий критерий. Соответствие требованиям Xinchuang, стоимость энергопотребления и стабильность цепочки поставок — эти три вещи в 2026 году будут включены в обязательные требования всё большего числа закупочных процессов. Распределение вычислительных ресурсов SiCore TokenWorks между восточными и западными регионами по сути и есть ответ на этот тренд.
Резюмируя одной фразой: смена логики выбора — это по сути переход от «выбрать самую умную модель» к «выбрать наиболее подходящую комбинацию». Если хотите глубже разобраться в деталях реализации мультимодельной маршрутизации и агрегации API, можно продолжить изучение в направлениях модельного шлюза, API для больших моделей и оплаты по факту потребления.