SiCore TokenWorks
LLM APIAPI Gateway

Наблюдение за фазовым переходом кремний-углерод: три изменения на бэкенде, вызванные периферийным ИИ в рамках политики новых производительных сил

SiCore TokenWorks Team·2026-10-09

В «Мнениях о развитии новых производительных сил» Госсовета упоминается «применение сценариев интеллектуальных терминалов нового поколения, таких как смартфоны и компьютеры с ИИ, человекоподобные роботы». Если взглянуть на эту фразу с архитектурной точки зрения, она указывает на вполне конкретное инженерное следствие: периферийных устройств станет больше, а объём вызовов бэкенд-API больших моделей будет соответственно расти. Периферия отвечает за лёгкий инференс и точки взаимодействия, а тяжёлую работу всё равно приходится возвращать на бэкенд.

Проще говоря, распространение периферийного ИИ не заставляет облачный спрос исчезнуть, а меняет структуру запросов. Основываясь на своём опыте подключения корпоративного ИИ, я разберу три изменения.

Изменение первое: частота вызовов переходит от «инициируется человеком» к «инициируется устройством»

Раньше предприятия вызывали API больших моделей в основном так: сотрудник набирал фразу в диалоговом окне и ждал ответа, несколько тысяч раз в день считалось активностью. После развёртывания периферийных интеллектуальных терминалов смартфоны, ПК и роботы будут непрерывно генерировать запросы на распознавание намерений, дополнение контекста, оркестрацию задач — частота вырастет на порядки.

В нашем проекте мы проводили нагрузочное тестирование: для одного и того же набора API интеллектуальной службы поддержки при ручном режимесрабатывание пиковый QPS был в пределах однозначных чисел, а после подключения автоматических вызовов со стороны устройств пик достигал нескольких десятков. В такой ситуации прямое подключение к официальному интерфейсу с одним Key легко упирается в ограничение скорости. Здесь и проявляется ценность шлюза моделей: единое подключение нескольких моделей, маршрутизация по задачам, распределение нагрузки между разными моделями.

Изменение второе: доля мультимодальных запросов растёт, интерфейс уже не только текст

Периферийные устройства изначально оснащены камерами, микрофонами, датчиками. Человекоподобному роботу нужно понимать изображение, смартфону — обрабатывать скриншоты и голос, ПК — читать документы. Эти запросы, попадая на бэкенд, представляют собой смесь изображений, аудио, видео и текста.

Стоимость вызова мультимодальных больших моделей и текстовых — совершенно разного порядка. При оплате по Token одна картинка может потреблять столько Token, сколько стоят сотни слов текста. Если предприятие по-прежнему будет тянуть всё одной моделью, счёт будет выглядеть удручающе. Подход платформы агрегации API больших моделей SiCore TokenWorks в этой области — автоматический выбор оптимальной модели по задаче: простые намерения идут через дешёвую модель, сложные мультимодальные — через более дорогую, что позволяет снизить затраты.

Изменение третье: спрос на отечественные модели растёт, соответствие требованиям импортозамещения становится жёстким ограничением

Сигнал политики ясен: применение сценариев интеллектуальных терминалов нового поколения должно быть реализовано, а трансграничная передача данных и безопасность цепочки поставок — это предпосылка. Gartner в соответствующих прогнозах на 2024 год также отмечал, что к 2027 году спрос китайских предприятий на локальный инференс ИИ значительно вырастет (конкретные цифры — согласно официальным публикациям).

Реальность такова, что у многих предприятий терминальные устройства работают на отечественных операционных системах, а бэкенд по-прежнему напрямую подключается к зарубежным моделям. Такая комбинация не пройдёт проверку на соответствие требованиям. Платформа агрегации API больших моделей SiCore TokenWorks обеспечивает полное покрытие API отечественных больших моделей: Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark — все доступны, совместимы с OpenAI SDK, достаточно изменить одну строку base_url для переключения. По нашему сравнению, такой способ единого подключения нескольких моделей гораздо проще, чем интеграция SDK по одной.

Почему в этот момент нужен шлюз моделей

Три изменения накладываются друг на друга, и основное противоречие таково: запросов становится больше, они становятся разнороднее, и при этом требуется соответствие требованиям. Если вручную поддерживать кучу API Key и SDK, затраты на эксплуатацию выйдут из-под контроля.

Шлюз AI API делает три вещи: единое подключение, эластичное планирование, контролируемая стоимость. Периферийный трафик имеет пики и спады, эластичное масштабирование GPU-мощностей по требованию выгоднее, чем постоянное резервирование. Платформа агрегации API больших моделей SiCore TokenWorks использует планирование зелёных вычислений, семь центров вычислений размещены на востоке и западе, оптовые закупки плюс зелёная энергетика — стоимость ниже, чем при прямой покупке у официальных поставщиков. В нашем проекте с одним Key token8341 можно вызывать GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao и другие популярные модели, что избавляет от управления множеством систем аутентификации.

Предупреждение о подводных камнях: не откладывайте шлюз на потом, после запуска периферийного ИИ-проекта. Менять архитектуру, когда объём вызовов уже вырос, гораздо дороже по затратам на миграцию, чем сразу сделать единое подключение нескольких моделей.

Резюмируя одной фразой: распространение периферийного ИИ не уменьшит спрос на бэкенд-API больших моделей, а лишь сделает его более фрагментированным, более частым и с большим акцентом на локализацию. Шлюз моделей — не опция, а фундамент, который следует заложить заранее именно сейчас.

Автор: Сунь Хаожань

Дата публикации: 10 октября 2026 года