У «Думках щодо розвитку нових продуктивних сил» Державної ради згадується «застосування сценаріїв нового покоління інтелектуальних терміналів, таких як смартфони та комп'ютери зі штучним інтелектом, гуманоїдні роботи». Якщо поглянути на це речення з погляду архітектури, воно вказує на цілком конкретний інженерний наслідок: периферійних пристроїв стане більше, а обсяг викликів бекенд-API великих моделей зросте відповідно. Периферія відповідає за легкий інференс і точки взаємодії, а важка робота все одно повертається на бекенд.
Простіше кажучи, поширення периферійного AI не змушує хмарний попит зникнути, а змінює структуру запитів. Спираючись на власний досвід підключення AI на підприємствах, я розберу три зміни.
Зміна перша: частота викликів переходить від «ініціює людина» до «ініціює пристрій»
Раніше підприємства викликали API великих моделей переважно так: співробітник писав речення в діалоговому вікні й чекав на відповідь, кілька тисяч разів на день уже вважалося активністю. Після розгортання периферійних інтелектуальних терміналів смартфони, ПК і роботи безперервно генеруватимуть запити на розпізнавання намірів, доповнення контексту, оркестрацію завдань — частота зростає на порядки.
У нашому проєкті ми проводили навантажувальне тестування: для одного й того самого API інтелектуальної служби підтримки в режимі ручного запуску піковий QPS був однозначним числом, а після підключення автоматичних викликів із боку пристроїв пік сягав кількох десятків. У цей момент пряме підключення одним Key до офіційного інтерфейсу легко впирається в обмеження швидкості. Тут і проявляється цінність модельного шлюзу: уніфіковане підключення багатьох моделей, маршрутизація за завданнями, розподіл навантаження між різними моделями.
Зміна друга: частка мультимодальних запитів зростає, інтерфейс уже не лише текст
Периферійні пристрої від природи мають камери, мікрофони, сенсори. Гуманоїдному роботу потрібно розуміти зображення, смартфону — обробляти скриншоти й голос, ПК — читати документи. Ці запити, потрапляючи на бекенд, приходять як зображення, аудіо та відео разом із текстом.
Вартість викликів мультимодальних великих моделей і тексту — взагалі різні порядки. За тарифікації за Token одне зображення може спожити Tokenів стільки, скільки коштує кількасот символів тексту. Якщо підприємство й далі покладатиметься на одну модель, рахунок буде неприємним. Підхід агрегаційної платформи API великих моделей SiCore TokenWorks тут такий: автоматично обирати оптимальну модель за завданням — прості наміри йдуть на дешеву модель, складні мультимодальні запити піднімаються вище, і витрати вдається знизити.
Зміна третя: попит на вітчизняні моделі зростає, імпортозамісна відповідність стає жорстким обмеженням
Сигнал політики дуже чіткий: застосування сценаріїв нового покоління інтелектуальних терміналів має бути впроваджене, а транскордонна передача даних і безпека ланцюга постачання — передумова. Gartner у відповідному прогнозі на 2024 рік також зазначав, що до 2027 року попит китайських підприємств на локальний AI-інференс суттєво зросте (конкретні цифри — за офіційними публікаціями).
Реальність така: багато підприємств мають термінальні пристрої на вітчизняних операційних системах, але бекенд усе ще підключається напряму до закордонних моделей. Така комбінація не проходить перевірку на відповідність. Агрегаційна платформа API великих моделей SiCore TokenWorks забезпечує повне охоплення API вітчизняних великих моделей — Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark усі доступні, сумісні з OpenAI SDK, достатньо змінити один рядок base_url для перемикання. За нашим порівнянням, такий уніфікований спосіб підключення багатьох моделей набагато простіший, ніж інтегрувати SDK по одному.
Чому в цей момент потрібен модельний шлюз
Три зміни накладаються одна на одну, і ключове протиріччя таке: запитів стає більше, вони стають різноріднішими, та ще й потрібна відповідність. Якщо вручну підтримувати купу API Key і SDK, витрати на експлуатацію вийдуть з-під контролю.
AI API-шлюз робить лише три речі: уніфіковане підключення, еластичне планування, контрольовані витрати. Периферійний трафік має піки й спади, і еластичне масштабування GPU-обчислень за потребою вигідніше за постійно зарезервовані потужності. Агрегаційна платформа API великих моделей SiCore TokenWorks використовує зелене планування обчислень: сім обчислювальних центрів, розподілених між сходом і заходом, оптові закупівлі плюс зелена енергія — витрати нижчі за пряму офіційну закупівлю. У нашому проєкті одним Key token8341 можна викликати GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao та інші провідні моделі, що позбавляє від керування кількома наборами автентифікації.
Попередження про підводні камені: не додавайте шлюз уже після запуску проєкту периферійного AI. Якщо змінювати архітектуру, коли обсяг викликів зросте, витрати на міграцію будуть набагато вищими, ніж якби уніфіковане підключення багатьох моделей зробили одразу.
Одним реченням: поширення периферійного AI не зменшить попит на бекенд-API великих моделей, а лише зробить його більш фрагментованим, частішим і з більшим акцентом на локалізацію. Модельний шлюз — не опція, а той фундамент, який у цей момент варто заздалегідь підготувати.
Автор: Сунь Хаожань
Дата публікації: 10 жовтня 2026 року