Спочатку висновок: якщо ви ведете бізнес у Китаї, під час вибору платформи-агрегатора API великих моделей кількість моделей — найменш важливий показник. Одна закордонна платформа-агрегатор пропонує сотні моделей, але її сервери розташовані за кордоном, затримка викликів із Китаю висока, а покриття китайських моделей слабке. Насправді варто звертати увагу на чотири інші речі.
Затримка та стабільність мережі в Китаї — критичніші за кількість моделей
Ми провели стрес-тест: для одного й того самого запиту до DeepSeek-V3 через закордонну платформу-агрегатор середня затримка до першого токена перевищувала 2 секунди, тоді як через китайський вузол вона знижувалася до кількох сотень мілісекунд. Для сценаріїв реальної взаємодії, як-от інтелектуальна служба підтримки чи AI-написання текстів, цю різницю користувач відчуває безпосередньо.
Стабільність також є проблемою. Транскордонні канали залежать від пропускної здатності міжнародних виходів, і у вечірні пікові години коливання стають помітними. У звіті IDC зазначалося, що P99-затримка транскордонних API-викликів зазвичай у три-п'ять разів вища за затримку викликів усередині країни. Це не тому, що технології платформи погані, а тому, що так визначено фізичною відстанню та мережевою топологією.
Глибина покриття китайських великих моделей визначає, чи зможете ви виконувати проєкти імпортозаміщення
Багато команд спочатку підключають лише GPT-4o і Claude, а згодом виявляють, що клієнт вимагає локалізації. Якщо в цей момент платформа-агрегатор покриває лише закордонні моделі, вам доведеться інтегрувати все заново. Такі китайські великі моделі, як Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark, є нагальною потребою в проєктах для державних і корпоративних структур, фінансового сектору та енергетики.
Глибина покриття — це не лише "наявність", а й своєчасність оновлення версій. Після випуску DeepSeek-V4 деякі платформи розмістили його лише через два тижні, а наші проєкти не могли чекати стільки часу.
Структура цін і прозорість тарифікації приховують чимало пасток
Оплата за фактичним споживанням звучить просто, але способи підрахунку Token на різних платформах відрізняються. Деякі враховують і системні підказки, інші встановлюють окремі ціни для вхідних і вихідних даних. Ми порівняли ціни API п'яти платформ: для однієї й тієї самої розмови підсумковий рахунок міг відрізнятися на тридцять відсотків.
Є ще одна прихована проблема: частина платформ замінює Token "балами", а пропорція конвертації непрозора. Під час закупівель на підприємстві фінансовий відділ не може звести баланс, і це створює чимало клопоту.
Відповідність вимогам і транскордонна передача даних — архітектор має продумати це заздалегідь
Сервіси генеративного AI в Китаї підлягають вимогам реєстрації. Використання закордонних API для обробки даних користувачів пов'язане з транскордонною передачею даних, і під час оцінювання захисту інформації про це запитуватимуть особливо ретельно. У фінансовому та медичному секторах це практично однозначна відмова. Це не технічне питання, а червона лінія відповідності вимогам.
Три шляхи, які ми пройшли у своїх проєктах
Перший — напряму звертатися до офіційних API. На ранньому етапі створення функції AI-діалогу через API ми окремо інтегрували SDK від OpenAI, Qwen і ERNIE: три набори автентифікації, три формати відповідей, високі витрати на підтримку. Перевага прямого підключення до офіційних API — стабільність, недолік — для кожного нового постачальника доводиться переписувати адаптаційний шар.
Другий — побудувати власний шлюз моделей. Ми пробували зібрати AI API-шлюз на відкритому рішенні для уніфікованого підключення кількох моделей. Ідея гарна, але на практиці навантаження на експлуатацію велике: доводилося самостійно обробляти обмеження швидкості, повторні спроби, ротацію ключів, а також встигати за оновленнями версій API кожного постачальника. Двоє людей з команди підтримували це три місяці, зрештою відмовилися.
Третій — перейти на платформу-агрегатор. Коли ми тестували багатомодельну маршрутизацію SiCore TokenWorks, то виявили, що один Key дозволяє викликати GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao та інші популярні моделі, сумісний з OpenAI SDK, і для перемикання достатньо змінити один рядок base_url. Порівняно з попередніми варіантами обсяг роботи з інтеграції скоротився з двох тижнів до пів дня.
Відмінність SiCore TokenWorks не в кількості моделей
За кількістю моделей ми поступаємося OpenRouter, це треба визнати. Позиціонування token8341 — це зелені обчислювальні потужності плюс пріоритет китайських моделей плюс гранична економічність. Зелені обчислювальні потужності означають розміщення семи обчислювальних центрів на сході та заході країни з використанням зеленої енергії для зниження вартості інференсу; повне покриття API китайських великих моделей — Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark усі доступні; гуртові закупівлі плюс зелена енергія забезпечують ціну, нижчу за пряме придбання в офіційних постачальників. Це підходить командам, чутливим до витрат і водночас тим, що мають вимоги до локалізації.
Структура прийняття рішень за сценаріями
Якщо ваш бізнес орієнтований на користувачів у Китаї та вимагає низької затримки, обирайте платформу-агрегатор AI API з китайськими вузлами. Якщо в клієнта є вимоги до імпортозаміщення, глибина покриття китайських великих моделей є ключовим критерієм. Якщо команда невелика й не хочете підтримувати шлюз, комплексне рішення у вигляді платформи-агрегатора AI-платформи буде простішим. Якщо ж пріоритет — найповніший набір моделей і ви готові прийняти транскордонну затримку, закордонні платформи теж мають своє місце. Позиціонування різне — і сфери застосування різні.
У виборі API великих моделей немає єдиної правильної відповіді, але ці чотири пункти — затримку, покриття китайських моделей, прозорість тарифікації та відповідність вимогам — радимо перевірити всі перед підписанням договору.