Сначала вывод: если вы ведёте бизнес в Китае, при выборе агрегатора API больших моделей количество моделей — наименее важный показатель. У одной зарубежной платформы-агрегатора висят сотни моделей, но серверы находятся за границей, задержка вызовов из Китая высокая, а покрытие китайских моделей слабое. Реально смотреть нужно на четыре другие вещи.
Задержка и стабильность сети внутри Китая важнее количества моделей
Мы проводили нагрузочный тест: для одного и того же запроса к DeepSeek-V3 через зарубежную платформу-агрегатор средняя задержка до первого токена составляла более 2 секунд, а через отечественный узел сжималась до нескольких сотен миллисекунд. Для сценариев реального взаимодействия — интеллектуальной поддержки клиентов, AI-генерации текста — эту разницу пользователь чувствует напрямую.
Стабильность тоже проблема. Трансграничные каналы зависят от пропускной способности международных выходов, в вечерний пик наблюдаются заметные колебания. В отчёте IDC упоминалось, что P99 задержки трансграничных API-вызовов обычно в три-пять раз выше, чем у вызовов внутри страны. Это не потому, что платформа технически слаба, а потому что так определяют физическое расстояние и сетевая топология.
Глубина покрытия китайских больших моделей определяет, сможете ли вы делать проекты для сферы Xinchuang
Многие команды поначалу подключают только GPT-4o и Claude, а по ходу работы обнаруживают, что заказчик требует локализации. В этот момент, если агрегатор покрывает только зарубежные модели, придётся переподключаться заново. Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark и другие китайские большие модели — это насущная необходимость в проектах для госсектора, финансов и энергетики.
Глубина покрытия — это не только «есть или нет», но и своевременность обновления версий. После выхода DeepSeek-V4 некоторые платформы разместили его только через две недели, а в наших проектах ждать столько времени нельзя.
Структура цен и прозрачность биллинга скрывают немало подводных камней
Оплата по факту использования звучит просто, но способы подсчёта Token на разных платформах различаются. Где-то в счёт включают системный промпт, где-то отдельно тарифицируют вход и выход. Мы сравнивали API-цены пяти платформ: за один и тот же диалог итоговый счёт мог отличаться на тридцать процентов.
Есть и скрытая проблема: некоторые платформы используют «баллы» вместо Token, а коэффициент пересчёта непрозрачен. При корпоративных закупках бухгалтерия не сходится — это очень хлопотно.
Комплаенс и трансграничная передача данных — архитектор обязан продумать это заранее
Услуги генеративного AI в Китае подлежат регистрации. Использование зарубежных API для обработки пользовательских данных затрагивает трансграничную передачу данных, и на оценке соответствия уровню защиты к этому будут придираться в первую очередь. Для финансовой и медицинской отраслей это практически автоматический отказ. Это не техническая проблема, а красная линия комплаенса.
Три пути, и все мы прошли на своих проектах
Первый — обращаться напрямую к официальным API. На раннем этапе работы над функцией AI-диалогов мы отдельно подключали SDK от OpenAI, Qwen и ERNIE: три набора аутентификации, три формата ответов, высокие затраты на поддержку. Плюс прямого подключения к официальным API — стабильность, минус — при каждом новом подключении приходится переписывать слой адаптации.
Второй — построить собственный шлюз моделей. Мы пробовали собрать AI API-шлюз на открытых решениях для унифицированного доступа к нескольким моделям. Идея хорошая, но на практике нагрузка по эксплуатации большая: нужно самостоятельно обрабатывать ограничение скорости, повторы, ротацию ключей, а также следить за обновлениями версий API у каждого поставщика. Команда из двух человек поддерживала это три месяца, а потом отказалась.
Третий — выйти на платформу-агрегатор. Тестируя мультимодельную маршрутизацию SiCore TokenWorks, мы обнаружили, что одним ключом можно вызывать GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao и другие популярные модели, совместимые с OpenAI SDK, — достаточно изменить одну строку base_url, чтобы переключиться. По сравнению с остальными вариантами объём работ по интеграции сократился с двух недель до половины дня.
Отличие SiCore TokenWorks не в количестве моделей
По количеству моделей мы уступаем OpenRouter — это надо признать. Позиционирование token8341 — зелёные вычисления плюс приоритет отечественных решений плюс максимальная экономическая эффективность. Зелёные вычисления означают размещение семи вычислительных центров на востоке и западе страны с использованием зелёной энергии для снижения стоимости инференса; полное покрытие API китайских больших моделей — Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark — всё подключается; оптовые закупки плюс зелёная энергия дают цену ниже прямой покупки у официальных поставщиков. Подходит командам, чувствительным к затратам и одновременно имеющим требования по локализации.
Фреймворк выбора по сценариям
Если ваш бизнес ориентирован на китайских пользователей и требует низкой задержки — в первую очередь выбирайте агрегатор AI API с отечественными узлами. Если у заказчика есть требования Xinchuang — глубина покрытия китайских больших моделей становится жёстким критерием. Если команда небольшая и не хочет поддерживать шлюз — комплексное решение AI-платформы на базе агрегатора избавит от лишних хлопот. Если важнее всего максимально полный набор моделей и вы готовы мириться с трансграничной задержкой — зарубежная платформа тоже имеет право на существование. Позиционирование разное — сценарии применения разные.
У выбора API больших моделей нет единственно верного ответа, но эти четыре пункта — задержку, покрытие китайских моделей, прозрачность биллинга и комплаенс — рекомендую проверить до подписания договора.