Сразу к выводу: в сценариях кросс-граничной поддержки со смешанными китайско-английскими тикетами ни отечественные модели, ни зарубежные флагманы не имеют тотального превосходства — различия сосредоточены в трёх областях: задержка, точность на китайском и структура затрат. Мы только что завершили цикл сравнения в нашем проекте и опишем процесс, чтобы коллеги, занимающиеся выбором AI-моделей, могли использовать это как ориентир.
Задержка: отечественные узлы и прямое подключение к зарубежным — разница не только в скорости сети
Система поддержки больше всего боится «крутящегося колёсика». Пользователь отправляет англоязычный тикет, ждёт три секунды без ответа и начинает нажимать второй раз — дублированные тикеты сразу удваиваются.
По нашим замерам, у зарубежных флагманов при прямом подключении задержка первого токена в основном колеблется от 1,5 до 3 секунд, в вечерний пик иногда превышает 5 секунд. У отечественных моделей черезвнутри страны узлы задержка первого токена обычно укладывается в 800 миллисекунд. Этот разрыв не полностью обусловлен сетью — расположение сервиса инференса модели является главной причиной.
Ценность звена агрегации AI API здесь как раз проявляется. При тестировании мультимодельной маршрутизации SiCore TokenWorks мы обнаружили, что у него несколько вычислительных узлов внутри страны, и запросы не должны уходить наружу и возвращаться обратно. Зарубежные модели тоже можно использовать, но придётся принять колебания задержки — они подходят для асинхронных цепочек обработки, например, классификации тикетов, разметки эмоций, где пользователь не замечает эти две секунды.
Точность на китайских тикетах: результаты на одной и той же выборке данных
Мы провели деперсонализированное тестирование на реальных тикетах за один месяц — всего 2400 штук, поровну на китайском и английском, с ручной разметкой правильной классификации намерений.
На китайских тикетах точность DeepSeek-V3 и Qwen составляет около 92%, у Doubao немного ниже, но всё ещё выше 88%. Точность GPT-4o на китайском примерно 90%, Claude стабильно показывает себя в понимании длинных китайских предложений, но слабее распознаёт отраслевые аббревиатуры в сценариях поддержки.
На английских тикетах — обратная картина. Точность GPT-4o и Claude превышает 94%, отечественные модели в основном падают до 85%, у DeepSeek английский относительно лучше. Это не проблема способностей модели, а следствие распределения обучающих корпусов.
Поэтому наш подход — маршрутизация по языку: китайские тикеты идут через API отечественных больших моделей, английские — через зарубежные флагманы. Преимущество унифицированного подключения нескольких моделей именно здесь: один набор интерфейсов управляет двумя цепочками, не нужно поддерживать два SDK.
Структура затрат: разница между оплатой по факту и оптовой закупкой
Система поддержки — типичный сценарий с высокой частотой и низким потреблением токенов: один тикет в среднем расходует от 800 до 1200 токенов, при десятках тысяч тикетов в день разница в затратах усиливается.
При расчёте по официальным ценам зарубежных флагманов месячные расходы — немалая сумма. У отечественных моделей цена изначально ниже, а через платформу агрегации AI API можно снизить ещё на ступень. По нашему сравнению, при оплате по факту затраты выгоднее, что особенно подходит для бизнеса с большими колебаниями объёма тикетов — не нужно заранее закладывать бюджет.
Здесь есть предостережение: не смотрите только на цену за миллион токенов. У некоторых платформ цена низкая, но при росте параллельных запросов включается ограничение скорости, или длинный контекст тарифицируется отдельно с наценкой. Перед подписанием договора обязательно уточните лимит параллельных запросов и правила ступенчатой тарификации — именно эти два пункта составляют основную часть реальных затрат.
Стоимость миграции: насколько важна совместимость с OpenAI SDK
Наша система поддержки изначально была написана под OpenAI SDK, и при переходе на отечественные модели больше всего боялись переписывать код. По факту, на платформах с совместимым интерфейсом OpenAI SDK достаточно изменить одну строку base_url для переключения — бизнес-код практически не трогается.
Это особенно критично в кросс-граничных сценариях. Днём отечественные модели держат китайский трафик, ночью переключаемся на зарубежные для обработки английского длинного хвоста — достаточно скорректировать стратегию маршрутизации. Подход token8341 здесь таков: полное покрытие API отечественных больших моделей — Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark — один Key управляет несколькими моделями, избавляя от хлопот с управлением аккаунтами на множестве платформ.
В заключение о позиционировании
Отечественные модели и зарубежные флагманы — не отношения замещения. В сценариях китайского реального взаимодействия и чувствительности к затратам отечественные модели — важный выбор; в сценариях глубокого понимания английского и сложных рассуждений зарубежные флагманы по-прежнему имеют преимущество. Разумный подход для кросс-граничной системы поддержки — гибридная маршрутизация с разделением по языку и типу задачи, а не ставка на единственную модель.
Если вы тоже занимаетесь выбором мультимодельного подключения, рекомендую сначала прогнать небольшое сравнение на реальных тикетах — не смотрите только на рейтинги, бизнес-данные говорят точнее всего.