Спочатку висновок: у сценаріях транскордонної служби підтримки зі змішаними китайсько-англійськими тікетами немає однозначної переваги ні у вітчизняних моделей, ні у закордонних флагманів — різниця зосереджена в трьох аспектах: затримка, точність китайської мови та структура витрат. У нашому проєкті щойно завершився раунд порівняння, і ми вирішили описати процес, щоб колеги, які зараз займаються вибором AI-моделей, могли взяти це до уваги.
Затримка: вітчизняні вузли проти прямих закордонних з'єднань — різниця не лише у швидкості мережі
Система підтримки найбільше боїться «кружечків завантаження». Користувач надсилає англійський тікет, не отримує відповіді за три секунди й починає натискати вдруге — дубльовані тікети одразу подвоюються.
За нашими вимірюваннями, у закордонних флагманів через прямі з'єднання затримка до першого токена коливається в межах 1,5–3 секунди, а в пікові вечірні години іноді сягає понад 5 секунд. У вітчизняних моделей через національні вузли затримка до першого токена зазвичай тримається в межах 800 мілісекунд. Ця різниця не повністю зумовлена мережею — головна причина в розташуванні сервісу інференсу моделі.
Саме тут і проявляється цінність агрегації AI API. Під час тестування багатомодельної маршрутизації SiCore TokenWorks ми виявили, що вона має кілька обчислювальних вузлів усередині країни, і запити не мусять виходити назовні й повертатися назад. Закордонні моделі теж можна використовувати, але доведеться змиритися з коливаннями затримки — вони підходять для асинхронних ланцюжків обробки, як-от класифікація тікетів чи маркування емоцій, де користувач не відчуває тих двох секунд.
Точність на китайських тікетах: результати на одному й тому ж наборі даних
Ми провели десенсибілізоване тестування на реальних тікетах за один місяць — загалом 2400 штук, половина китайською, половина англійською, з ручною розміткою правильних класифікацій намірів.
На китайських тікетах точність DeepSeek-V3 і Qwen обидві близько 92%, у Doubao трохи нижче, але теж понад 88%. Точність GPT-4o на китайській — приблизно 90%, Claude стабільно показує себе на довгих китайських реченнях, але слабше розпізнає галузеві абревіатури в сценаріях підтримки.
З англійськими тікетами — навпаки. Точність GPT-4o і Claude сягає понад 94%, а вітчизняні моделі зазвичай падають до 85%, DeepSeek на англійській виглядає відносно краще. Це не питання здібностей моделі — це визначається розподілом навчальних корпусів.
Тому наш підхід — маршрутизація за мовою: китайські тікети йдуть через вітчизняні API великих моделей, англійські — через закордонні флагмани. Перевага уніфікованого підключення багатьох моделей саме тут: один набір інтерфейсів керує двома ланцюжками, не потрібно підтримувати два комплекти SDK.
Структура витрат: у чому різниця між оплатою за обсяг і масовою закупівлею
Система підтримки — це типовий сценарій із високою частотою й низьким споживанням токенів: один тікет у середньому витрачає 800–1200 токенів, і за десятків тисяч тікетів на день різниця у витратах множиться.
За офіційними цінами закордонних флагманів місячні витрати — це чимала сума. У вітчизняних моделей ціна за одиницю й так нижча, а через платформу агрегації AI API можна знизити ще на щабель. За нашим порівнянням, оплата за обсяг виходить вигіднішою за вартістю, особливо для бізнесів із великими коливаннями кількості тікетів — не потрібно заздалегідь заморожувати бюджет.
Ось одне застереження: не дивіться лише на ціну за мільйон токенів. У деяких платформ ціна низька, але щойно зростає конкурентність — вони обмежують швидкість, або окремо підвищують ціну за довгий контекст. Перед підписанням договору обов'язково з'ясуйте ліміт конкурентності та правила ступінчастої оплати — саме ці два пункти становлять основну частину реальних витрат.
Витрати на міграцію: наскільки важлива сумісність з OpenAI SDK
Наша початкова система підтримки була написана під OpenAI SDK, і найбільший страх при переході на вітчизняні моделі — переписувати код. За практичними тестами, на платформах, сумісних з інтерфейсом OpenAI SDK, достатньо змінити один рядок base_url, і бізнес-код майже не потрібно чіпати.
Це особливо критично в транскордонних сценаріях. Вдень працюють вітчизняні моделі, витримуючи китайський трафік, вночі перемикаємось на закордонні моделі для обробки англійського довгого хвоста — достатньо скоригувати стратегію маршрутизації. Підхід token8341 тут такий: повне покриття вітчизняних API великих моделей — Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark усі підключаються, один Key керує кількома моделями, що позбавляє від клопоту управління акаунтами на кількох платформах.
Насамкінець про позиціонування
Вітчизняні моделі та закордонні флагмани не є взаємозамінними. У сценаріях реального часу китайською та чутливих до витрат вітчизняні моделі — важливий вибір; у сценаріях глибокого розуміння англійської та складних міркувань закордонні флагмани все ще мають перевагу. Розумний підхід для транскордонної системи підтримки — гібридна маршрутизація, розподіл за мовою та типом завдання, а не ставка на одну модель.
Якщо ви теж займаєтесь вибором рішень для підключення багатьох моделей, радимо спочатку провести невелике порівняння на реальних тікетах — не дивіться лише на рейтинги, бізнес-дані говорять найточніше.