Najpierw wnioski: w scenariuszach transgranicznej obsługi klienta z mieszanymi zgłoszeniami chińsko-angielskimi, ani modele krajowe, ani zagraniczne flagowce nie dominują wszechstronnie. Różnice koncentrują się w trzech obszarach: opóźnienie, dokładność w języku chińskim i struktura kosztów. W naszym projekcie właśnie zakończyliśmy rundę porównań i opisujemy proces, aby dać punkt odniesienia kolegom, którzy dokonują wyboru modeli AI.
Opóźnienie: krajowe węzły vs bezpośrednie połączenie zagraniczne — różnica to nie tylko prędkość sieci
System obsługi klienta najbardziej boi się kręcącego się kółka. Użytkownik wysyła zgłoszenie po angielsku, czeka trzy sekundy bez odpowiedzi i zaczyna klikać drugi raz — duplikaty zgłoszeń natychmiast się podwajają.
W naszych testach zagraniczne flagowce przez bezpośrednie połączenie miały opóźnienie pierwszego tokenu wahające się zasadniczo między 1,5 a 3 sekundami, a w szczycie wieczornym sporadycznie przekraczające 5 sekund. Modele krajowe przez węzły krajowe miały opóźnienie pierwszego tokenu powszechnie poniżej 800 milisekund. Ta różnica nie wynika wyłącznie z sieci — lokalizacja usługi inferencji modelu jest głównym czynnikiem.
Wartość agregacji AI API ujawnia się właśnie tutaj. Podczas testowania wielomodelowego routingu SiCore TokenWorks odkryliśmy, że ma wiele węzłów obliczeniowych w kraju, a żądania nie muszą wychodzić na zewnątrz i wracać. Modele zagraniczne też można stosować, trzeba tylko zaakceptować wahania opóźnień — nadają się do asynchronicznych łańcuchów przetwarzania, takich jak klasyfikacja zgłoszeń czy oznaczanie emocji, gdzie użytkownik nie odczuwa tych dwóch sekund.
Dokładność chińskich zgłoszeń: wyniki z tego samego zbioru danych
Przeprowadziliśmy test na zanonimizowanych prawdziwych zgłoszeniach z jednego miesiąca — łącznie 2400 sztuk, po połowie chińskich i angielskich, z ręcznie oznaczoną poprawną klasyfikacją intencji.
W przypadku chińskich zgłoszeń dokładność DeepSeek-V3 i Qwen wynosiła około 92%, Doubao nieco niżej, ale powyżej 88%. Dokładność GPT-4o w języku chińskim to około 90%, Claude jest stabilny w rozumieniu długich chińskich zdań, ale słabszy w rozpoznawaniu branżowych skrótów w scenariuszach obsługi klienta.
W przypadku angielskich zgłoszeń jest odwrotnie. GPT-4o i Claude osiągają dokładność powyżej 94%, modele krajowe spadają powszechnie do około 85%, DeepSeek wypada stosunkowo lepiej po angielsku. To nie kwestia zdolności modelu, lecz rozkładu korpusu treningowego.
Dlatego nasze podejście to routing według języka: chińskie zgłoszenia kierujemy do krajowych API dużych modeli, angielskie do zagranicznych flagowców. Zaleta ujednoliconego dostępu do wielu modeli polega na tym, że jeden interfejs obsługuje dwa łańcuchy — nie trzeba utrzymywać dwóch zestawów SDK.
Struktura kosztów: czym różni się rozliczenie za zużycie od zakupu hurtowego
System obsługi klienta to typowy scenariusz wysokiej częstotliwości i niskiego zużycia tokenów — pojedyncze zgłoszenie zużywa średnio 800 do 1200 tokenów, a przy dziesiątkach tysięcy dziennie różnice kosztów się powiększają.
Zagraniczne flagowce według oficjalnych cen to niemały wydatek miesięczny. Ceny jednostkowe modeli krajowych są już niższe, a przez platformę agregacji AI API można zejść jeszcze o poziom. W naszym porównaniu okazało się, że rozliczenie za zużycie jest korzystniejsze kosztowo, szczególnie dla biznesów o zmiennym wolumenie zgłoszeń — nie trzeba z góry rezerwować budżetu.
Jest tu jedno ostrzeżenie: nie patrzcie tylko na cenę za milion tokenów. Niektóre platformy mają niską cenę, ale przy wzroście współbieżności ograniczają przepustowość albo osobno podnoszą cenę za długi kontekst. Przed podpisaniem umowy koniecznie zapytajcie o limit współbieżności i zasady rozliczenia progowego — te dwa elementy to prawdziwy główny składnik kosztów.
Koszt migracji: jak ważna jest kompatybilność z OpenAI SDK
Nasz pierwotny system obsługi klienta był napisany pod OpenAI SDK, a przy przejściu na modele krajowe najbardziej obawialiśmy się przepisywania kodu. W testach okazało się, że platformy kompatybilne z interfejsem OpenAI SDK wymagają zmiany jednej linii base_url, a kod biznesowy zasadniczo nie wymaga modyfikacji.
To jest szczególnie istotne w scenariuszach transgranicznych. W dzień modele krajowe obsługują chiński ruch, w nocy modele zagraniczne przetwarzają angielski długi ogon — wystarczy dostosować strategię routingu. Podejście token8341 w tym obszarze polega na pełnym pokryciu krajowych API dużych modeli — Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark — jeden Key zarządza wieloma modelami, eliminując kłopot zarządzania kontami na wielu platformach.
Na koniec o pozycjonowaniu
Modele krajowe i zagraniczne flagowce nie są wobec siebie alternatywą. W scenariuszach chińskiej interakcji w czasie rzeczywistym i wrażliwych na koszty modele krajowe są ważnym wyborem; w scenariuszach głębokiego rozumienia angielskiego i złożonego rozumowania zagraniczne flagowce wciąż mają przewagę. Rozsądnym podejściem w transgranicznym systemie obsługi klienta jest routing hybrydowy, rozdzielający ruch według języka i typu zadania, a nie stawianie na jeden model.
Jeśli również dokonujecie wyboru przy integracji wielu modeli, radzimy najpierw przeprowadzić małą rundę porównań na prawdziwych zgłoszeniach — nie patrzcie tylko na rankingi ewaluacyjne, dane biznesowe mówią najdokładniej.