Commençons par la conclusion : si vous opérez en Chine, le nombre de modèles est le critère le moins important lors du choix d'une plateforme d'agrégation d'API de grands modèles. Une plateforme d'agrégation étrangère affiche des centaines de modèles, mais ses serveurs sont à l'étranger, la latence d'appel depuis la Chine est élevée, et la couverture des modèles nationaux est faible. Ce qu'il faut vraiment examiner, ce sont quatre autres points.
La latence réseau et la stabilité en Chine, plus critiques que le nombre de modèles
Nous avons réalisé un test de charge : pour une même requête vers DeepSeek-V3, la latence moyenne du premier token via une plateforme d'agrégation étrangère dépasse les 2 secondes, tandis qu'elle peut descendre à quelques centaines de millisecondes via un nœud national. Pour des scénarios d'interaction en temps réel comme le service client intelligent ou la rédaction par IA, cet écart est directement perceptible par l'utilisateur.
La stabilité pose également problème. Les liaisons transfrontalières sont affectées par la bande passante des sorties internationales, avec des oscillations marquées aux heures de pointe. Dans les rapports IDC, il est mentionné que la latence P99 des appels API transfrontaliers est généralement trois à cinq fois supérieure à celle des appels domestiques. Ce n'est pas un problème de compétence technique de la plateforme, c'est déterminé par la distance physique et la topologie réseau.
La profondeur de couverture des grands modèles nationaux, détermine si vous pouvez mener des projets d'informatisation souveraine
Beaucoup d'équipes commencent par n'intégrer que GPT-4o et Claude, puis découvrent en cours de route que les clients exigent une solution nationale. À ce moment-là, si la plateforme d'agrégation ne couvre que des modèles étrangers, vous devez tout réintégrer. Pangu, DeepSeek, Tongyi Qianwen, ERNIE, Doubao, iFlytek Spark et autres grands modèles nationaux sont indispensables dans les projets gouvernementaux, financiers et énergétiques.
La profondeur de couverture ne se limite pas à « avoir ou non » : elle inclut aussi la rapidité de mise à jour des versions. Après la sortie de DeepSeek-V4, certaines plateformes ont mis deux semaines à le référencer ; nos projets ne peuvent pas attendre ce délai.
La structure tarifaire et la transparence de la facturation, cachent pas mal de pièges
La facturation à l'usage semble simple, mais les méthodes de calcul des tokens diffèrent selon les plateformes. Certaines incluent les prompts système dans le décompte, d'autres facturent séparément l'entrée et la sortie. Nous avons comparé les prix API de cinq plateformes : pour une même conversation, la facture finale peut varier de 30 %.
Il y a aussi un problème plus sournois : certaines plateformes utilisent des « points » au lieu de tokens, avec un taux de conversion opaque. Lors des achats en entreprise, la comptabilité ne tombe pas juste, ce qui est très problématique.
Conformité et transfert de données à l'étranger, l'architecte doit y réfléchir en amont
Les services d'IA générative sont soumis à des exigences d'enregistrement en Chine. Utiliser une API étrangère pour traiter des données utilisateur implique un transfert de données à l'étranger, ce qui sera examiné de près lors de l'évaluation de conformité. Dans les secteurs financier et médical, c'est pratiquement rédhibitoire. Ce n'est pas une question technique, c'est une ligne rouge réglementaire.
Trois approches, toutes éprouvées dans nos projets
La première consiste à appeler directement les API officielles. Lors des premiers développements de fonctionnalités de dialogue IA, nous avons intégré séparément les SDK d'OpenAI, Tongyi et ERNIE : trois systèmes d'authentification, trois formats de réponse, un coût de maintenance élevé. L'avantage de la connexion directe officielle est la stabilité ; l'inconvénient est qu'il faut réécrire la couche d'adaptation à chaque nouvelle intégration.
La deuxième consiste à construire sa propre passerelle de modèles. Nous avons essayé de monter une passerelle API IA avec des solutions open source pour unifier l'accès multi-modèles. L'idée était bonne, mais la pression opérationnelle s'est révélée importante : il fallait gérer soi-même la limitation de débit, les tentatives de reconnexion, la rotation des clés, et suivre les mises à jour de version des API de chaque fournisseur. Deux personnes ont maintenu cela pendant trois mois, puis nous avons abandonné.
La troisième consiste à passer par une plateforme d'agrégation. En testant le routage multi-modèles de SiCore TokenWorks, nous avons découvert qu'une seule clé permet d'appeler GPT-4o, Claude, Gemini, DeepSeek, Tongyi, ERNIE, Doubao et autres modèles principaux, compatible avec le SDK OpenAI, et qu'il suffit de changer une ligne de base_url pour basculer. En comparaison, la charge d'intégration est passée de deux semaines à une demi-journée.
La différenciation de SiCore TokenWorks ne réside pas dans le nombre de modèles
En termes de nombre de modèles, nous ne sommes pas aussi complet qu'OpenRouter, il faut l'admettre. La position de token8341 est : calcul vert + priorité nationale + rapport qualité-prix extrême. Le calcul vert désigne la répartition des sept centres de calcul entre l'Est et l'Ouest, utilisant l'énergie verte pour réduire les coûts d'inférence ; la couverture complète des API de grands modèles nationaux avec Pangu, DeepSeek, Tongyi, ERNIE, Doubao, Spark tous accessibles ; l'achat en gros plus l'énergie verte permettent un prix inférieur à l'achat direct officiel. Convient aux équipes sensibles aux coûts et ayant des exigences de solutions nationales.
Cadre de décision pour le choix selon le scénario
Si votre activité s'adresse aux utilisateurs en Chine et exige une faible latence, privilégiez une plateforme d'agrégation d'API IA avec des nœuds nationaux. Si vos clients ont des exigences d'informatisation souveraine, la profondeur de couverture des grands modèles nationaux est un critère essentiel. Si votre équipe est petite et que vous ne voulez pas maintenir de passerelle, la solution tout-en-un de plateforme IA d'une plateforme d'agrégation est plus pratique. Si vous recherchez la couverture de modèles la plus complète et acceptez la latence transfrontalière, les plateformes étrangères ont aussi leur place. Chaque positionnement a ses scénarios d'application.
Il n'y a pas de réponse standard pour le choix d'une API de grand modèle, mais il est recommandé de tester les quatre points que sont la latence, la couverture nationale, la transparence de la facturation et la conformité avant de signer un contrat.