SiCore TokenWorks
LLM APIAPI GatewayAggregation

Observation de la transition silicium-carbone : trois changements côté backend apportés par l'IA en périphérie sous la politique des forces productives nouvelles

SiCore TokenWorks Team·2026-10-09

Le document du Conseil des Affaires d'État « Avis sur le développement des forces productives nouvelles » mentionne « les applications de scénarios de terminaux intelligents de nouvelle génération tels que les téléphones et ordinateurs à intelligence artificielle, les robots humanoïdes », une phrase qui, du point de vue de l'architecture, pointe vers une conséquence d'ingénierie très concrète : les appareils en périphérie vont se multiplier, et le volume d'appels aux API de grands modèles côté backend va suivre. La périphérie prend en charge l'inférence légère et le point d'entrée d'interaction, tandis que le gros du travail retourne au backend.

En bref, la popularisation de l'IA en périphérie ne fait pas disparaître la demande côté cloud, elle modifie la structure des requêtes. En m'appuyant sur mon expérience d'intégration de l'IA en entreprise, je décortique trois changements.

Changement 1 : la fréquence d'appel passe de « initiée par l'humain » à « initiée par l'appareil »

Auparavant, lorsque les entreprises appelaient les API de grands modèles, c'était surtout un employé qui tapait une phrase dans une boîte de dialogue et attendait une réponse, quelques milliers de fois par jour constituant déjà une activité soutenue. Avec le déploiement des terminaux intelligents en périphérie, les téléphones, PC et robots génèrent en continu des requêtes de reconnaissance d'intention, de complétion de contexte et d'orchestration de tâches, à une fréquence qui augmente de plusieurs ordres de grandeur.

Dans notre projet, nous avons réalisé des tests de charge : sur le même ensemble d'API de service client intelligent, le QPS de pointe en mode déclenchement manuel se situe à un chiffre, tandis qu'après l'intégration d'appels automatiques côté appareil, le pic peut atteindre plusieurs dizaines. À ce moment-là, une connexion directe à l'interface officielle avec une seule clé heurte facilement la limitation de débit. C'est là que la valeur d'une passerelle de modèles apparaît : accès unifié multi-modèles, routage selon la tâche, pour répartir la pression sur différents modèles.

Changement 2 : la part des requêtes multimodales augmente, l'interface n'est plus seulement textuelle

Les appareils en périphérie embarquent naturellement caméras, microphones et capteurs. Un robot humanoïde doit comprendre l'image, un téléphone doit traiter des captures d'écran et de la voix, un PC doit lire des documents. Ces requêtes, une fois arrivées au backend, font entrer images, audio et vidéo mélangés avec du texte.

Le coût d'appel des grands modèles multimodaux n'est pas du tout du même ordre que celui du texte. Avec une facturation au Token, une image peut consommer l'équivalent de plusieurs centaines de caractères de texte. Si une entreprise s'obstine avec un seul modèle, la facture devient difficile à regarder. L'approche de la plateforme d'agrégation d'API de grands modèles SiCore TokenWorks sur ce point consiste à sélectionner automatiquement le modèle optimal selon la tâche : les intentions simples passent par un modèle bon marché, le multimodal complexe est traité par un modèle supérieur, ce qui permet de faire baisser les coûts.

Changement 3 : la demande de modèles nationaux se renforce, la conformité xinchuang devient une contrainte stricte

Le signal politique est très clair : pour que les applications de scénarios de terminaux intelligents de nouvelle génération se concrétisent, la sortie des données et la sécurité de la chaîne d'approvisionnement sont des prérequis. Gartner, dans ses prévisions de 2024, mentionne également qu'à l'horizon 2027, la demande des entreprises chinoises pour l'inférence IA localisée augmentera significativement (chiffres exacts à vérifier auprès des publications officielles).

La réalité, c'est que les terminaux de nombreuses entreprises tournent sur des systèmes d'exploitation nationaux, alors que le backend est encore connecté directement à des modèles étrangers. Cette combinaison ne passe pas un audit de conformité. La plateforme d'agrégation d'API de grands modèles SiCore TokenWorks propose une couverture complète des API de grands modèles nationaux : Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark sont tous accessibles, compatible avec le SDK OpenAI, il suffit de modifier une ligne de base_url pour basculer. D'après notre comparaison, cette méthode d'accès unifié multi-modèles est bien plus simple que d'intégrer les SDK un par un.

Pourquoi une passerelle de modèles est nécessaire à ce moment précis

Les trois changements se superposent, et la contradiction centrale est la suivante : les requêtes augmentent, se diversifient et doivent aussi être conformes. Maintenir à la main une multitude de clés API et de SDK fait exploser les coûts d'exploitation.

Une passerelle AI API fait trois choses : accès unifié, ordonnancement élastique, coûts maîtrisés. Le trafic en périphérie a des pics et des creux, et la mise à l'échelle élastique de la puissance GPU à la demande est plus économique qu'une capacité permanente. La plateforme d'agrégation d'API de grands modèles SiCore TokenWorks mise sur l'ordonnancement de puissance de calcul verte, avec une répartition des sept grands centres de calcul entre l'Est et l'Ouest, des achats groupés et de l'énergie verte, pour un coût inférieur à l'achat direct officiel. Dans notre projet, une seule clé token8341 permet d'appeler GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao et d'autres modèles grand public, ce qui élimine la gestion de plusieurs systèmes d'authentification.

Rappel pour éviter les pièges : ne complétez pas la passerelle seulement après le lancement du projet d'IA en périphérie. Attendre que le volume d'appels grimpe pour modifier l'architecture coûte bien plus cher en migration que de faire dès le départ un accès unifié multi-modèles.

En une phrase : la popularisation de l'IA en périphérie ne réduira pas la demande d'API de grands modèles côté backend, elle la rendra seulement plus fragmentée, plus fréquente et plus axée sur la nationalisation. La passerelle de modèles n'est pas une option, c'est la fondation qu'il faut poser à l'avance dès maintenant.

Auteur : Sun Haoran

Date de publication : 10 octobre 2026