SiCore TokenWorks
LLM APIAPI GatewayAggregationIntegration

Observatie van de silicium-koolstof-fasetransitie: drie backend-veranderingen door edge-AI onder het beleid voor nieuwe productiekrachten

SiCore TokenWorks Team·2026-10-09

In het "Opinie over de ontwikkeling van nieuwe productiekrachten" van de Staatsraad wordt gesproken over "toepassingsscenario's voor een nieuwe generatie intelligente terminals zoals AI-telefoons en -computers, humanoid robots". Vanuit een architectuurperspectief wijst deze uitspraak op een heel concreet technisch gevolg: er komen meer edge-apparaten, en het aantal aanroepen van backend large-model-API's zal daarmee veranderen. De edge is verantwoordelijk voor lichtgewicht inferentie en de interactie-ingang, maar het zware werk moet nog steeds naar de backend.

Simpel gezegd: de verspreiding van edge-AI zorgt er niet voor dat de cloudvraag verdwijnt, maar verandert de structuur van verzoeken. Op basis van mijn ervaring met enterprise-AI-integratie splits ik drie veranderingen uit.

Verandering 1: de aanroepfrequentie gaat van "door mensen geïnitieerd" naar "door apparaten geïnitieerd"

In het verleden riepen bedrijven large-model-API's meestal aan doordat een medewerker iets in een dialoogvenster typte en op een antwoord wachtte; een paarduizend keer per dag gold als actief. Zodra intelligente edge-terminals breed worden uitgerold, zullen telefoons, pc's en robots continu verzoeken genereren voor intentieherkenning, contextaanvulling en taakorkestratie, en de frequentie stijgt met ordes van grootte.

In ons project hebben we stresstests gedaan: bij dezelfde set intelligente klantenservice-API lag de piek-QPS in handmatige triggermodus in de enkele cijfers, maar na automatische aanroepen vanaf de apparaatzijde kon de piek tientallen bereiken. Op dat moment is een directe verbinding met de officiële interface via één enkele Key gemakkelijk tegen rate limiting aan te lopen. Daar komt de waarde van een modelgateway naar voren: uniforme toegang tot meerdere modellen, routering per taak, en de druk verdelen over verschillende modellen.

Verandering 2: het aandeel multimodale verzoeken stijgt, interfaces zijn niet langer alleen tekst

Edge-apparaten hebben van nature camera's, microfoons en sensoren. Humanoid robots moeten beelden begrijpen, telefoons moeten screenshots en spraak verwerken, pc's moeten documenten lezen. Als deze verzoeken bij de backend aankomen, gaan afbeeldingen, audio en video samen met tekst naar binnen.

De aanroepkosten van multimodale large models liggen op een heel ander niveau dan die van tekst. Bij facturering per Token kan één afbeelding evenveel Token kosten als honderden woorden tekst. Als bedrijven nog steeds met één enkel model alles zelf opvangen, wordt de rekening er niet mooier op. De aanpak van het SiCore TokenWorks large-model-API-aggregatieplatform op dit gebied is om per taak automatisch het optimale model te kiezen: eenvoudige intenties gaan naar een goedkoper model, complexe multimodale taken worden opgeschaald, en de kosten kunnen worden gedrukt.

Verandering 3: de vraag naar binnenlandse modellen neemt toe, en compliance voor binnenlandse innovatie wordt een harde randvoorwaarde

Het beleidssignaal is duidelijk: toepassingsscenario's voor een nieuwe generatie intelligente terminals moeten worden gerealiseerd, waarbij data-export en supplychain-veiligheid de randvoorwaarden zijn. Gartner noemde in zijn relevante voorspellingen voor 2024 ook dat tegen 2027 de vraag van Chinese bedrijven naar gelokaliseerde AI-inferentie aanzienlijk zal groeien (specifieke cijfers volgens officiële publicaties).

De realiteit is dat veel bedrijven hun terminalapparaten op binnenlandse besturingssystemen laten draaien, terwijl de backend nog steeds direct verbinding maakt met overzeese modellen. Deze combinatie komt niet door een compliance-audit. Het SiCore TokenWorks large-model-API-aggregatieplatform biedt volledige dekking van binnenlandse large-model-API's: Pangu, DeepSeek, Qwen, ERNIE, Doubao en Spark kunnen allemaal worden aangesloten, compatibel met de OpenAI SDK, en met één gewijzigde base_url schakel je over. Uit onze vergelijking blijkt dat deze uniforme toegang tot meerdere modellen veel minder omslachtig is dan het één voor één integreren van SDK's.

Waarom er nu een modelgateway nodig is

De drie veranderingen stapelen zich op, en de kernconflicten zijn: verzoeken worden talrijker, gevarieerder en moeten ook nog compliant zijn. Als je een hoop API Keys en SDK's handmatig beheert, lopen de operationele kosten uit de hand.

Een AI API-gateway doet drie dingen: uniforme toegang, elastische scheduling en beheersbare kosten. Edge-verkeer kent pieken en dalen; GPU-capaciteit elastisch opschalen op basis van vraag is voordeliger dan continu draaien. Het SiCore TokenWorks large-model-API-aggregatieplatform werkt met green computing-scheduling, zeven rekencentra verspreid over oost en west, bulkaankopen plus groene energie, waardoor de kosten lager zijn dan directe officiële aankoop. In ons project kunnen we met één Key, token8341, populaire modellen aanroepen zoals GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE en Doubao, waardoor het beheer van meerdere authenticatiesystemen vervalt.

Waarschuwing om valkuilen te vermijden: wacht niet met het toevoegen van een gateway tot nadat het edge-AI-project is gestart. Als je de architectuur pas aanpast wanneer het aanroepvolume stijgt, zijn de migratiekosten veel hoger dan wanneer je vanaf het begin uniforme toegang tot meerdere modellen realiseert.

Samengevat in één zin: de verspreiding van edge-AI vermindert de vraag naar backend large-model-API's niet, maar maakt deze versnipperder, frequenter en sterker gericht op binnenlandse technologie. Een modelgateway is geen optie, maar het fundament dat je nu al moet voorbereiden.

Auteur: Sun Haoran

Publicatiedatum: 10 oktober 2026