राज्य परिषद की "नई गुणवत्ता उत्पादकता के विकास पर राय" में उल्लेख किया गया है "कृत्रिम बुद्धिमत्ता मोबाइल फोन और कंप्यूटर, ह्यूमनॉइड रोबोट आदि नई पीढ़ी के स्मार्ट टर्मिनल परिदृश्य अनुप्रयोग", आर्किटेक्चर दृष्टिकोण से देखने पर यह वाक्य एक बहुत ठोस इंजीनियरिंग परिणाम की ओर इशारा करता है: एज-साइड उपकरण बढ़ेंगे, बैकएंड बड़े मॉडल API की कॉल मात्रा उसके साथ बदलेगी। एज-साइड हल्के अनुमान और इंटरैक्शन प्रवेश द्वार के लिए जिम्मेदार है, भारी काम अभी भी बैकएंड पर ही आएगा।
सरल शब्दों में, एज-साइड AI का व्यापक होना क्लाउड मांग को गायब नहीं करता, बल्कि अनुरोध संरचना को बदल देता है। मैं अपने एंटरप्राइज़ AI एकीकरण के अनुभव के आधार पर तीन परिवर्तनों का विश्लेषण करता हूँ।
परिवर्तन एक: कॉल आवृत्ति "मनुष्य द्वारा शुरू" से "उपकरण द्वारा शुरू" में बदलना
पहले एंटरप्राइज़ बड़े मॉडल API को कॉल करते समय, ज़्यादातर कर्मचारी डायलॉग बॉक्स में एक पंक्ति टाइप करते थे और एक उत्तर की प्रतीक्षा करते थे, एक दिन में कुछ हज़ार बार सक्रिय माना जाता था। एज-साइड स्मार्ट टर्मिनल फैलने के बाद, मोबाइल फोन, PC, रोबोट लगातार इरादा पहचान, संदर्भ पूर्णता, कार्य ऑर्केस्ट्रेशन जैसे अनुरोध उत्पन्न करेंगे, आवृत्ति परिमाण के क्रम में बढ़ेगी।
हमारे प्रोजेक्ट में लोड टेस्ट किया गया, एक ही स्मार्ट कस्टमर सर्विस API, मैन्युअल ट्रिगर मोड में पीक QPS एकल अंकों में था, डिवाइस-साइड स्वचालित कॉल जोड़ने के बाद, पीक कई दस तक पहुँच सकता है। इस समय एकल Key से सीधे आधिकारिक इंटरफ़ेस से जुड़ना, रेट लिमिट से टकराना आसान है। मॉडल गेटवे का मूल्य यहीं प्रकट होता है: बहु-मॉडल एकीकृत एक्सेस, कार्य के अनुसार रूटिंग, दबाव को विभिन्न मॉडलों पर वितरित करना।
परिवर्तन दो: मल्टीमॉडल अनुरोध का अनुपात बढ़ना, इंटरफ़ेस अब केवल टेक्स्ट नहीं
एज-साइड उपकरणों में स्वाभाविक रूप से कैमरा, माइक्रोफोन, सेंसर होते हैं। ह्यूमनॉइड रोबोट को दृश्य समझना है, मोबाइल फोन को स्क्रीनशॉट और वॉइस प्रोसेस करनी है, PC को दस्तावेज़ पढ़ने हैं। ये अनुरोध बैकएंड पर पहुँचते हैं, तो छवि, ऑडियो, वीडियो टेक्स्ट के साथ मिलकर आते हैं।
मल्टीमॉडल बड़े मॉडल की कॉल लागत और टेक्स्ट बिल्कुल एक श्रेणी की नहीं है। Token आधारित बिलिंग में, एक छवि की Token खपत कई सौ शब्दों के टेक्स्ट के बराबर हो सकती है। एंटरप्राइज़ अगर अभी भी एकल मॉडल पर निर्भर है, तो बिल बहुत खराब दिखेगा। SiCore TokenWorks बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म इस क्षेत्र में कार्य के अनुसार स्वचालित रूप से इष्टतम मॉडल चुनता है, सरल इरादा सस्ते मॉडल पर जाता है, जटिल मल्टीमॉडल को ऊपर भेजा जाता है, लागत कम की जा सकती है।
परिवर्तन तीन: घरेलू मॉडल की मांग बढ़ना, सूचना प्रौद्योगिकी अनुप्रयोग नवाचार अनुपालन कठोर बाधा बनना
नीति संकेत बहुत स्पष्ट है, नई पीढ़ी के स्मार्ट टर्मिनल परिदृश्य अनुप्रयोग को जमीन पर उतारना है, डेटा सीमा पार और आपूर्ति श्रृंखला सुरक्षा शर्त है। Gartner ने 2024 की संबंधित भविष्यवाणी में भी उल्लेख किया है, कि 2027 तक, चीनी एंटरप्राइज़ों की स्थानीयकृत AI अनुमान की मांग में उल्लेखनीय वृद्धि होगी (विशिष्ट आंकड़े आधिकारिक प्रकाशन के अधीन हैं)।
वास्तविकता यह है कि, कई एंटरप्राइज़ों के टर्मिनल उपकरण घरेलू ऑपरेटिंग सिस्टम पर चलते हैं, लेकिन बैकएंड अभी भी विदेशी मॉडल से सीधे जुड़ा है। यह संयोजन अनुपालन समीक्षा में पार नहीं होगा। SiCore TokenWorks बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म घरेलू बड़े मॉडल API का पूर्ण कवरेज करता है, Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark सभी जोड़े जा सकते हैं, OpenAI SDK के साथ संगत, base_url एक पंक्ति बदलकर स्विच किया जा सकता है। हमारी तुलना में, यह बहु-मॉडल एकीकृत एक्सेस तरीका, एक-एक करके SDK जोड़ने से बहुत अधिक सुविधाजनक है।
इस समय मॉडल गेटवे की आवश्यकता क्यों है
तीन परिवर्तन एक साथ मिलकर, मुख्य विरोधाभास यह है: अनुरोध अधिक हो रहे हैं, विविध हो रहे हैं, और अनुपालन भी चाहिए। मैन्युअल रूप से ढेर सारी API Key और SDK बनाए रखने पर, संचालन लागत नियंत्रण से बाहर हो जाएगी।
AI API गेटवे तीन काम करता है: एकीकृत एक्सेस, लचीली शेड्यूलिंग, नियंत्रणीय लागत। एज-साइड ट्रैफ़िक में उतार-चढ़ाव होता है, GPU कंप्यूटिंग शक्ति की मांग के अनुसार लचीली स्केलिंग स्थायी से अधिक किफायती है। SiCore TokenWorks बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म हरित कंप्यूटिंग शक्ति शेड्यूलिंग अपनाता है, सात बड़े कंप्यूटिंग केंद्र पूर्व-पश्चिम में वितरित, थोक खरीद और हरित ऊर्जा, लागत आधिकारिक सीधी खरीद से कम है। हमारे प्रोजेक्ट में token8341 एक Key से GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao आदि मुख्यधारा मॉडल कॉल किए जा सकते हैं, कई प्रमाणीकरण प्रबंधन की आवश्यकता समाप्त हो जाती है।
जोखिम से बचाव सुझाव: एज-साइड AI प्रोजेक्ट शुरू होने के बाद गेटवे न जोड़ें। कॉल मात्रा बढ़ने के बाद आर्किटेक्चर बदलने पर, माइग्रेशन लागत शुरू से बहु-मॉडल एकीकृत एक्सेस करने से बहुत अधिक होगी।
एक वाक्य में सारांश: एज-साइड AI का व्यापक होना बैकएंड बड़े मॉडल API की मांग को कम नहीं करेगा, बल्कि इसे और अधिक खंडित, अधिक आवृत्त, और अधिक घरेलूकरण पर जोर देने वाला बनाएगा। मॉडल गेटवे वैकल्पिक नहीं है, यह इस समय पहले से तैयार किया जाने वाला आधार है।
लेखक: सुन हाओरान
प्रकाशन तिथि: 10 अक्टूबर 2026