दो साल पहले, मैंने एक क्रॉस-बॉर्डर कस्टमर सर्विस सिस्टम बनाने वाली टीम के लिए आर्किटेक्चर समीक्षा में मदद की थी। मीटिंग रूम के व्हाइटबोर्ड पर विभिन्न मॉडलों के बेंचमार्क तुलना से भरा हुआ था—MMLU, C-Eval, HumanEval—कोई भी शून्य दशमलव कुछ प्रतिशत अंकों से आगे हो, तो उस पर आधा दिन बहस होती थी। इस साल जब फिर गया, तो वही टीम, व्हाइटबोर्ड पर अब संख्याओं का एक अलग समूह था: प्रति सत्र औसत लागत, P99 लेटेंसी, सात दिनों की निरंतर उपलब्धता। यह बदलाव कोई अलग मामला नहीं है। AI प्लेटफ़ॉर्म पर मेरे इन वर्षों में, मैंने स्पष्ट रूप से महसूस किया है कि उद्यमों का लार्ज मॉडल API चुनने का तर्क "पैरामीटर पूजा" से "इंजीनियरिंग लेजर" की ओर बदल रहा है।
लीडरबोर्ड से लेजर तक, चयन में वास्तव में क्या बदला
सरल शब्दों में, पहले चयन का मुख्य प्रश्न था "कौन सा मॉडल सबसे स्मार्ट है", अब यह बन गया है "किस कार्य पर कौन सा मॉडल सबसे किफायती है"। लीडरबोर्ड स्कोर प्रयोगशाला स्थितियों के स्थिर संकेतक हैं, लेकिन उत्पादन वातावरण में, आपको लाखों कॉल, उतार-चढ़ाव वाले पीक ट्रैफ़िक, और हर तिमाही बदलते मॉडल संस्करणों का सामना करना पड़ता है। एक मॉडल जो लीडरबोर्ड पर शीर्ष पर है, अगर उसकी अनुमान लागत किसी अन्य से दोगुनी है और लेटेंसी दोगुनी है, तो प्रतिदिन लाखों कॉल के परिदृश्य में, लागत का हिसाब मेल नहीं खाता। हमारे प्रोजेक्ट में अब हम कार्य के अनुसार स्वचालित रूप से इष्टतम मॉडल चुनने को अधिक महत्व देते हैं—वर्गीकरण, सारांश जैसे कार्यों के लिए छोटे मॉडल, जटिल तर्क के लिए बड़े मॉडल पर रूटिंग—कुल लागत काफी कम हो जाती है। यही कारण है कि मॉडल गेटवे अब मानक बनना शुरू हो गया है; यह केवल अनुरोध अग्रेषित नहीं करता, बल्कि रूटिंग, डिग्रेडेशन, रेट लिमिटिंग जैसी उत्पादन-स्तरीय जिम्मेदारियाँ निभाता है।
तीन कारक, जिन्होंने उद्योग को इस मोड़ पर पहुँचाया
पहला है मॉडल क्षमता का अंतर सिकुड़ना। शीर्ष मॉडलों और दूसरे स्तर के मॉडलों के बीच का अंतर, उस समय के "उपयोग कर सकते हैं या नहीं" से अब "थोड़ा सा अंतर" बन गया है। अधिकांश व्यावसायिक परिदृश्यों के लिए, इस अंतर को उपयोगकर्ता महसूस ही नहीं करते, लेकिन लागत का अंतर वास्तविक होता है। दूसरा है घरेलू मॉडलों का चीनी परिदृश्यों में लगभग बराबरी कर लेना। Qwen, DeepSeek, Doubao, ERNIE आदि, चीनी समझ, स्थानीयकृत ज्ञान, अनुपालन अनुकूलन में, विदेशी मॉडलों की तुलना में घरेलू व्यवसायों के लिए अधिक उपयुक्त हैं। पहले कई टीमें "विदेशी मॉडल मुख्य, घरेलू बैकअप" थीं, अब यह उलट गया है। तीसरा, और सबसे महत्वपूर्ण, उद्यम डेमो से बड़े पैमाने के उत्पादन में प्रवेश कर चुके हैं। डेमो चरण में कॉल की मात्रा कम होती है, लागत के प्रति संवेदनशीलता कम होती है; एक बार पैमाना बढ़ने पर, हर कॉल की लागत, हर टाइमआउट का नुकसान, बढ़ा-चढ़ा कर दिखाई देता है। तब चयन तकनीकी पसंद का मामला नहीं, बल्कि वित्तीय मामला बन जाता है।
मोड़ के बाद, अवसंरचना में कौन से हिस्से जोड़ने होंगे
पहला हिस्सा है मॉडल गेटवे। यह "एक प्रवेश द्वार से सभी मॉडलों का प्रबंधन" की समस्या हल करता है। गेटवे के बिना, हर नए मॉडल को जोड़ने पर कोड बदलना, कुंजी बनाए रखना, रिट्राई लॉजिक लिखना पड़ता है। गेटवे के साथ, बहु-मॉडल एकीकृत पहुँच, मॉडल स्विचिंग ऊपरी व्यवसाय के लिए पारदर्शी हो जाती है। दूसरा हिस्सा है AI API एग्रीगेशन। इसका मूल्य खरीद, बिलिंग, कोटा प्रबंधन को एकीकृत करने में है। हमने आंतरिक रूप से तुलना की थी—स्वयं पाँच विक्रेताओं के SDK को जोड़ने पर, केवल दस्तावेज़ और संस्करण संगतता बनाए रखने में एक इंजीनियर की काफी ऊर्जा लग जाती है; एग्रीगेशन प्लेटफ़ॉर्म पर स्विच करने पर, OpenAI SDK के साथ संगत, base_url की एक पंक्ति बदलकर स्विच कर सकते हैं, जो बचता है वह वास्तविक मानव संसाधन है। यहाँ एक बात उल्लेखनीय है—SiCore TokenWorks जैसी घरेलू मॉडल प्राथमिकता और ग्रीन कंप्यूटिंग की स्थिति, ठीक इस मोड़ के बिंदु पर पड़ती है—उद्यमों को सबसे अधिक मॉडलों की संख्या नहीं, बल्कि घरेलू कवरेज पूर्ण, लागत नियंत्रित, कंप्यूटिंग शेड्यूलिंग स्थिर चाहिए। तीसरा हिस्सा है ऑब्जर्वेबिलिटी। कॉल लॉग, Token खपत आँकड़े, लेटेंसी वितरण के बिना, आपको पता ही नहीं चलेगा कि पैसा कहाँ खर्च हो रहा है, कौन सा मॉडल पीछे खींच रहा है। निरंतर अनुकूलन की शर्त है—दिखाई देना।
2026 चयन के लिए तीन पूर्वानुमान
पूर्वानुमान एक: पे-एज़-यू-गो डिफ़ॉल्ट विकल्प बनेगा, वार्षिक/मासिक पैकेज का अपरिष्कृत मॉडल कुछ स्थिर उच्च-ट्रैफ़िक परिदृश्यों तक सिमट जाएगा। क्योंकि व्यवसाय की मात्रा स्वयं उतार-चढ़ाव वाली है, कोई भी निष्क्रिय कंप्यूटिंग के लिए भुगतान नहीं करना चाहता। पूर्वानुमान दो: मॉडल रूटिंग "उन्नत सुविधा" से "बुनियादी सुविधा" बन जाएगी। जब एक उद्यम का एक साथ तीन-चार मॉडल उपयोग करना सामान्य हो जाएगा, तो स्वचालित रूप से इष्टतम मॉडल चुनना केवल बोनस नहीं, बल्कि लागत बचाने की अनिवार्यता होगी। पूर्वानुमान तीन: ग्रीन कंप्यूटिंग और घरेलूकरण बोनस आइटम से अनिवार्य संकेतक बन जाएँगे। सिनोसॉफ्ट अनुपालन, ऊर्जा लागत, आपूर्ति श्रृंखला स्थिरता—ये तीन चीज़ें 2026 में अधिक खरीद प्रक्रियाओं में अनिवार्य आवश्यकताओं के रूप में शामिल होंगी। SiCore TokenWorks का पूर्वी-पश्चिमी क्षेत्रों में कंप्यूटिंग शेड्यूलिंग लेआउट, मूल रूप से इसी प्रवृत्ति की प्रतिक्रिया है।
एक वाक्य में सारांश: चयन तर्क का स्थानांतरण, मूल रूप से "सबसे स्मार्ट मॉडल चुनना" से "सबसे उपयुक्त संयोजन चुनना" है। बहु-मॉडल रूटिंग और API एग्रीगेशन के कार्यान्वयन विवरण को गहराई से समझने के लिए, मॉडल गेटवे, लार्ज मॉडल API, पे-एज़-यू-गो इन दिशाओं में आगे खोज सकते हैं।