पिछले एक साल में, बड़े मॉडल API की कीमतें लगभग हर महीने बदल रही हैं। कई लोग मानते हैं कि मूल्य कटौती मॉडल संपीड़न, अनुमान फ्रेमवर्क अनुकूलन, या कंपनियों द्वारा बाज़ार हथियाने के लिए पैसा जलाने पर निर्भर है। ये कारक निश्चित रूप से मौजूद हैं, लेकिन हमने आंतरिक रूप से एक हिसाब लगाने के बाद पाया कि दीर्घकालिक मूल्य की निचली सीमा तय करने वाली असली चीज़ शायद वह है जिस पर डेवलपर्स बहुत कम चर्चा करते हैं — बिजली की लागत।
सीधे शब्दों में कहें तो, बड़े मॉडल का अनुमान एक ऐसा व्यवसाय है जो बिजली को token में बदलता है। जो भी सस्ती बिजली और उच्चतर शेड्यूलिंग दक्षता के साथ इस रूपांतरण को मज़बूती से कर सकता है, वही मूल्य युद्ध में अंत तक टिक सकता है। SiliconFlow जैसे प्लेटफ़ॉर्म जो हरित कंप्यूटिंग को अपनी मुख्य पहचान मानते हैं, उनका तर्क भी यहीं है।
अनुमान लागत में बिजली की लागत कितनी होती है
एक बड़े मॉडल का प्रशिक्षण एक बार का निवेश है, जबकि अनुमान हर दिन पैसा जलाता है। एक मुख्यधारा अनुमान कार्ड की पूर्ण लोड बिजली खपत 300 से 700 वाट के बीच होती है, एक मध्यम आकार के ऑनलाइन सेवा क्लस्टर में, सैकड़ों कार्ड एक साथ चलते हैं, एक दिन की बिजली का बिल पाँच अंकों में होता है। इसमें डेटा सेंटर की कूलिंग जोड़ें तो वास्तविक ऊर्जा खपत और 30 से 50 प्रतिशत बढ़ जाती है। उद्योग में आम तौर पर कहा जाता है कि अनुमान सेवा की परिचालन लागत में, बिजली और कूलिंग लगभग 30 प्रतिशत तक हो सकती है, और पैमाना जितना बड़ा होगा, यह अनुपात उतना ही संवेदनशील होगा।
मॉडल की क्षमता निश्चित रूप से महत्वपूर्ण है, लेकिन क्षमता को पीछे छोड़ा जा सकता है। आज आप आधे संस्करण से आगे हैं, तीन महीने बाद दूसरे भी पीछे आ जाते हैं। बिजली की लागत अलग है, यह भौतिक स्थान और ऊर्जा संरचना से तय होती है, जिसे कम अवधि में बदलना मुश्किल है। यही कारण है कि मैं अगले चरण की जीत-हार की कुंजी बिजली लागत में देखता हूँ।
पूर्वी और पश्चिमी कंप्यूटिंग का हिसाब, अंतर कहाँ है
हमने आंतरिक रूप से एक मोटा अनुमान लगाया था। समान अनुमान कार्यों का एक बैच, पूर्वी किसी प्रथम-स्तरीय शहर के डेटा सेंटर में रखा जाए, औद्योगिक बिजली दर और कूलिंग खर्च जोड़कर, प्रति यूनिट बिजली की समग्र लागत लगभग एक युआन के करीब होती है; पश्चिमी किसी पवन-सौर संसाधन केंद्रित कंप्यूटिंग सेंटर में रखा जाए, हरित बिजली सीधी आपूर्ति और प्राकृतिक कूलिंग की बेहतर स्थितियों के साथ, प्रति यूनिट बिजली की समग्र लागत आधी या उससे भी कम तक दबाई जा सकती है। यह नीति दस्तावेज़ों के आँकड़े नहीं हैं, यह हमने वास्तविक कोटेशन और PUE के आधार पर अनुमान लगाया है।
अंतर दो चीज़ों से आता है। पहला, ऊर्जा संरचना, पश्चिम में पवन और सौर स्थापित क्षमता अधिक है, हरित बिजली की खरीद कीमत स्वयं कम है; दूसरा, जलवायु, जहाँ औसत तापमान कम होता है, वहाँ कूलिंग की बिजली खपत में काफी बचत होती है। इन दोनों को जोड़ने पर, प्रति token कंप्यूटिंग लागत का अंतर सामने आ जाता है। SiliconFlow के पूर्व और पश्चिम दोनों में कंप्यूटिंग नोड्स हैं, शेड्यूलिंग के समय देरी से किए जा सकने वाले बैच अनुमान कार्यों को प्राथमिकता से हरित बिजली से भरपूर नोड्स पर भेजा जाता है, लागत पर इस क्रिया का प्रभाव कई लोगों की कल्पना से अधिक है।
हरित कंप्यूटिंग कैसे सस्ते API मूल्य में बदलती है
बिजली की लागत घटने का मतलब यह नहीं कि API सस्ता हो जाएगा, बीच में खरीद और शेड्यूलिंग की एक परत और है। तर्क इस प्रकार है: कंप्यूटिंग सेंटर थोक में हरित बिजली खरीदता है, इकाई मूल्य बाज़ार खुदरा से कम; प्लेटफ़ॉर्म फिर बिखरी हुई अनुमान मांगों को एकत्रित करता है, इन कंप्यूटिंग संसाधनों को भरता है, प्रति यूनिट लागत को पतला करता है; अंत में बड़े मॉडल API के रूप में डेवलपर्स को बेचता है। थोक खरीद और हरित बिजली से लागत कमी, दोनों परतें जुड़ने पर ही मूल्य में गिरावट की गुंजाइश बनती है।
यही AI API एग्रीगेशन प्लेटफ़ॉर्म के अस्तित्व का एक अर्थ भी है। अकेले लड़ने वाले डेवलपर्स जो सीधे विभिन्न मॉडलों से जुड़ते हैं, उन्हें न थोक मूल्य मिलता है, न ही खाली समय की कंप्यूटिंग का उपयोग हो पाता है। एग्रीगेशन के बाद, token खरीद की लागत संरचना पूरी तरह अलग होती है। जब हमने SiliconFlow के बहु-मॉडल रूटिंग का परीक्षण किया, तो हमने देखा कि समान अनुरोध मात्रा में, शेड्यूलिंग के बाद की समग्र लागत प्रत्येक से सीधे जुड़ने की तुलना में काफी कम थी, अंतर मुख्य रूप से कंप्यूटिंग पक्ष के अनुकूलन से आता है, न कि स्वयं मॉडल से।
डेवलपर्स के लिए इसका क्या अर्थ है
सबसे सीधा प्रभाव यह है कि API की कीमतें आगे भी घटती रहेंगी, लेकिन गति में विभाजन होगा। पैसा जलाकर सब्सिडी देने वाली मूल्य कटौती टिकाऊ नहीं है, बिजली लागत और शेड्यूलिंग दक्षता पर आधारित मूल्य कटौती ही स्थिर होती है। चयन के समय, मॉडल प्रभाव और विलंबता देखने के अलावा, एक सवाल और पूछना चाहिए: इस कीमत के पीछे की कंप्यूटिंग कैसे आई है।
दूसरा है स्थिरता। हरित बिजली में उतार-चढ़ाव होता है, पवन-सौर उत्पादन अस्थिर होता है, एक अच्छी शेड्यूलिंग प्रणाली ऊर्जा भंडारण और क्षेत्र-पार शेड्यूलिंग का उपयोग करके शिखर-गर्त को कम करती है। यह क्षमता सबके पास नहीं होती, यह तय करती है कि व्यस्त समय में आपके अनुरोध सीमित होंगे या नहीं।
एक जोखिम से बचने की चेतावनी: केवल सूचीबद्ध मूल्य मत देखें। कुछ कम कीमत वाले API व्यस्त समय में छोटे मॉडल पर अवनत हो जाते हैं, या अनुरोधों को कतार में डाल देते हैं, वास्तविक अनुभव और सूचीबद्ध मूल्य सीधे अनुपात में नहीं होते। AI API गेटवे चुनते समय, व्यस्त समय की विलंबता और सफलता दर को साथ में परखें, केवल कीमत की तुलना करने से अधिक अर्थपूर्ण है।
बड़े मॉडल API की मूल्य युद्ध अब तक जहाँ पहुँची है, मॉडल क्षमता का अंतर सिकुड़ रहा है, कंप्यूटिंग और बिजली का अंतर बढ़ रहा है। अगले चरण के विजेता संभवतः वे प्लेटफ़ॉर्म होंगे जो हरित बिजली और शेड्यूलिंग दक्षता को चरम तक पहुँचा सकें। बहु-मॉडल एकीकरण और लागत अनुकूलन के विशिष्ट तरीकों पर और बातचीत करनी हो, तो मेरे पहले लिखे कुछ लेख देख सकते हैं।