किसी LLM प्रदाता को बेंचमार्क स्कोर के आधार पर चुनना ऐसा ही है जैसे किसी रेस्तरां को उसके मेनू की तस्वीरों से चुनना। मॉडल मायने रखता है, लेकिन मॉडल के आसपास की हर चीज़ भी मायने रखती है, और यही आसपास की चीज़ें हैं जो वास्तव में प्रोडक्शन में आपको परेशान करती हैं। यह वह चेकलिस्ट है जिससे मैं किसी भी प्रदाता को तब गुज़ारता हूँ जब उस पर कोई भी असली काम सौंपने से पहले।
अपटाइम और SLA
SLA एक वादा है जिसके साथ संख्याएँ जुड़ी होती हैं, इसलिए संख्याओं को ध्यान से पढ़ें। अपटाइम प्रतिशत भ्रामक रूप से एक-दूसरे के बहुत करीब लगते हैं जब तक आप उन्हें बदल नहीं लेते:
| SLA | प्रति वर्ष डाउनटाइम | प्रति माह डाउनटाइम |
|---|---|---|
| 99.9% | 8.76 घंटे | 43.8 मिनट |
| 99.95% | 4.38 घंटे | 21.9 मिनट |
| 99.99% | 52.6 मिनट | 4.4 मिनट |
99.9% बहुत बढ़िया लगता है और फिर भी लगभग एक घंटे का मासिक आउटेज की अनुमति देता है। अगर आपका प्रोडक्ट एंडपॉइंट पर निर्भर है, तो 99.9% बनाम 99.99% का फर्क "परेशान करने वाले" और "भुला देने वाले" के बीच का फर्क है। मुख्य संख्या के अलावा दो चीज़ें भी जाँचें:
•डाउनटाइम में क्या गिना जाता है। कुछ SLA केवल पूर्ण आउटेज को कवर करते हैं, घटी हुई थ्रूपुट या उच्च त्रुटि दर को नहीं।
•जब वे इसे पूरा नहीं करते तो आपको क्या मिलता है। क्रेडिट का मूल्य तब बहुत कम होता है जब वह सीमित हो या उसके लिए आपको दावा दायर करना पड़े। उपाय ठोस होना चाहिए।
जो प्रदाता SLA बिल्कुल भी प्रकाशित नहीं करेगा, वह आपको कुछ बता रहा है, और वह अच्छा नहीं है।
लेटेंसी और थ्रूपुट
लेटेंसी की दो संख्याएँ हैं जिनकी आपको परवाह है और वे अलग-अलग चीज़ें मापती हैं:
•टाइम टू फर्स्ट टोकन (TTFT)। रिस्पॉन्स स्ट्रीमिंग शुरू होने से पहले कितना समय लगता है। यही वह चीज़ है जिसे उपयोगकर्ता "स्नैपी" के रूप में महसूस करता है।
•टोकन प्रति सेकंड (थ्रूपुट)। रिस्पॉन्स का बाकी हिस्सा कितनी तेज़ी से आता है। यही तय करता है कि लंबा जवाब धीमा लगता है या नहीं।
दोनों मॉडल और लोड के अनुसार बदलते हैं, इसलिए किसी मार्केटिंग संख्या पर भरोसा न करें। इसे खुद मापें:
import time
from openai import OpenAI
client = OpenAI(base_url="https://api.token8341.com/v1",
api_key="sk-your-key")
start = time.perf_counter()
stream = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": "Write 200 words about caching"}],
stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
if ttft is None:
ttft = time.perf_counter() - start
tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
f"{tokens / elapsed:.1f} tok/s")इसे दिन के कुछ अलग-अलग समयों पर और अपनी अपेक्षित कंकरेंसी के तहत चलाएँ। जो प्रदाता सुबह 10 बजे तेज़ है और शाम 7 बजे धीमा, उसकी क्षमता की समस्या है जिसके बारे में आपको जानना चाहिए।
लागत
प्रति-टोकन कीमत आसान हिस्सा है। लागत की पूरी तस्वीर में शामिल है:
•इनपुट बनाम आउटपुट कीमतें, क्योंकि आउटपुट की कीमत आमतौर पर इनपुट से कई गुना होती है।
•कैश-हिट कीमत। दोहराए जाने वाले वर्कलोड के लिए, एक प्रॉम्प्ट कैश किसी भी छूट से ज़्यादा लागत कम कर सकता है।
•रेट लिमिट और थ्रॉटलिंग। जो सस्ता एंडपॉइंट आप केवल कभी-कभार ही हिट कर सकते हैं, वह क्यूइंग और रीट्राई जोड़ने के बाद सस्ता नहीं रहता।
•मुद्रा और भुगतान की अड़चन। सीमा-पार कार्ड शुल्क और कन्वर्ज़न लागत छोटी टीमों के लिए वास्तविक होती है।
अलग-अलग प्रति मिलियन टोकन की कीमत नहीं, बल्कि अपने वास्तविक वर्कलोड की कीमत पूछें।
मॉडल कवरेज और संगतता
•क्या API OpenAI-संगत है? अगर हाँ, तो आप मानक SDK का उपयोग कर सकते हैं और बाद में बिना दोबारा लिखे बदल सकते हैं। अगर यह स्वामित्व-आधारित है, तो आप प्रदाता से बंध जाते हैं।
•क्या आप एक ही कुंजी से कई मॉडल परिवारों तक पहुँच सकते हैं? एक या दो मॉडल वाला कैटलॉग आपको उतना ही कसकर बाँधता है जितना स्वामित्व-आधारित API। कई मॉडल वाला कैटलॉग आपको एक फ़ॉलबैक और सस्ते रूटिंग का रास्ता देता है।
•क्या embeddings, फंक्शन कॉलिंग, और स्ट्रीमिंग समर्थित हैं, केवल साधारण चैट नहीं? यही वे सुविधाएँ हैं जो तय करती हैं कि एंडपॉइंट किसी असली ऐप में फिट बैठता है या केवल डेमो में।
डेटा हैंडलिंग और सपोर्ट
•डेटा रिटेंशन। क्या प्रदाता आपके प्रॉम्प्ट और कम्पलीशन को ट्रेनिंग के लिए रखता है? इसे लिखित में लें।
•क्षेत्र और रेसिडेंसी। रिक्वेस्ट कहाँ प्रोसेस होती हैं? कुछ उपयोगकर्ताओं के लिए यह एक कानूनी आवश्यकता है, कोई प्राथमिकता नहीं।
•सपोर्ट की गुणवत्ता। प्रतिबद्ध होने से पहले एक सपोर्ट टिकट खोलकर देखें। पहली प्रतिक्रिया की गति और उपयोगिता इस बात का मज़बूत संकेत है कि आउटेज कैसा होगा।
•स्टेटस पारदर्शिता। एक सार्वजनिक स्टेटस पेज और घटना इतिहास बताते हैं कि प्रदाता अपनी विश्वसनीयता के बारे में ईमानदार है या नहीं।
संक्षिप्त संस्करण
हर उम्मीदवार को इन पाँच सवालों से गुज़ारें:
1.SLA क्या है, और इसे पूरा न करने पर उपाय क्या है?
2.मेरे लोड के तहत मापा गया TTFT और थ्रूपुट क्या है?
3.कैश हिट सहित मेरे असली वर्कलोड की लागत क्या है?
4.क्या API OpenAI-संगत है, एक ही कुंजी के पीछे कई मॉडलों के साथ?
5.क्या वे बताएँगे कि डेटा कहाँ प्रोसेस होता है और सपोर्ट कैसे प्रतिक्रिया देता है?
इनमें से किसी के लिए गहरी विशेषज्ञता की ज़रूरत नहीं। इनके लिए ज़रूरत इस बात की है कि आप आउटेज के बाद नहीं, पहले पूछें। जो प्रदाता इनका आसानी से जवाब देते हैं, वे आमतौर पर वही होते हैं जिन्होंने वास्तव में प्रोडक्शन ट्रैफ़िक चलाया है, न कि केवल कोई मॉडल सूचीबद्ध किया है।
SiCore TokenWorks इस सूची के ज़्यादातर हिस्सों पर आसानी से खरा उतरता है: 99.9% SLA, https://api.token8341.com/v1 पर एक OpenAI-संगत एंडपॉइंट, एक ही कुंजी जो GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark, और Pangu को कवर करती है, और कैश-हिट कीमत के साथ प्रति-टोकन मीटर वाली बिलिंग।