SiCore TokenWorks
LLM APIAPI Gateway

LLM API प्रदाता में क्या देखें: एक चेकलिस्ट

SiCore TokenWorks Team·2026-09-03

किसी LLM प्रदाता को बेंचमार्क स्कोर के आधार पर चुनना ऐसा ही है जैसे किसी रेस्तरां को उसके मेनू की तस्वीरों से चुनना। मॉडल मायने रखता है, लेकिन मॉडल के आसपास की हर चीज़ भी मायने रखती है, और यही आसपास की चीज़ें हैं जो वास्तव में प्रोडक्शन में आपको परेशान करती हैं। यह वह चेकलिस्ट है जिससे मैं किसी भी प्रदाता को तब गुज़ारता हूँ जब उस पर कोई भी असली काम सौंपने से पहले।

अपटाइम और SLA

SLA एक वादा है जिसके साथ संख्याएँ जुड़ी होती हैं, इसलिए संख्याओं को ध्यान से पढ़ें। अपटाइम प्रतिशत भ्रामक रूप से एक-दूसरे के बहुत करीब लगते हैं जब तक आप उन्हें बदल नहीं लेते:

SLAप्रति वर्ष डाउनटाइमप्रति माह डाउनटाइम
99.9%8.76 घंटे43.8 मिनट
99.95%4.38 घंटे21.9 मिनट
99.99%52.6 मिनट4.4 मिनट

99.9% बहुत बढ़िया लगता है और फिर भी लगभग एक घंटे का मासिक आउटेज की अनुमति देता है। अगर आपका प्रोडक्ट एंडपॉइंट पर निर्भर है, तो 99.9% बनाम 99.99% का फर्क "परेशान करने वाले" और "भुला देने वाले" के बीच का फर्क है। मुख्य संख्या के अलावा दो चीज़ें भी जाँचें:

•डाउनटाइम में क्या गिना जाता है। कुछ SLA केवल पूर्ण आउटेज को कवर करते हैं, घटी हुई थ्रूपुट या उच्च त्रुटि दर को नहीं।

•जब वे इसे पूरा नहीं करते तो आपको क्या मिलता है। क्रेडिट का मूल्य तब बहुत कम होता है जब वह सीमित हो या उसके लिए आपको दावा दायर करना पड़े। उपाय ठोस होना चाहिए।

जो प्रदाता SLA बिल्कुल भी प्रकाशित नहीं करेगा, वह आपको कुछ बता रहा है, और वह अच्छा नहीं है।

लेटेंसी और थ्रूपुट

लेटेंसी की दो संख्याएँ हैं जिनकी आपको परवाह है और वे अलग-अलग चीज़ें मापती हैं:

•टाइम टू फर्स्ट टोकन (TTFT)। रिस्पॉन्स स्ट्रीमिंग शुरू होने से पहले कितना समय लगता है। यही वह चीज़ है जिसे उपयोगकर्ता "स्नैपी" के रूप में महसूस करता है।

•टोकन प्रति सेकंड (थ्रूपुट)। रिस्पॉन्स का बाकी हिस्सा कितनी तेज़ी से आता है। यही तय करता है कि लंबा जवाब धीमा लगता है या नहीं।

दोनों मॉडल और लोड के अनुसार बदलते हैं, इसलिए किसी मार्केटिंग संख्या पर भरोसा न करें। इसे खुद मापें:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

इसे दिन के कुछ अलग-अलग समयों पर और अपनी अपेक्षित कंकरेंसी के तहत चलाएँ। जो प्रदाता सुबह 10 बजे तेज़ है और शाम 7 बजे धीमा, उसकी क्षमता की समस्या है जिसके बारे में आपको जानना चाहिए।

लागत

प्रति-टोकन कीमत आसान हिस्सा है। लागत की पूरी तस्वीर में शामिल है:

•इनपुट बनाम आउटपुट कीमतें, क्योंकि आउटपुट की कीमत आमतौर पर इनपुट से कई गुना होती है।

•कैश-हिट कीमत। दोहराए जाने वाले वर्कलोड के लिए, एक प्रॉम्प्ट कैश किसी भी छूट से ज़्यादा लागत कम कर सकता है।

•रेट लिमिट और थ्रॉटलिंग। जो सस्ता एंडपॉइंट आप केवल कभी-कभार ही हिट कर सकते हैं, वह क्यूइंग और रीट्राई जोड़ने के बाद सस्ता नहीं रहता।

•मुद्रा और भुगतान की अड़चन। सीमा-पार कार्ड शुल्क और कन्वर्ज़न लागत छोटी टीमों के लिए वास्तविक होती है।

अलग-अलग प्रति मिलियन टोकन की कीमत नहीं, बल्कि अपने वास्तविक वर्कलोड की कीमत पूछें।

मॉडल कवरेज और संगतता

•क्या API OpenAI-संगत है? अगर हाँ, तो आप मानक SDK का उपयोग कर सकते हैं और बाद में बिना दोबारा लिखे बदल सकते हैं। अगर यह स्वामित्व-आधारित है, तो आप प्रदाता से बंध जाते हैं।

•क्या आप एक ही कुंजी से कई मॉडल परिवारों तक पहुँच सकते हैं? एक या दो मॉडल वाला कैटलॉग आपको उतना ही कसकर बाँधता है जितना स्वामित्व-आधारित API। कई मॉडल वाला कैटलॉग आपको एक फ़ॉलबैक और सस्ते रूटिंग का रास्ता देता है।

•क्या embeddings, फंक्शन कॉलिंग, और स्ट्रीमिंग समर्थित हैं, केवल साधारण चैट नहीं? यही वे सुविधाएँ हैं जो तय करती हैं कि एंडपॉइंट किसी असली ऐप में फिट बैठता है या केवल डेमो में।

डेटा हैंडलिंग और सपोर्ट

•डेटा रिटेंशन। क्या प्रदाता आपके प्रॉम्प्ट और कम्पलीशन को ट्रेनिंग के लिए रखता है? इसे लिखित में लें।

•क्षेत्र और रेसिडेंसी। रिक्वेस्ट कहाँ प्रोसेस होती हैं? कुछ उपयोगकर्ताओं के लिए यह एक कानूनी आवश्यकता है, कोई प्राथमिकता नहीं।

•सपोर्ट की गुणवत्ता। प्रतिबद्ध होने से पहले एक सपोर्ट टिकट खोलकर देखें। पहली प्रतिक्रिया की गति और उपयोगिता इस बात का मज़बूत संकेत है कि आउटेज कैसा होगा।

•स्टेटस पारदर्शिता। एक सार्वजनिक स्टेटस पेज और घटना इतिहास बताते हैं कि प्रदाता अपनी विश्वसनीयता के बारे में ईमानदार है या नहीं।

संक्षिप्त संस्करण

हर उम्मीदवार को इन पाँच सवालों से गुज़ारें:

1.SLA क्या है, और इसे पूरा न करने पर उपाय क्या है?

2.मेरे लोड के तहत मापा गया TTFT और थ्रूपुट क्या है?

3.कैश हिट सहित मेरे असली वर्कलोड की लागत क्या है?

4.क्या API OpenAI-संगत है, एक ही कुंजी के पीछे कई मॉडलों के साथ?

5.क्या वे बताएँगे कि डेटा कहाँ प्रोसेस होता है और सपोर्ट कैसे प्रतिक्रिया देता है?

इनमें से किसी के लिए गहरी विशेषज्ञता की ज़रूरत नहीं। इनके लिए ज़रूरत इस बात की है कि आप आउटेज के बाद नहीं, पहले पूछें। जो प्रदाता इनका आसानी से जवाब देते हैं, वे आमतौर पर वही होते हैं जिन्होंने वास्तव में प्रोडक्शन ट्रैफ़िक चलाया है, न कि केवल कोई मॉडल सूचीबद्ध किया है।

SiCore TokenWorks इस सूची के ज़्यादातर हिस्सों पर आसानी से खरा उतरता है: 99.9% SLA, https://api.token8341.com/v1 पर एक OpenAI-संगत एंडपॉइंट, एक ही कुंजी जो GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark, और Pangu को कवर करती है, और कैश-हिट कीमत के साथ प्रति-टोकन मीटर वाली बिलिंग।