Bir LLM sağlayıcısını kıyaslama puanlarına göre seçmek, bir restoranı menü fotoğraflarına göre seçmek gibidir. Model önemlidir, ama modelin etrafındaki her şey de önemlidir ve üretim ortamında asıl canınızı yakan şey o çevresel unsurlardır. Bu, gerçek bir iş yükünü yönlendirmeden önce bir sağlayıcıyı tabi tuttuğum kontrol listesidir.
Çalışma süresi ve SLA
Bir SLA, rakamlarla desteklenen bir vaattir, o yüzden rakamları okuyun. Çalışma süresi yüzdeleri, dönüştürmediğiniz sürece yanıltıcı biçimde birbirine yakındır:
| SLA | Yıllık kesinti süresi | Aylık kesinti süresi |
|---|---|---|
| 99,9% | 8,76 saat | 43,8 dakika |
| 99,95% | 4,38 saat | 21,9 dakika |
| 99,99% | 52,6 dakika | 4,4 dakika |
99,9% mükemmel kulağa gelir ve yine de ayda neredeyse bir saatlik kesintiye izin verir. Ürününüz bu uç noktaya bağımlıysa, 99,9% ile 99,99% arasındaki fark "sinir bozucu" ile "unutulabilir" arasındaki farktır. Ayrıca manşet rakamın ötesinde iki şeyi kontrol edin:
•Neyin kesinti sayıldığı. Bazı SLA'lar yalnızca tam kesintileri kapsar, düşük verim veya yüksek hata oranlarını kapsamaz.
•Kaçırdıklarında ne elde ettiğiniz. Kredi sınırlıysa veya bir talep açmanız gerekiyorsa, kredi çok az değer taşır. Telafi somut olmalıdır.
Hiç SLA yayınlamayan bir sağlayıcı size bir şey söylüyordur ve bu iyi bir şey değildir.
Gecikme ve verim
Gecikmenin önemsediğiniz iki rakamı vardır ve bunlar farklı şeyleri ölçer:
•İlk token'a kadar geçen süre (TTFT). Yanıtın akmaya başlamasından önce geçen süre. Kullanıcının "çevik" olarak hissettiği şey budur.
•Saniyedeki token sayısı (verim). Yanıtın geri kalanının ne kadar hızlı geldiği. Uzun bir yanıtın yavaş hissettirip hissettirmemesini belirleyen budur.
Her ikisi de modele ve yüke göre değişir, o yüzden bir pazarlama rakamına güvenmeyin. Kendiniz ölçün:
import time
from openai import OpenAI
client = OpenAI(base_url="https://api.token8341.com/v1",
api_key="sk-your-key")
start = time.perf_counter()
stream = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": "Write 200 words about caching"}],
stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
if ttft is None:
ttft = time.perf_counter() - start
tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
f"{tokens / elapsed:.1f} tok/s")Bunu günün birkaç farklı saatinde ve kendi beklediğiniz eşzamanlılık altında çalıştırın. Sabah 10'da hızlı, akşam 7'de yavaş olan bir sağlayıcının, bilmeniz gereken bir kapasite sorunu vardır.
Maliyet
Token başına fiyat işin kolay kısmıdır. Tam maliyet tablosu şunları içerir:
•Girdi ve çıktı fiyatları, çünkü çıktı genellikle girdinin birkaç katına mal olur.
•Önbellek isabeti fiyatlandırması. Tekrarlayan iş yükleri için bir prompt önbelleği, maliyeti herhangi bir indirimden daha fazla düşürebilir.
•Hız limitleri ve kısıtlama. Yalnızca seyrek olarak erişebildiğiniz ucuz bir uç nokta, kuyruklama ve yeniden denemeleri eklediğinizde ucuz değildir.
•Para birimi ve ödeme sürtünmesi. Sınır ötesi kart ücretleri ve dönüşüm maliyetleri küçük ekipler için gerçektir.
Tek başına milyon token başına fiyatı değil, gerçek iş yükünüzün fiyatını sorun.
Model kapsamı ve uyumluluk
•API, OpenAI uyumlu mu? Öyleyse standart SDK'ları kullanabilir ve daha sonra yeniden yazmadan geçiş yapabilirsiniz. Tescilliyse, sağlayıcıyla evleniyorsunuz demektir.
•Tek bir anahtarla birkaç model ailesine erişebiliyor musunuz? Bir veya iki model içeren bir katalog, sizi tescilli bir API kadar sıkı kilitler. Birçok model içeren bir katalog, size bir yedek ve daha ucuz yönlendirmeye giden bir yol sunar.
•Gömme, fonksiyon çağırma ve akış destekleniyor mu, yalnızca düz sohbet değil? Uç noktanın gerçek bir uygulamaya mı yoksa yalnızca bir demoya mı uyduğunu belirleyen özellikler bunlardır.
Veri işleme ve destek
•Veri saklama. Sağlayıcı, prompt'larınızı ve tamamlamalarınızı eğitim için saklıyor mu? Bunu yazılı olarak alın.
•Bölge ve ikamet. İstekler nerede işleniyor? Bazı kullanıcılar için bu bir tercih değil, yasal bir gerekliliktir.
•Destek kalitesi. Taahhütte bulunmadan önce bir destek talebi açmayı deneyin. İlk yanıtın hızı ve faydası, bir kesintinin nasıl olacağının güçlü bir göstergesidir.
•Durum şeffaflığı. Genel bir durum sayfası ve olay geçmişi, sağlayıcının kendi güvenilirliği konusunda dürüst olup olmadığını size söyler.
Kısa özet
Her adayı şu beş sorudan geçirin:
1.SLA nedir ve kaçırıldığında telafi ne olur?
2.Benim yüküm altında ölçülen TTFT ve verim nedir?
3.Önbellek isabetleri dahil, gerçek iş yüküm ne kadara mal oluyor?
4.API, OpenAI uyumlu mu ve tek bir anahtarın arkasında birkaç model var mı?
5.Verilerin nerede işlendiğini ve desteğin nasıl yanıt verdiğini bana söyleyecekler mi?
Bunların hiçbiri derin uzmanlık gerektirmez. Gerektirdiği şey, kesintiden sonra değil önce sormanızdır. Bu soruları rahatça yanıtlayan sağlayıcılar, yalnızca bir model listelemek yerine gerçekten üretim trafiği işletmiş olanlar olma eğilimindedir.
SiCore TokenWorks bu listenin çoğuna kolayca uyar: 99,9% SLA, https://api.token8341.com/v1 adresinde OpenAI uyumlu bir uç nokta, GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark ve Pangu'yu kapsayan tek bir anahtar ve önbellek isabeti fiyatlandırmasıyla token başına ölçümlü faturalandırma.