SiCore TokenWorks
LLM APIAPI GatewayAggregation

Na co zwrócić uwagę wybierając dostawcę API LLM: lista kontrolna

SiCore TokenWorks Team·2026-09-03

Wybieranie dostawcy LLM na podstawie wyników benchmarków jest jak wybieranie restauracji na podstawie zdjęć w menu. Model ma znaczenie, ale wszystko wokół modelu też, a to właśnie otoczenie daje ci się we znaki w produkcji. To jest lista kontrolna, przez którą przepuszczam dostawcę, zanim skieruję na niego cokolwiek prawdziwego.

Czas działania i SLA

SLA to obietnica z liczbami w środku, więc czytaj te liczby. Procenty czasu działania są myląco blisko siebie, dopóki ich nie przeliczysz:

SLAPrzestój roczniePrzestój miesięcznie
99,9%8,76 godziny43,8 minuty
99,95%4,38 godziny21,9 minuty
99,99%52,6 minuty4,4 minuty

99,9% brzmi doskonale i wciąż pozwala na prawie godzinę miesięcznego przestoju. Jeśli twój produkt zależy od endpointu, 99,9% versus 99,99% to różnica między „irytujące" a „do zapomnienia". Sprawdź też dwie rzeczy poza nagłówkową liczbą:

•Co liczy się jako przestój. Niektóre SLA obejmują tylko całkowite awarie, a nie obniżoną przepustowość czy wysokie wskaźniki błędów.

•Co dostajesz, gdy go nie dotrzymają. Kredyt jest wart niewiele, jeśli jest ograniczony pułapem albo wymaga złożenia reklamacji. Środek zaradczy powinien być konkretny.

Dostawca, który w ogóle nie opublikuje SLA, coś ci mówi, i nie jest to nic dobrego.

Opóźnienie i przepustowość

Opóźnienie ma dwie liczby, które cię interesują, i mierzą one różne rzeczy:

•Czas do pierwszego tokena (TTFT). Jak długo trwa, zanim odpowiedź zacznie być strumieniowana. To jest to, co użytkownik odczuwa jako „żwawość".

•Tokeny na sekundę (przepustowość). Jak szybko przychodzi reszta odpowiedzi. To decyduje o tym, czy długa odpowiedź wydaje się wolna.

Obie zależą od modelu i od obciążenia, więc nie ufaj liczbie marketingowej. Zmierz to sam:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Uruchom to o kilku różnych porach dnia i przy własnej oczekiwanej współbieżności. Dostawca, który jest szybki o 10:00, a wolny o 19:00, ma problem z przepustowością, o którym musisz wiedzieć.

Koszt

Cena za token to łatwa część. Pełny obraz kosztów obejmuje:

•Ceny wejścia vs. wyjścia, ponieważ wyjście zwykle kosztuje kilka razy więcej niż wejście.

•Ceny trafień w cache. Przy powtarzalnych obciążeniach cache promptów może obniżyć koszt bardziej niż jakikolwiek rabat.

•Limity szybkości i throttling. Tani endpoint, do którego możesz uderzać tylko oszczędnie, nie jest tani, gdy dodasz kolejkowanie i ponowne próby.

•Waluta i tarcia płatnicze. Opłaty za karty transgraniczne i koszty konwersji są realne dla małych zespołów.

Poproś o cenę twojego rzeczywistego obciążenia, a nie cenę za milion tokenów w izolacji.

Pokrycie modeli i kompatybilność

•Czy API jest zgodne z OpenAI? Jeśli tak, możesz używać standardowych SDK i później się przełączyć bez przepisywania. Jeśli jest własnościowe, żenisz się z dostawcą.

•Czy możesz sięgnąć po kilka rodzin modeli przez jeden klucz? Katalog z jednym lub dwoma modelami zamyka cię tak samo mocno jak własnościowe API. Katalog z wieloma modelami daje ci plan B i ścieżkę do tańszego routingu.

•Czy embeddingi, wywoływanie funkcji i strumieniowanie są obsługiwane, nie tylko zwykły czat? To są funkcje, które decydują, czy endpoint pasuje do prawdziwej aplikacji, czy tylko do dema.

Przetwarzanie danych i wsparcie

•Przechowywanie danych. Czy dostawca zachowuje twoje prompty i uzupełnienia do trenowania? Uzyskaj to na piśmie.

•Region i rezydencja danych. Gdzie przetwarzane są żądania? Dla niektórych użytkowników to wymóg prawny, nie preferencja.

•Jakość wsparcia. Spróbuj otworzyć zgłoszenie do wsparcia, zanim się zobowiążesz. Szybkość i użyteczność pierwszej odpowiedzi to silny predyktor tego, jak będzie wyglądać awaria.

•Przejrzystość statusu. Publiczna strona statusu i historia incydentów mówią ci, czy dostawca jest szczery co do własnej niezawodności.

W skrócie

Przepuść każdego kandydata przez tych pięć pytań:

1.Jakie jest SLA i jaki jest środek zaradczy, gdy go nie dotrzymają?

2.Jakie są zmierzone TTFT i przepustowość przy moim obciążeniu?

3.Ile kosztuje moje rzeczywiste obciążenie, z trafieniami w cache włącznie?

4.Czy API jest zgodne z OpenAI, z kilkoma modelami za jednym kluczem?

5.Czy powiedzą mi, gdzie przetwarzane są dane i jak reaguje wsparcie?

Żadne z tych pytań nie wymaga głębokiej ekspertyzy. Wymagają tego, żebyś zapytał przed awarią, nie po. Dostawcy, którzy odpowiadają na nie swobodnie, to zwykle ci, którzy naprawdę obsługiwali produkcyjny ruch, a nie tylko wymienili model.

SiCore TokenWorks pasuje bez wysiłku do większości tej listy: SLA 99,9%, endpoint zgodny z OpenAI pod https://api.token8341.com/v1, jeden klucz obejmujący GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark i Pangu oraz rozliczanie za token z cenami trafień w cache.