SiCore TokenWorks
LLM APIAPI GatewayAggregation

Waar u op moet letten bij een LLM API-provider: een checklist

SiCore TokenWorks Team·2026-09-03

Een LLM-provider kiezen op basis van benchmarkscores is als een restaurant kiezen op basis van de foto's op het menu. Het model doet ertoe, maar alles rondom het model ook, en dat omringende is wat je in productie daadwerkelijk parten speelt. Dit is de checklist die ik langsloop bij een provider voordat ik er iets echts naartoe wijs.

Uptime en SLA

Een SLA is een belofte met getallen eraan vast, dus lees de getallen. Uptime-percentages lijken misleidend dicht bij elkaar te liggen tot je ze omrekent:

SLADowntime per jaarDowntime per maand
99,9%8,76 uur43,8 minuten
99,95%4,38 uur21,9 minuten
99,99%52,6 minuten4,4 minuten

99,9% klinkt uitstekend en staat nog steeds bijna een uur maandelijkse uitval toe. Als uw product afhankelijk is van het endpoint, is 99,9% versus 99,99% het verschil tussen "vervelend" en "vergeetachtig". Controleer ook twee dingen naast het hoofdbedrag:

•Wat telt als downtime. Sommige SLA's dekken alleen totale storingen, niet verminderde doorvoer of hoge foutpercentages.

•Wat u krijgt als ze het niet halen. Een credit is weinig waard als de credit gemaximeerd is of als u een claim moet indienen. De remedie moet concreet zijn.

Een provider die helemaal geen SLA wil publiceren, vertelt u iets, en het is niet goed.

Latency en doorvoer

Latency heeft twee getallen waar u om geeft, en ze meten verschillende dingen:

•Time to first token (TTFT). Hoe lang het duurt voordat het antwoord begint te streamen. Dit is wat een gebruiker ervaart als "vlot".

•Tokens per seconde (doorvoer). Hoe snel de rest van het antwoord binnenkomt. Dit bepaalt of een lang antwoord traag aanvoelt.

Beide variëren per model en per belasting, dus vertrouw geen marketinggetal. Meet het zelf:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Voer dat op een paar verschillende momenten van de dag uit en onder uw eigen verwachte gelijktijdigheid. Een provider die snel is om 10.00 uur en traag om 19.00 uur heeft een capaciteitsprobleem waarvan u op de hoogte moet zijn.

Kosten

Prijs per token is het makkelijke deel. Het volledige kostenplaatje omvat:

•Input- versus outputprijzen, aangezien output meestal meerdere keren de input kost.

•Prijsstelling bij cache-hits. Voor repetitieve workloads kan een promptcache de kosten meer drukken dan welke korting dan ook.

•Rate limits en throttling. Een goedkoop endpoint dat u slechts beperkt kunt aanspreken is niet goedkoop zodra u wachtrijen en retries toevoegt.

•Valuta en betalingsfrictie. Kosten voor grensoverschrijdende kaarten en conversiekosten zijn reëel voor kleine teams.

Vraag naar de prijs van uw daadwerkelijke workload, niet naar de prijs per miljoen tokens op zichzelf.

Modeldekking en compatibiliteit

•Is de API OpenAI-compatibel? Als dat zo is, kunt u de standaard SDK's gebruiken en later overstappen zonder te herschrijven. Als het propriëtair is, trouwt u met de provider.

•Kunt u meerdere modelfamilies bereiken via één sleutel? Een catalogus met een of twee modellen sluit u net zo nauw in als een propriëtaire API. Een catalogus met veel modellen geeft u een fallback en een pad naar goedkopere routing.

•Worden embeddings, function calling en streaming ondersteund, niet alleen platte chat? Dit zijn de functies die bepalen of het endpoint bij een echte app past of alleen bij een demo.

Gegevensverwerking en ondersteuning

•Gegevensbewaring. Bewaart de provider uw prompts en completions voor training? Krijg dit op schrift.

•Regio en residentie. Waar worden de verzoeken verwerkt? Voor sommige gebruikers is dit een wettelijke vereiste, geen voorkeur.

•Kwaliteit van ondersteuning. Probeer een supportticket te openen voordat u zich vastlegt. De snelheid en bruikbaarheid van het eerste antwoord voorspellen sterk hoe een storing zal verlopen.

•Transparantie van status. Een openbare statuspagina en incidentgeschiedenis vertellen u of de provider eerlijk is over zijn eigen betrouwbaarheid.

De korte versie

Laat elke kandidaat door deze vijf vragen gaan:

1.Wat is de SLA, en wat is de remedie als deze niet wordt gehaald?

2.Wat zijn de gemeten TTFT en doorvoer onder mijn belasting?

3.Wat kost mijn echte workload, cache-hits inbegrepen?

4.Is de API OpenAI-compatibel, met meerdere modellen achter één sleutel?

5.Vertellen ze me waar gegevens worden verwerkt en hoe ondersteuning reageert?

Niets hiervan vereist diepgaande expertise. Het vereist dat u het vraagt vóór de storing, niet erna. De providers die deze vragen met gemak beantwoorden, zijn doorgaans degenen die daadwerkelijk productieverkeer hebben gedraaid, in plaats van alleen een model te hebben vermeld.

SiCore TokenWorks past gemakkelijk bij het grootste deel van deze lijst: een SLA van 99,9%, een OpenAI-compatibel endpoint op https://api.token8341.com/v1, één sleutel die GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark en Pangu dekt, en facturering per token met prijsstelling bij cache-hits.