SiCore TokenWorks
LLM APIAPI GatewayAggregation

Worauf man bei einem LLM-API-Anbieter achten sollte: Eine Checkliste

SiCore TokenWorks Team·2026-09-03

Einen LLM-Anbieter nach Benchmark-Werten auszuwählen ist wie ein Restaurant nach seinen Speisekartenfotos auszuwählen. Das Modell zählt, aber alles rund um das Modell zählt genauso, und genau das Drumherum beißt einen im Produktivbetrieb. Das ist die Checkliste, die ich bei einem Anbieter durchgehe, bevor ich irgendetwas Echtes darauf ausrichte.

Uptime und SLA

Ein SLA ist ein Versprechen mit angehängten Zahlen, also lies die Zahlen. Uptime-Prozentsätze liegen trügerisch nah beieinander, bis man sie umrechnet:

SLAAusfallzeit pro JahrAusfallzeit pro Monat
99,9 %8,76 Stunden43,8 Minuten
99,95 %4,38 Stunden21,9 Minuten
99,99 %52,6 Minuten4,4 Minuten

99,9 % klingt hervorragend und erlaubt trotzdem fast eine Stunde Ausfall pro Monat. Wenn dein Produkt vom Endpunkt abhängt, ist 99,9 % versus 99,99 % der Unterschied zwischen „ärgerlich" und „vergessenswert". Prüfe außerdem zwei Dinge jenseits der Schlagzeile:

•Was als Ausfallzeit zählt. Manche SLAs decken nur Totalausfälle ab, nicht degradierten Durchsatz oder hohe Fehlerraten.

•Was du bekommst, wenn sie es verfehlen. Eine Gutschrift ist wenig wert, wenn die Gutschrift gedeckelt ist oder du einen Antrag stellen musst. Die Abhilfe sollte konkret sein.

Ein Anbieter, der überhaupt kein SLA veröffentlichen will, sagt dir damit etwas, und es ist nichts Gutes.

Latenz und Durchsatz

Bei der Latenz gibt es zwei Zahlen, die dich interessieren, und sie messen unterschiedliche Dinge:

•Time to first token (TTFT). Wie lange es dauert, bis die Antwort zu streamen beginnt. Das ist, was ein Nutzer als „flott" empfindet.

•Tokens pro Sekunde (Durchsatz). Wie schnell der Rest der Antwort ankommt. Das bestimmt, ob sich eine lange Antwort langsam anfühlt.

Beide variieren je nach Modell und je nach Last, also vertraue keiner Marketingzahl. Miss es selbst:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Führe das zu verschiedenen Tageszeiten und unter deiner eigenen erwarteten Nebenläufigkeit aus. Ein Anbieter, der um 10 Uhr schnell und um 19 Uhr langsam ist, hat ein Kapazitätsproblem, das du kennen musst.

Kosten

Der Preis pro Token ist der einfache Teil. Das vollständige Kostenbild umfasst:

•Input- vs. Output-Preise, da Output normalerweise ein Vielfaches von Input kostet.

•Preise für Cache-Treffer. Bei repetitiven Workloads kann ein Prompt-Cache die Kosten stärker senken als jeder Rabatt.

•Rate Limits und Drosselung. Ein günstiger Endpunkt, den du nur spärlich erreichen kannst, ist nicht günstig, sobald du Queueing und Retries hinzurechnest.

•Währung und Zahlungsreibung. Grenzüberschreitende Kartengebühren und Umrechnungskosten sind für kleine Teams real.

Frage nach dem Preis für deinen tatsächlichen Workload, nicht nach dem Preis pro Million Tokens isoliert betrachtet.

Modellabdeckung und Kompatibilität

•Ist die API OpenAI-kompatibel? Wenn ja, kannst du die Standard-SDKs verwenden und später wechseln, ohne umzuschreiben. Wenn sie proprietär ist, heiratest du den Anbieter.

•Kannst du mehrere Modellfamilien über einen Schlüssel erreichen? Ein Katalog mit ein oder zwei Modellen bindet dich genauso eng wie eine proprietäre API. Ein Katalog mit vielen Modellen gibt dir einen Fallback und einen Weg zu günstigerem Routing.

•Werden Embeddings, Function Calling und Streaming unterstützt, nicht nur einfacher Chat? Diese Features entscheiden, ob der Endpunkt zu einer echten App passt oder nur zu einer Demo.

Datenhandling und Support

•Datenaufbewahrung. Behält der Anbieter deine Prompts und Completions fürs Training? Lass dir das schriftlich geben.

•Region und Datenresidenz. Wo werden die Anfragen verarbeitet? Für manche Nutzer ist das eine gesetzliche Anforderung, keine Präferenz.

•Support-Qualität. Versuche, ein Support-Ticket zu eröffnen, bevor du dich festlegst. Die Geschwindigkeit und Nützlichkeit der ersten Antwort ist ein starker Prädiktor dafür, wie ein Ausfall ablaufen wird.

•Status-Transparenz. Eine öffentliche Statusseite und Incident-Historie zeigen dir, ob der Anbieter ehrlich über seine eigene Zuverlässigkeit ist.

Die Kurzfassung

Lass jeden Kandidaten durch diese fünf Fragen laufen:

1.Wie lautet das SLA, und was ist die Abhilfe, wenn es verfehlt wird?

2.Was sind die gemessenen TTFT- und Durchsatzwerte unter meiner Last?

3.Was kostet mein tatsächlicher Workload, Cache-Treffer inklusive?

4.Ist die API OpenAI-kompatibel, mit mehreren Modellen hinter einem Schlüssel?

5.Sagen sie mir, wo Daten verarbeitet werden und wie der Support reagiert?

Nichts davon erfordert tiefe Expertise. Es erfordert, dass du vor dem Ausfall fragst, nicht danach. Die Anbieter, die diese Fragen locker beantworten, sind tendenziell die, die tatsächlich Produktivverkehr betrieben haben, statt nur ein Modell zu listen.

SiCore TokenWorks passt leicht auf die meisten Punkte dieser Liste: ein SLA von 99,9 %, ein OpenAI-kompatibler Endpunkt unter https://api.token8341.com/v1, ein Schlüssel für GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark und Pangu sowie nutzungsbasierte Abrechnung pro Token mit Cache-Treffer-Preisen.