SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

LLM-API-Preise im Vergleich: Wie Aggregatoren Ihnen Geld sparen

SiCore TokenWorks Team·2026-09-03

Wenn Sie bisher nur einen einzigen LLM-Anbieter genutzt haben, sieht der Listenpreis auf der Preisseite dieses Anbieters wahrscheinlich wie der Preis aus. Ist er aber nicht. Er ist der Endkundenpreis, und wie bei den meisten Endkundenpreisen steckt darin eine Menge Marge und Struktur. Aggregatoren verdienen ihr Geld damit, genau diese Struktur anzugreifen.

Warum direkte Listenpreise hoch sind

Direkte Preise enthalten Kosten, die nichts mit dem Betrieb des Modells zu tun haben. Wenn Sie direkt bei einem Anbieter kaufen, zahlen Sie auch für:

•Mindestabnahmen. Manche Anbieter verlangen ein vorausbezahltes Guthaben oder eine zugesagte Ausgabensumme, bevor Sie ihren besten Tarif erhalten. Kleine Teams erreichen diese Stufen selten.

•Ein Anbieter, ein Vertrag. Jeder Anbieter hat seine eigene Anmeldung, seine eigene Abrechnung, seine eigene Währung. Drei Anbieter bedeuten drei Rechnungen und drei Zahlungsmethoden.

•Kein Wettbewerb innerhalb Ihrer eigenen Rechnung. Wenn Sie an einen Anbieter gebunden sind, hat dieser Anbieter keinen Grund, Rabatte zu gewähren. Sie zahlen seinen Tarif oder Sie gehen.

•Rate Limits, die zu ihrem Schutz gesetzt sind, nicht zu Ihrer Bequemlichkeit.

Aggregatoren existieren, weil sie Upstream-Kapazität in großem Volumen einkaufen und einen Teil des Rabatts weitergeben können. Sie ermöglichen es Ihnen außerdem, Ausgaben zwischen Anbietern zu verschieben, und das ist der eigentliche Hebel: Wenn Modell A nächsten Monat günstiger wird, wechseln Sie Ihren Traffic, ohne den Anbieter zu wechseln.

Die Rechnung, mit runden Zahlen

Lassen Sie mich absichtlich einfache Beispielzahlen verwenden, damit die Struktur klar wird. Echte Preise ändern sich ständig, aber die Arithmetik bleibt dieselbe.

Nehmen wir an, ein Anbieter listet ein Modell mit $2,50 pro Million Input-Tokens und $10,00 pro Million Output-Tokens. Eine typische Arbeitslast, sagen wir ein Support-Ticket-Zusammenfasser mit 10 Millionen Input-Tokens und 4 Millionen Output-Tokens pro Monat, würde kosten:

Direct:  (10M x $2.50) + (4M x $10.00) = $25 + $40 = $65.00 / month

Ein Aggregator, der Volumenpreise ausgehandelt hat, könnte dasselbe Modell für etwa ein Viertel des Listenpreises anbieten, $0,60 pro Million Input und $2,40 pro Million Output:

Aggregated:  (10M x $0.60) + (4M x $2.40) = $6.00 + $9.60 = $15.60 / month

Das sind etwa $49 Ersparnis pro Monat bei einer einzigen bescheidenen Arbeitslast, eine Reduktion um ~76 %, bevor Sie irgendetwas anderes anfassen. Skalieren Sie die Token-Zahlen um eine Größenordnung nach oben, und die absoluten Einsparungen skalieren mit.

Der entscheidende Punkt sind nicht diese konkreten Zahlen. Der Punkt ist, dass die Lücke zwischen „Listenpreis" und „Volumenpreis" real ist, und die Aufgabe eines Aggregators ist es, in dieser Lücke zu sitzen und Ihnen einen Teil davon zurückzugeben.

Die anderen Kosten, die sich im Kleingedruckten verstecken

Der Preis pro Token ist die Schlagzeile, aber nicht die ganze Rechnung. Drei Dinge bringen Leute ins Stolpern:

Cache-Hit-Preise. Manche Modelle rabattieren Tokens, die einen Prompt-Cache treffen. Wenn ein Anbieter den vollen Preis für gecachte Eingaben berechnet und ein anderer 10 % davon, kann sich eine Arbeitslast mit repetitiven Prompts kostenseitig stark unterscheiden, selbst bei gleichem Listenpreis. Fragen Sie nach, bevor Sie sich festlegen.

Währung und Zahlungsreibung. Bei einem Anbieter zu kaufen, dessen Abrechnung in einer Währung oder Region erfolgt, die Ihre Karte nicht mag, verursacht Umrechnungsgebühren und Ärger mit fehlgeschlagenen Abbuchungen. Eine einzige Aggregator-Rechnung in Ihrer eigenen Währung beseitigt das.

Rate Limits als versteckte Kosten. Ein günstiges Modell, das Sie nur 10-mal pro Minute aufrufen können, ist nicht günstig; Sie werden Retry- und Queueing-Logik bauen, um das zu kompensieren, und das ist Entwicklungszeit. Durchsatzgrenzen gehören in den Preisvergleich, auch wenn sie nicht auf der Preisseite stehen.

Ein schneller Kostenschätzer

Die Ausgaben zu schätzen, bevor Sie bauen, ist unkompliziert, sobald Sie die Zahlen haben. Hier ist ein kleines Python-Skript in diesem Sinne:

def monthly_cost(input_tokens, output_tokens, in_price, out_price):
    # prices are per million tokens
    return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price

# Direct list price
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)

# Aggregator price (example values)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)

print(f"Direct:     ${direct:.2f}")
print(f"Aggregated: ${aggregated:.2f}")
print(f"Saved:      ${direct - aggregated:.2f}")

Lassen Sie Ihre echten Token-Zahlen mit Ihren echten Preisen durchlaufen. Das ist die einzige Zahl, die zählt.

Wo Aggregatoren Ihnen kein Geld sparen

Ich sollte ehrlich über die Grenzen sein. Ein Aggregator ist ein Wiederverkäufer. Manche Modelle sind über Wiederverkäufer überhaupt nicht verfügbar, und bei manchen Nischenmodellen kann der Aufschlag eines Aggregators schlechter sein als der Direktkauf. Die Einsparungen sind am größten bei den populären Allzweckmodellen, bei denen Volumenrabatte existieren. Bei einem exotischen Modell, das Sie selten aufrufen, ist der Unterschied vernachlässigbar.

Außerdem ist ein günstigerer Preis wertlos, wenn die Zuverlässigkeit des Aggregators schlecht ist. Eine Ersparnis von 30 %, die Ihnen einen unzuverlässigen Endpoint einbringt, kostet mehr als 30 %, sobald Sie Retries, Support-Tickets und Ihre eigene Zeit einrechnen. Preis und Zuverlässigkeit sind eine Entscheidung, nicht zwei.

SiCore TokenWorks ist eine unkomplizierte Version dieses Modells: OpenAI-kompatibel, Pay-as-you-go, mit einem Katalog populärer Modelle von DeepSeek, Qwen, ERNIE, Doubao, Spark und Pangu neben GPT-4o, Claude und Gemini, deutlich unter den offiziellen Preisen pro Token gelistet.