Jeśli kiedykolwiek korzystałeś tylko z jednego dostawcy LLM, cena katalogowa na jego stronie z cennikiem prawdopodobnie wygląda jak cena ostateczna. Nie jest nią. To cena detaliczna, a jak większość cen detalicznych ma w sobie dużo marży i struktury. Agregatorzy zarabiają, atakując dokładnie tę strukturę.
Dlaczego bezpośrednie ceny katalogowe są wysokie
Bezpośrednie ceny zawierają koszty, które nie dotyczą uruchamiania modelu. Kupując bezpośrednio od dostawcy, płacisz również za:
•Minimalne zobowiązania. Niektórzy dostawcy chcą przedpłaconego salda lub zadeklarowanych wydatków, zanim dadzą Ci najlepszą stawkę. Małe zespoły rzadko osiągają te progi.
•Jeden dostawca, jedna umowa. Każdy dostawca ma własną rejestrację, własne rozliczenia, własną walutę. Korzystanie z trzech dostawców oznacza trzy faktury i trzy metody płatności.
•Brak konkurencji w Twoim własnym rachunku. Gdy jesteś przywiązany do jednego dostawcy, ten dostawca nie ma powodu do rabatów. Płacisz jego stawkę albo odchodzisz.
•Limity szybkości ustawione dla ich ochrony, nie dla Twojej wygody.
Agregatorzy istnieją, ponieważ mogą kupować przepustowość u źródła hurtowo i przekazywać część rabatu dalej. Pozwalają też przenosić wydatki między dostawcami, co jest prawdziwą dźwignią: jeśli model A stanieje w przyszłym miesiącu, przełączasz ruch bez zmiany dostawcy.
Matematyka, na okrągłych liczbach
Użyję celowo prostych przykładowych liczb, żeby kształt był jasny. Prawdziwe ceny zmieniają się ciągle, ale arytmetyka jest ta sama.
Załóżmy, że dostawca podaje model w cenie $2.50 za milion tokenów wejściowych i $10.00 za milion tokenów wyjściowych. Typowe obciążenie, powiedzmy summarizer zgłoszeń wsparcia robiący 10 milionów tokenów wejściowych i 4 miliony tokenów wyjściowych miesięcznie, kosztowałoby:
Bezpośrednio: (10M x $2.50) + (4M x $10.00) = $25 + $40 = $65.00 / miesiącAgregator, który wynegocjował ceny hurtowe, może zaoferować ten sam model za mniej więcej jedną czwartą ceny katalogowej, $0.60 za milion wejściowych i $2.40 za milion wyjściowych:
Z agregatorem: (10M x $0.60) + (4M x $2.40) = $6.00 + $9.60 = $15.60 / miesiącTo około $49 zaoszczędzone miesięcznie na jednym skromnym obciążeniu, redukcja o ~76%, zanim tkniesz cokolwiek innego. Zwiększ liczbę tokenów o rząd wielkości, a bezwzględne oszczędności skalują się razem z tym.
Kluczowy punkt to nie te konkretne liczby. Chodzi o to, że różnica między „ceną katalogową" a „ceną hurtową" jest realna, a zadaniem agregatora jest siedzieć w tej różnicy i oddawać Ci jej część.
Inne koszty ukryte w drobnym druku
Cena za token to nagłówek, ale nie cały rachunek. Trzy rzeczy zaskakują ludzi:
Ceny trafień w cache. Niektóre modele dają rabat na tokeny, które trafiają w cache promptu. Jeśli jeden dostawca pobiera pełną cenę za buforowane wejście, a inny 10% tej ceny, obciążenie z powtarzalnymi promptami może różnić się kosztowo bardzo mocno, nawet przy tej samej cenie katalogowej. Zapytaj, zanim się zobowiążesz.
Waluta i tarcia płatnicze. Kupowanie od dostawcy, którego rozliczenia są w walucie lub regionie, którego Twoja karta nie lubi, dodaje opłaty za przewalutowanie i problemy z nieudanymi obciążeniami. Jedna faktura od agregatora w Twojej własnej walucie usuwa to.
Limity szybkości jako ukryty koszt. Tani model, który możesz wywołać tylko 10 razy na minutę, nie jest tani; zbudujesz logikę ponawiania i kolejkowania, żeby to skompensować, a to czas inżynierski. Limity przepustowości należą do porównania cen, nawet jeśli nie ma ich na stronie z cennikiem.
Szybki kalkulator kosztów
Oszacowanie wydatków przed budowaniem jest proste, gdy masz liczby. Oto mały skrypt w Pythonie w tym duchu:
def monthly_cost(input_tokens, output_tokens, in_price, out_price):
# prices are per million tokens
return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price
# Direct list price
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)
# Aggregator price (example values)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)
print(f"Direct: ${direct:.2f}")
print(f"Aggregated: ${aggregated:.2f}")
print(f"Saved: ${direct - aggregated:.2f}")Przepuść przez to swoje prawdziwe liczby tokenów z prawdziwymi cenami. To jedyna liczba, która się liczy.
Gdzie agregatorzy nie oszczędzają Ci pieniędzy
Powinienem być szczery co do ograniczeń. Agregator to reseller. Niektóre modele nie są w ogóle dostępne przez resellerów, a dla niektórych niszowych modeli marża agregatora może być gorsza niż zakup bezpośredni. Oszczędności są największe na popularnych modelach ogólnego przeznaczenia, gdzie istnieją rabaty hurtowe. Dla egzotycznego modelu, który rzadko wywołujesz, różnica to szum.
Poza tym niższa cena jest bezwartościowa, jeśli niezawodność agregatora jest zła. Oszczędność 30%, która kupuje Ci niestabilny endpoint, kosztuje więcej niż 30%, gdy weźmiesz pod uwagę ponowienia, zgłoszenia do wsparcia i swój własny czas. Cena i niezawodność to jedna decyzja, nie dwie.
SiCore TokenWorks to prostolinijna wersja tego modelu: zgodny z OpenAI, rozliczany za użycie, z katalogiem popularnych modeli od DeepSeek, Qwen, ERNIE, Doubao, Spark i Pangu obok GPT-4o, Claude i Gemini, wycenionych znacznie poniżej oficjalnych stawek za token.