SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

مقایسه قیمت‌گذاری API مدل‌های زبانی بزرگ: چگونه Aggregatorها در هزینه شما صرفه‌جویی می‌کنند

SiCore TokenWorks Team·2026-09-03

اگر تنها از یک ارائه‌دهنده LLM استفاده کرده‌اید، احتمالاً قیمت درج‌شده در صفحه قیمت‌گذاری آن ارائه‌دهنده به نظرتان همان قیمت واقعی است. اما این‌طور نیست. آن قیمت خرده‌فروشی است و مانند بیشتر قیمت‌های خرده‌فروشی، حاشیه سود و ساختار زیادی در آن نهفته است. Aggregatorها از طریق حمله به همین ساختار پول درمی‌آورند.

چرا قیمت‌های مستقیم درج‌شده بالا هستند

قیمت‌گذاری مستقیم هزینه‌هایی دارد که ربطی به اجرای مدل ندارند. وقتی مستقیماً از یک فروشنده خرید می‌کنید، در واقع برای موارد زیر هم پول می‌دهید:

•تعهدات حداقلی. برخی ارائه‌دهندگان می‌خواهند قبل از دادن بهترین نرخ، موجودی پیش‌پرداخت یا تعهد هزینه داشته باشید. تیم‌های کوچک به‌ندرت به آن سطوح می‌رسند.

•یک ارائه‌دهنده، یک قرارداد. هر فروشنده ثبت‌نام خودش، صورتحساب خودش و ارز خودش را دارد. کار با سه ارائه‌دهنده یعنی سه فاکتور و سه روش پرداخت.

•عدم رقابت در صورتحساب خودتان. وقتی به یک فروشنده قفل شده‌اید، آن فروشنده دلیلی برای تخفیف دادن ندارد. یا نرخ آن‌ها را می‌پردازید یا می‌روید.

•محدودیت‌های نرخ که برای محافظت از آن‌ها تنظیم شده، نه برای راحتی شما.

Aggregatorها وجود دارند چون می‌توانند ظرفیت بالادستی را به‌صورت عمده خریداری کنند و بخشی از تخفیف را به شما منتقل کنند. آن‌ها همچنین به شما اجازه می‌دهند هزینه را بین ارائه‌دهندگان جابه‌جا کنید، که همان اهرم واقعی است: اگر مدل A ماه بعد ارزان‌تر شود، ترافیک خود را بدون تغییر فروشنده جابه‌جا می‌کنید.

محاسبات، با اعداد گرد

بگذارید از اعداد مثال عمداً ساده استفاده کنم تا شکل ماجرا روشن شود. قیمت‌های واقعی مدام تغییر می‌کنند، اما حساب‌وکتاب همان است.

فرض کنید یک ارائه‌دهنده مدلی را با قیمت ۲.۵۰ دلار به ازای هر میلیون توکن ورودی و ۱۰.۰۰ دلار به ازای هر میلیون توکن خروجی فهرست کرده است. یک بار کاری معمولی، مثلاً یک خلاصه‌ساز تیکت پشتیبانی که ماهانه ۱۰ میلیون توکن ورودی و ۴ میلیون توکن خروجی مصرف می‌کند، هزینه‌ای برابر با این خواهد داشت:

Direct:  (10M x $2.50) + (4M x $10.00) = $25 + $40 = $65.00 / month

یک Aggregator که قیمت‌گذاری عمده مذاکره کرده است، ممکن است همان مدل را با حدود یک‌چهارم قیمت درج‌شده ارائه دهد، ۰.۶۰ دلار به ازای هر میلیون ورودی و ۲.۴۰ دلار به ازای هر میلیون خروجی:

Aggregated:  (10M x $0.60) + (4M x $2.40) = $6.00 + $9.60 = $15.60 / month

این یعنی حدود ۴۹ دلار صرفه‌جویی در ماه روی یک بار کاری متوسط، کاهشی حدود ۷۶٪، پیش از آنکه به چیز دیگری دست بزنید. تعداد توکن‌ها را یک مرتبه بزرگی افزایش دهید و صرفه‌جویی مطلق هم با آن مقیاس می‌گیرد.

نکته کلیدی این اعداد خاص نیست. نکته این است که شکاف بین «قیمت درج‌شده» و «قیمت عمده» واقعی است، و کار یک Aggregator این است که در همان شکاف بنشیند و بخشی از آن را به شما برگرداند.

سایر هزینه‌هایی که در متن ریز پنهان شده‌اند

قیمت هر توکن تیتر اصلی است، اما کل صورتحساب نیست. سه چیز مردم را غافلگیر می‌کند:

قیمت‌گذاری برخورد با کش. برخی مدل‌ها توکن‌هایی که به کش پرامپت برخورد می‌کنند را تخفیف می‌دهند. اگر یک ارائه‌دهنده برای ورودی کش‌شده قیمت کامل بگیرد و دیگری ۱۰٪ آن، یک بار کاری با پرامپت‌های تکراری می‌تواند حتی با قیمت درج‌شده یکسان، هزینه‌ای بسیار متفاوت داشته باشد. قبل از تعهد، بپرسید.

اصطکاک ارز و پرداخت. خرید از فروشنده‌ای که صورتحسابش به ارزی یا در منطقه‌ای است که کارت شما با آن راحت نیست، هزینه‌های تبدیل و دردسرهای پرداخت ناموفق را اضافه می‌کند. یک صورتحساب واحد از Aggregator به ارز خودتان این مشکل را حذف می‌کند.

محدودیت‌های نرخ به‌عنوان هزینه پنهان. مدل ارزانی که فقط می‌توانید دقیقه‌ای ۱۰ بار فراخوانی کنید ارزان نیست؛ شما منطق تلاش مجدد و صف‌بندی می‌سازید تا جبران کنید، و این زمان مهندسی است. محدودیت‌های توان عملیاتی باید در مقایسه قیمت‌گذاری گنجانده شوند، حتی اگر در صفحه قیمت‌گذاری نباشند.

یک تخمین‌زن سریع هزینه

تخمین هزینه پیش از ساخت، زمانی که اعداد را دارید، ساده است. اینجا یک اسکریپت کوچک پایتون در همین روحیه است:

def monthly_cost(input_tokens, output_tokens, in_price, out_price):
    # prices are per million tokens
    return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price

# Direct list price
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)

# Aggregator price (example values)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)

print(f"Direct:     ${direct:.2f}")
print(f"Aggregated: ${aggregated:.2f}")
print(f"Saved:      ${direct - aggregated:.2f}")

تعداد توکن‌های واقعی خود را با قیمت‌های واقعی خودتان از آن عبور دهید. این تنها عددی است که اهمیت دارد.

جاهایی که Aggregatorها در هزینه شما صرفه‌جویی نمی‌کنند

باید درباره محدودیت‌ها صریح باشم. Aggregator یک فروشنده مجدد است. برخی مدل‌ها اصلاً از طریق فروشندگان مجدد در دسترس نیستند، و برای برخی مدل‌های خاص، حاشیه سود Aggregator می‌تواند بدتر از خرید مستقیم باشد. صرفه‌جویی روی مدل‌های عمومی محبوب که تخفیف عمده برایشان وجود دارد، بیشترین است. برای یک مدل عجیب و غریب که به‌ندرت فراخوانی می‌کنید، تفاوت ناچیز است.

همچنین، قیمت ارزان‌تر اگر قابلیت اطمینان Aggregator بد باشد بی‌ارزش است. صرفه‌جویی ۳۰٪ که یک endpoint بی‌ثبات به شما می‌دهد، وقتی تلاش‌های مجدد، تیکت‌های پشتیبانی و زمان خودتان را در نظر بگیرید، بیشتر از ۳۰٪ هزینه دارد. قیمت و قابلیت اطمینان یک تصمیم هستند، نه دو تا.

SiCore TokenWorks نسخه ساده‌ای از همین مدل است: سازگار با OpenAI، پرداخت به‌ازای مصرف، با فهرستی از مدل‌های محبوب از DeepSeek، Qwen، ERNIE، Doubao، Spark و Pangu در کنار GPT-4o، Claude و Gemini، که بسیار پایین‌تر از نرخ‌های رسمی هر توکن فهرست شده‌اند.