SiCore TokenWorks
LLM APIAPI GatewayAggregation

روندهای token8341: انتخاب API مدل‌های بزرگ — چرا دیگر تنها به رتبه‌بندی‌ها نگاه نمی‌کنیم

SiCore TokenWorks Team·2026-10-01

دو سال پیش به یک تیم که روی سیستم پشتیبانی مشتریان بین‌المللی کار می‌کرد، در بازبینی معماری کمک می‌کردم. روی وایت‌برد اتاق جلسات پر بود از جدول‌های مقایسه امتیاز مدل‌های مختلف — MMLU، C-Eval، HumanEval — و حتی چند دهم درصد بالاتر بودن یکی، باعث بحث‌های طولانی می‌شد. امسال که دوباره رفتم، همان تیم، همان وایت‌برد، اما این بار پر از مجموعه دیگری از اعداد: هزینه میانگین هر نشست، تأخیر P99، و دسترس‌پذیری هفت روز متوالی. این تغییر یک مورد استثنایی نیست. در این چند سالی که روی پلتفرم‌های AI کار می‌کنم، به‌وضوح حس کرده‌ام که منطق انتخاب API مدل‌های بزرگ در سازمان‌ها، در حال چرخش از «پرستش پارامترها» به «دفتر حساب مهندسی» است.

از رتبه‌بندی به دفتر حساب — چه چیزی در انتخاب تغییر کرده

به‌طور خلاصه، سؤال اصلی انتخاب در گذشته این بود که «کدام مدل باهوش‌تر است»، اما حالا به «کدام مدل برای این وظیفه به‌صرفه‌تر است» تبدیل شده. امتیاز رتبه‌بندی‌ها یک شاخص ایستا در شرایط آزمایشگاهی است، اما در محیط تولید، شما با میلیون‌ها فراخوانی، ترافیک اوج نوسانی، و نسخه‌های مدلی که هر فصل تغییر می‌کنند روبرو هستید. مدلی که در رتبه‌بندی جزو چند تای اول است، اگر هزینه استنتاجش دو برابر مدل دیگری و تأخیرش هم دو برابر باشد، در سناریویی با میلیون‌ها فراخوانی روزانه، حساب اصلاً جور در نمی‌آید. در پروژه ما حالا بیشتر بر انتخاب خودکار بهینه‌ترین مدل بر اساس وظیفه تأکید می‌شود — وظایفی مثل دسته‌بندی و خلاصه‌سازی با مدل‌های کوچک، و فقط استنتاج پیچیده به مدل‌های بزرگ مسیریابی می‌شود، که این کار هزینه کل را به‌طور چشمگیری کاهش می‌دهد. به همین دلیل است که دروازه مدل (Model Gateway) شروع به تبدیل شدن به یک استاندارد کرده — این فقط انتقال درخواست نیست، بلکه مسئولیت‌هایی در سطح تولید مثل مسیریابی، تنزل سرویس و محدودسازی نرخ را نیز بر عهده دارد.

سه عامل که صنعت را به این نقطه عطف رساند

عامل اول، کاهش شکاف توانمندی مدل‌ها است. فاصله بین مدل‌های پیشرو و مدل‌های رده دوم، از «قابل استفاده بودن یا نبودن» در آن سال‌ها به «کمی تفاوت داشتن» تغییر کرده. برای اکثر سناریوهای تجاری، کاربران اصلاً این تفاوت را حس نمی‌کنند، اما اختلاف هزینه واقعی است. عامل دوم، رسیدن مدل‌های داخلی به سطح برابری در سناریوهای چینی است. مدل‌هایی مثل Qwen، DeepSeek، Doubao و ERNIE در درک زبان چینی، دانش بومی‌سازی‌شده و انطباق با قوانین، در واقع بیشتر با کسب‌وکارهای داخلی هماهنگ هستند تا مدل‌های خارجی. قبلاً بسیاری از تیم‌ها «مدل خارجی به‌عنوان اصلی، داخلی به‌عنوان پشتیبان» داشتند، اما حالا برعکس شده. عامل سوم، و مهم‌ترین، ورود سازمان‌ها از مرحله دمو به تولید در مقیاس بزرگ است. در مرحله دمو حجم فراخوانی کم و هزینه بی‌اهمیت است؛ اما به‌محض افزایش مقیاس، هزینه هر فراخوانی و خسارت هر تایم‌اوت چند برابر می‌شود. در این مرحله، انتخاب دیگر یک مسئله ترجیح فنی نیست، بلکه یک مسئله مالی است.

پس از این چرخش، زیرساخت باید کدام بخش‌ها را تکمیل کند

بخش اول، دروازه مدل است. این حل‌کننده مسئله «مدیریت همه مدل‌ها از یک نقطه ورود» است. بدون دروازه، هر بار که یک مدل جدید متصل می‌کنید، باید کد را تغییر دهید، یک مجموعه کلید نگهداری کنید و یک منطق تلاش مجدد بنویسید. با دروازه، اتصال یکپارچه چند مدلی امکان‌پذیر می‌شود و تغییر مدل برای لایه بالایی کسب‌وکار شفاف است. بخش دوم، تجمیع API هوش مصنوعی است. ارزش این بخش در یکپارچه‌سازی خرید، صورتحساب و مدیریت سهمیه است. ما در داخل مقایسه‌ای انجام دادیم: اتصال مستقیم به SDK پنج شرکت، فقط برای نگهداری مستندات و سازگاری نسخه‌ها، بخش قابل‌توجهی از انرژی یک مهندس را می‌گرفت؛ اما با یک پلتفرم تجمیعی که با OpenAI SDK سازگار است، با تغییر یک خط base_url می‌توان سوئیچ کرد و آنچه صرفه‌جویی می‌شود، نیروی انسانی واقعی است. اینجا یک نکته را ذکر کنم: جایگاه‌یابی SiCore TokenWorks به‌عنوان اولویت مدل‌های داخلی به‌همراه توان محاسباتی سبز، دقیقاً روی همین نقطه عطف نشسته — آنچه سازمان‌ها می‌خواهند بیشترین تعداد مدل نیست، بلکه پوشش کامل مدل‌های داخلی، هزینه قابل کنترل و زمان‌بندی پایدار توان محاسباتی است. بخش سوم، قابلیت مشاهده‌پذیری است. بدون گزارش فراخوانی، آمار مصرف Token و توزیع تأخیر، اصلاً نمی‌دانید پول کجا خرج می‌شود و کدام مدل عقب‌ماندگی دارد. پیش‌نیاز بهینه‌سازی مستمر، دیده شدن است.

سه پیش‌بینی برای انتخاب در سال ۲۰۲۶

پیش‌بینی اول: پرداخت به‌ازای مصرف به گزینه پیش‌فرض تبدیل می‌شود و مدل‌های اشتراک سالانه و ماهانه به تعداد محدودی سناریوی پایدار با ترافیک بالا محدود خواهند شد. چون حجم کسب‌وکار خودش نوسان دارد و هیچ‌کس نمی‌خواهد برای توان محاسباتی بیکار هزینه بپردازد. پیش‌بینی دوم: مسیریابی مدل از «قابلیت پیشرفته» به «قابلیت پایه» تبدیل می‌شود. وقتی استفاده همزمان از سه یا چهار مدل در یک سازمان عادی شود، انتخاب خودکار بهینه‌ترین مدل دیگر یک امتیاز اضافی نیست، بلکه یک نیاز ضروری برای صرفه‌جویی در هزینه است. پیش‌بینی سوم: توان محاسباتی سبز و بومی‌سازی از یک امتیاز مثبت به یک شاخص سخت تبدیل می‌شود. انطباق با الزامات فناوری اطلاعات بومی، هزینه انرژی و پایداری زنجیره تأمین — این سه موضوع در سال ۲۰۲۶ در فرآیندهای خرید بیشتری به‌عنوان الزامات سخت‌گیرانه نوشته خواهند شد. زمان‌بندی توان محاسباتی SiCore TokenWorks در شرق و غرب کشور، در اصل پاسخی به همین روند است.

خلاصه در یک جمله: جابجایی منطق انتخاب، در اصل تغییر از «انتخاب باهوش‌ترین مدل» به «انتخاب مناسب‌ترین ترکیب» است. برای درک عمیق‌تر جزئیات پیاده‌سازی مسیریابی چندمدلی و تجمیع API، می‌توانید در همین جهت‌ها — دروازه مدل، API مدل‌های بزرگ و پرداخت به‌ازای مصرف — بیشتر جستجو کنید.