دو سال پیش به یک تیم که روی سیستم پشتیبانی مشتریان بینالمللی کار میکرد، در بازبینی معماری کمک میکردم. روی وایتبرد اتاق جلسات پر بود از جدولهای مقایسه امتیاز مدلهای مختلف — MMLU، C-Eval، HumanEval — و حتی چند دهم درصد بالاتر بودن یکی، باعث بحثهای طولانی میشد. امسال که دوباره رفتم، همان تیم، همان وایتبرد، اما این بار پر از مجموعه دیگری از اعداد: هزینه میانگین هر نشست، تأخیر P99، و دسترسپذیری هفت روز متوالی. این تغییر یک مورد استثنایی نیست. در این چند سالی که روی پلتفرمهای AI کار میکنم، بهوضوح حس کردهام که منطق انتخاب API مدلهای بزرگ در سازمانها، در حال چرخش از «پرستش پارامترها» به «دفتر حساب مهندسی» است.
از رتبهبندی به دفتر حساب — چه چیزی در انتخاب تغییر کرده
بهطور خلاصه، سؤال اصلی انتخاب در گذشته این بود که «کدام مدل باهوشتر است»، اما حالا به «کدام مدل برای این وظیفه بهصرفهتر است» تبدیل شده. امتیاز رتبهبندیها یک شاخص ایستا در شرایط آزمایشگاهی است، اما در محیط تولید، شما با میلیونها فراخوانی، ترافیک اوج نوسانی، و نسخههای مدلی که هر فصل تغییر میکنند روبرو هستید. مدلی که در رتبهبندی جزو چند تای اول است، اگر هزینه استنتاجش دو برابر مدل دیگری و تأخیرش هم دو برابر باشد، در سناریویی با میلیونها فراخوانی روزانه، حساب اصلاً جور در نمیآید. در پروژه ما حالا بیشتر بر انتخاب خودکار بهینهترین مدل بر اساس وظیفه تأکید میشود — وظایفی مثل دستهبندی و خلاصهسازی با مدلهای کوچک، و فقط استنتاج پیچیده به مدلهای بزرگ مسیریابی میشود، که این کار هزینه کل را بهطور چشمگیری کاهش میدهد. به همین دلیل است که دروازه مدل (Model Gateway) شروع به تبدیل شدن به یک استاندارد کرده — این فقط انتقال درخواست نیست، بلکه مسئولیتهایی در سطح تولید مثل مسیریابی، تنزل سرویس و محدودسازی نرخ را نیز بر عهده دارد.
سه عامل که صنعت را به این نقطه عطف رساند
عامل اول، کاهش شکاف توانمندی مدلها است. فاصله بین مدلهای پیشرو و مدلهای رده دوم، از «قابل استفاده بودن یا نبودن» در آن سالها به «کمی تفاوت داشتن» تغییر کرده. برای اکثر سناریوهای تجاری، کاربران اصلاً این تفاوت را حس نمیکنند، اما اختلاف هزینه واقعی است. عامل دوم، رسیدن مدلهای داخلی به سطح برابری در سناریوهای چینی است. مدلهایی مثل Qwen، DeepSeek، Doubao و ERNIE در درک زبان چینی، دانش بومیسازیشده و انطباق با قوانین، در واقع بیشتر با کسبوکارهای داخلی هماهنگ هستند تا مدلهای خارجی. قبلاً بسیاری از تیمها «مدل خارجی بهعنوان اصلی، داخلی بهعنوان پشتیبان» داشتند، اما حالا برعکس شده. عامل سوم، و مهمترین، ورود سازمانها از مرحله دمو به تولید در مقیاس بزرگ است. در مرحله دمو حجم فراخوانی کم و هزینه بیاهمیت است؛ اما بهمحض افزایش مقیاس، هزینه هر فراخوانی و خسارت هر تایماوت چند برابر میشود. در این مرحله، انتخاب دیگر یک مسئله ترجیح فنی نیست، بلکه یک مسئله مالی است.
پس از این چرخش، زیرساخت باید کدام بخشها را تکمیل کند
بخش اول، دروازه مدل است. این حلکننده مسئله «مدیریت همه مدلها از یک نقطه ورود» است. بدون دروازه، هر بار که یک مدل جدید متصل میکنید، باید کد را تغییر دهید، یک مجموعه کلید نگهداری کنید و یک منطق تلاش مجدد بنویسید. با دروازه، اتصال یکپارچه چند مدلی امکانپذیر میشود و تغییر مدل برای لایه بالایی کسبوکار شفاف است. بخش دوم، تجمیع API هوش مصنوعی است. ارزش این بخش در یکپارچهسازی خرید، صورتحساب و مدیریت سهمیه است. ما در داخل مقایسهای انجام دادیم: اتصال مستقیم به SDK پنج شرکت، فقط برای نگهداری مستندات و سازگاری نسخهها، بخش قابلتوجهی از انرژی یک مهندس را میگرفت؛ اما با یک پلتفرم تجمیعی که با OpenAI SDK سازگار است، با تغییر یک خط base_url میتوان سوئیچ کرد و آنچه صرفهجویی میشود، نیروی انسانی واقعی است. اینجا یک نکته را ذکر کنم: جایگاهیابی SiCore TokenWorks بهعنوان اولویت مدلهای داخلی بههمراه توان محاسباتی سبز، دقیقاً روی همین نقطه عطف نشسته — آنچه سازمانها میخواهند بیشترین تعداد مدل نیست، بلکه پوشش کامل مدلهای داخلی، هزینه قابل کنترل و زمانبندی پایدار توان محاسباتی است. بخش سوم، قابلیت مشاهدهپذیری است. بدون گزارش فراخوانی، آمار مصرف Token و توزیع تأخیر، اصلاً نمیدانید پول کجا خرج میشود و کدام مدل عقبماندگی دارد. پیشنیاز بهینهسازی مستمر، دیده شدن است.
سه پیشبینی برای انتخاب در سال ۲۰۲۶
پیشبینی اول: پرداخت بهازای مصرف به گزینه پیشفرض تبدیل میشود و مدلهای اشتراک سالانه و ماهانه به تعداد محدودی سناریوی پایدار با ترافیک بالا محدود خواهند شد. چون حجم کسبوکار خودش نوسان دارد و هیچکس نمیخواهد برای توان محاسباتی بیکار هزینه بپردازد. پیشبینی دوم: مسیریابی مدل از «قابلیت پیشرفته» به «قابلیت پایه» تبدیل میشود. وقتی استفاده همزمان از سه یا چهار مدل در یک سازمان عادی شود، انتخاب خودکار بهینهترین مدل دیگر یک امتیاز اضافی نیست، بلکه یک نیاز ضروری برای صرفهجویی در هزینه است. پیشبینی سوم: توان محاسباتی سبز و بومیسازی از یک امتیاز مثبت به یک شاخص سخت تبدیل میشود. انطباق با الزامات فناوری اطلاعات بومی، هزینه انرژی و پایداری زنجیره تأمین — این سه موضوع در سال ۲۰۲۶ در فرآیندهای خرید بیشتری بهعنوان الزامات سختگیرانه نوشته خواهند شد. زمانبندی توان محاسباتی SiCore TokenWorks در شرق و غرب کشور، در اصل پاسخی به همین روند است.
خلاصه در یک جمله: جابجایی منطق انتخاب، در اصل تغییر از «انتخاب باهوشترین مدل» به «انتخاب مناسبترین ترکیب» است. برای درک عمیقتر جزئیات پیادهسازی مسیریابی چندمدلی و تجمیع API، میتوانید در همین جهتها — دروازه مدل، API مدلهای بزرگ و پرداخت بهازای مصرف — بیشتر جستجو کنید.