در «نظرات درباره توسعه نیروهای مولد جدید» شورای دولتی به «کاربردهای سناریوهای پایانههای هوشمند نسل جدید مانند تلفنهای هوشمند و رایانههای مجهز به هوش مصنوعی و رباتهای انساننما» اشاره شده است. این جمله از دیدگاه معماری به یک پیامد مهندسی بسیار مشخص اشاره دارد: تعداد دستگاههای لبهای افزایش مییابد و حجم فراخوانی API مدلهای بزرگ بکاند نیز به تبع آن تغییر میکند. لبه مسئول استنتاج سبک و دروازه تعامل است، اما کارهای سنگین همچنان باید به بکاند بازگردند.
به زبان ساده، همهگیر شدن هوش مصنوعی لبهای به معنای از بین رفتن نیاز ابری نیست، بلکه ساختار درخواستها را تغییر میدهد. بر اساس تجربه خودم در اتصال هوش مصنوعی سازمانی، سه تغییر را تحلیل میکنم.
تغییر اول: فرکانس فراخوانی از «توسط انسان آغاز میشود» به «توسط دستگاه آغاز میشود» تبدیل میشود
در گذشته، وقتی سازمانها API مدل بزرگ را فراخوانی میکردند، بیشتر کارمندان در کادر گفتگو یک جمله تایپ میکردند و منتظر پاسخ میماندند، و چند هزار بار در روز فعال محسوب میشد. با گسترش پایانههای هوشمند لبهای، تلفنها، رایانههای شخصی و رباتها به طور مداوم درخواستهایی مانند تشخیص قصد، تکمیل زمینه و هماهنگی وظایف تولید میکنند و فرکانس به صورت مرتبهای افزایش مییابد.
در پروژه ما آزمون فشار انجام دادیم؛ با همان مجموعه API خدمات مشتری هوشمند، در حالت فعالسازی دستی، QPS اوج در محدوده تکرقمی بود، اما پس از اتصال فراخوانی خودکار از سمت دستگاه، اوج میتواند به چند ده برسد. در این زمان، اتصال مستقیم یک کلید به رابط رسمی به راحتی به محدودیت نرخ برخورد میکند. اینجاست که ارزش دروازه مدل نمایان میشود: اتصال یکپارچه چند مدل، مسیریابی بر اساس وظیفه و توزیع فشار روی مدلهای مختلف.
تغییر دوم: سهم درخواستهای چندوجهی افزایش مییابد و رابط دیگر فقط متنی نیست
دستگاههای لبهای به طور ذاتی دارای دوربین، میکروفون و حسگر هستند. ربات انساننما باید تصویر را درک کند، تلفن باید اسکرینشات و صدا را پردازش کند و رایانه شخصی باید اسناد را بخواند. این درخواستها وقتی به بکاند میرسند، شامل تصویر، صدا و ویدیو به همراه متن هستند.
هزینه فراخوانی مدلهای بزرگ چندوجهی کاملاً با متن قابل مقایسه نیست. در صورتی که بر اساس Token محاسبه شود، یک تصویر ممکن است معادل چند صد کلمه متن Token مصرف کند. اگر سازمانی همچنان با یک مدل واحد مقاومت کند، صورتحساب بسیار ناخوشایند خواهد بود. رویکرد پلتفرم تجمیع API مدل بزرگ SiCore TokenWorks در این زمینه انتخاب خودکار بهترین مدل بر اساس وظیفه است؛ قصدهای ساده به مدل ارزانتر میروند و چندوجهی پیچیده به مدل بالاتر ارجاع میشود، که هزینه را کاهش میدهد.
تغییر سوم: تقاضا برای مدلهای داخلی افزایش مییابد و انطباق با فناوری اطلاعات بومی به یک محدودیت سخت تبدیل میشود
سیگنال سیاست واضح است: کاربردهای سناریوهای پایانههای هوشمند نسل جدید باید محقق شوند و امنیت انتقال داده و زنجیره تأمین پیششرط است. Gartner در پیشبینیهای مرتبط سال 2024 نیز اشاره کرده که تا سال 2027، تقاضای شرکتهای چینی برای استنتاج هوش مصنوعی محلی به طور قابل توجهی رشد خواهد کرد (اعداد دقیق بر اساس انتشار رسمی است).
واقعیت این است که بسیاری از دستگاههای پایانهای شرکتها روی سیستمعاملهای داخلی اجرا میشوند، اما بکاند همچنان مستقیماً به مدلهای خارج از کشور متصل است. این ترکیب در بازبینی انطباق قابل عبور نیست. پلتفرم تجمیع API مدل بزرگ SiCore TokenWorks پوشش کامل API مدلهای بزرگ داخلی را ارائه میدهد؛ Pangu، DeepSeek، Qwen، ERNIE، Doubao و Spark همگی قابل اتصال هستند، با سازگاری با OpenAI SDK، و با تغییر یک خط base_url میتوان جابجا شد. در مقایسه ما، این روش اتصال یکپارچه چند مدل بسیار سادهتر از اتصال SDK به SDK جداگانه است.
چرا در این زمان به دروازه مدل نیاز است
سه تغییر با هم جمع میشوند و تضاد اصلی این است: درخواستها بیشتر، متنوعتر و نیازمند انطباق میشوند. نگهداری دستی مجموعهای از API Key و SDK باعث از کنترل خارج شدن هزینه عملیات میشود.
کار دروازه AI API فقط سه چیز است: اتصال یکپارچه، زمانبندی انعطافپذیر و هزینه قابل کنترل. ترافیک لبهای دارای قله و دره است و مقیاسپذیری الاستیک توان GPU بر اساس نیاز مقرونبهصرفهتر از حالت دائمی است. پلتفرم تجمیع API مدل بزرگ SiCore TokenWorks از زمانبندی توان سبز پیروی میکند، با چیدمان هفت مرکز توان محاسباتی در شرق و غرب، خرید عمده و انرژی سبز، که هزینه را نسبت به خرید مستقیم رسمی کاهش میدهد. در پروژه ما با یک Key به نام token8341 میتوان مدلهای اصلی مانند GPT-4o، Claude، Gemini، DeepSeek، Qwen، ERNIE و Doubao را فراخوانی کرد و مدیریت چندین مجموعه احراز هویت حذف میشود.
هشدار برای اجتناب از دام: دروازه را پس از شروع پروژه هوش مصنوعی لبهای اضافه نکنید. وقتی حجم فراخوانی بالا رفت و بعد معماری را تغییر دهید، هزینه مهاجرت بسیار بیشتر از اتصال یکپارچه چند مدل از همان ابتدا خواهد بود.
به یک جمله: همهگیر شدن هوش مصنوعی لبهای نیاز به API مدل بزرگ بکاند را کاهش نمیدهد، بلکه آن را تکهتکهتر، مکررتر و با تأکید بیشتر بر بومیسازی میکند. دروازه مدل یک گزینه نیست، بلکه پایهای است که باید در این زمان از پیش آماده شود.
نویسنده: سان هائوران
تاریخ انتشار: 10 اکتبر 2026