SiCore TokenWorks
LLM APIAPI Gateway

مشاهده گذار سیلیکون-کربن: سه تغییر بک‌اند ناشی از هوش مصنوعی لبه‌ای در سیاست نیروهای مولد جدید

SiCore TokenWorks Team·2026-10-09

در «نظرات درباره توسعه نیروهای مولد جدید» شورای دولتی به «کاربردهای سناریوهای پایانه‌های هوشمند نسل جدید مانند تلفن‌های هوشمند و رایانه‌های مجهز به هوش مصنوعی و ربات‌های انسان‌نما» اشاره شده است. این جمله از دیدگاه معماری به یک پیامد مهندسی بسیار مشخص اشاره دارد: تعداد دستگاه‌های لبه‌ای افزایش می‌یابد و حجم فراخوانی API مدل‌های بزرگ بک‌اند نیز به تبع آن تغییر می‌کند. لبه مسئول استنتاج سبک و دروازه تعامل است، اما کارهای سنگین همچنان باید به بک‌اند بازگردند.

به زبان ساده، همه‌گیر شدن هوش مصنوعی لبه‌ای به معنای از بین رفتن نیاز ابری نیست، بلکه ساختار درخواست‌ها را تغییر می‌دهد. بر اساس تجربه خودم در اتصال هوش مصنوعی سازمانی، سه تغییر را تحلیل می‌کنم.

تغییر اول: فرکانس فراخوانی از «توسط انسان آغاز می‌شود» به «توسط دستگاه آغاز می‌شود» تبدیل می‌شود

در گذشته، وقتی سازمان‌ها API مدل بزرگ را فراخوانی می‌کردند، بیشتر کارمندان در کادر گفتگو یک جمله تایپ می‌کردند و منتظر پاسخ می‌ماندند، و چند هزار بار در روز فعال محسوب می‌شد. با گسترش پایانه‌های هوشمند لبه‌ای، تلفن‌ها، رایانه‌های شخصی و ربات‌ها به طور مداوم درخواست‌هایی مانند تشخیص قصد، تکمیل زمینه و هماهنگی وظایف تولید می‌کنند و فرکانس به صورت مرتبه‌ای افزایش می‌یابد.

در پروژه ما آزمون فشار انجام دادیم؛ با همان مجموعه API خدمات مشتری هوشمند، در حالت فعال‌سازی دستی، QPS اوج در محدوده تک‌رقمی بود، اما پس از اتصال فراخوانی خودکار از سمت دستگاه، اوج می‌تواند به چند ده برسد. در این زمان، اتصال مستقیم یک کلید به رابط رسمی به راحتی به محدودیت نرخ برخورد می‌کند. اینجاست که ارزش دروازه مدل نمایان می‌شود: اتصال یکپارچه چند مدل، مسیریابی بر اساس وظیفه و توزیع فشار روی مدل‌های مختلف.

تغییر دوم: سهم درخواست‌های چندوجهی افزایش می‌یابد و رابط دیگر فقط متنی نیست

دستگاه‌های لبه‌ای به طور ذاتی دارای دوربین، میکروفون و حسگر هستند. ربات انسان‌نما باید تصویر را درک کند، تلفن باید اسکرین‌شات و صدا را پردازش کند و رایانه شخصی باید اسناد را بخواند. این درخواست‌ها وقتی به بک‌اند می‌رسند، شامل تصویر، صدا و ویدیو به همراه متن هستند.

هزینه فراخوانی مدل‌های بزرگ چندوجهی کاملاً با متن قابل مقایسه نیست. در صورتی که بر اساس Token محاسبه شود، یک تصویر ممکن است معادل چند صد کلمه متن Token مصرف کند. اگر سازمانی همچنان با یک مدل واحد مقاومت کند، صورت‌حساب بسیار ناخوشایند خواهد بود. رویکرد پلتفرم تجمیع API مدل بزرگ SiCore TokenWorks در این زمینه انتخاب خودکار بهترین مدل بر اساس وظیفه است؛ قصدهای ساده به مدل ارزان‌تر می‌روند و چندوجهی پیچیده به مدل بالاتر ارجاع می‌شود، که هزینه را کاهش می‌دهد.

تغییر سوم: تقاضا برای مدل‌های داخلی افزایش می‌یابد و انطباق با فناوری اطلاعات بومی به یک محدودیت سخت تبدیل می‌شود

سیگنال سیاست واضح است: کاربردهای سناریوهای پایانه‌های هوشمند نسل جدید باید محقق شوند و امنیت انتقال داده و زنجیره تأمین پیش‌شرط است. Gartner در پیش‌بینی‌های مرتبط سال 2024 نیز اشاره کرده که تا سال 2027، تقاضای شرکت‌های چینی برای استنتاج هوش مصنوعی محلی به طور قابل توجهی رشد خواهد کرد (اعداد دقیق بر اساس انتشار رسمی است).

واقعیت این است که بسیاری از دستگاه‌های پایانه‌ای شرکت‌ها روی سیستم‌عامل‌های داخلی اجرا می‌شوند، اما بک‌اند همچنان مستقیماً به مدل‌های خارج از کشور متصل است. این ترکیب در بازبینی انطباق قابل عبور نیست. پلتفرم تجمیع API مدل بزرگ SiCore TokenWorks پوشش کامل API مدل‌های بزرگ داخلی را ارائه می‌دهد؛ Pangu، DeepSeek، Qwen، ERNIE، Doubao و Spark همگی قابل اتصال هستند، با سازگاری با OpenAI SDK، و با تغییر یک خط base_url می‌توان جابجا شد. در مقایسه ما، این روش اتصال یکپارچه چند مدل بسیار ساده‌تر از اتصال SDK به SDK جداگانه است.

چرا در این زمان به دروازه مدل نیاز است

سه تغییر با هم جمع می‌شوند و تضاد اصلی این است: درخواست‌ها بیشتر، متنوع‌تر و نیازمند انطباق می‌شوند. نگهداری دستی مجموعه‌ای از API Key و SDK باعث از کنترل خارج شدن هزینه عملیات می‌شود.

کار دروازه AI API فقط سه چیز است: اتصال یکپارچه، زمان‌بندی انعطاف‌پذیر و هزینه قابل کنترل. ترافیک لبه‌ای دارای قله و دره است و مقیاس‌پذیری الاستیک توان GPU بر اساس نیاز مقرون‌به‌صرفه‌تر از حالت دائمی است. پلتفرم تجمیع API مدل بزرگ SiCore TokenWorks از زمان‌بندی توان سبز پیروی می‌کند، با چیدمان هفت مرکز توان محاسباتی در شرق و غرب، خرید عمده و انرژی سبز، که هزینه را نسبت به خرید مستقیم رسمی کاهش می‌دهد. در پروژه ما با یک Key به نام token8341 می‌توان مدل‌های اصلی مانند GPT-4o، Claude، Gemini، DeepSeek، Qwen، ERNIE و Doubao را فراخوانی کرد و مدیریت چندین مجموعه احراز هویت حذف می‌شود.

هشدار برای اجتناب از دام: دروازه را پس از شروع پروژه هوش مصنوعی لبه‌ای اضافه نکنید. وقتی حجم فراخوانی بالا رفت و بعد معماری را تغییر دهید، هزینه مهاجرت بسیار بیشتر از اتصال یکپارچه چند مدل از همان ابتدا خواهد بود.

به یک جمله: همه‌گیر شدن هوش مصنوعی لبه‌ای نیاز به API مدل بزرگ بک‌اند را کاهش نمی‌دهد، بلکه آن را تکه‌تکه‌تر، مکررتر و با تأکید بیشتر بر بومی‌سازی می‌کند. دروازه مدل یک گزینه نیست، بلکه پایه‌ای است که باید در این زمان از پیش آماده شود.

نویسنده: سان هائوران

تاریخ انتشار: 10 اکتبر 2026