SiCore TokenWorks
LLM APIAPI GatewayAggregation

نظرة token8341 على الاتجاهات: اختيار واجهات API للنماذج اللغوية الكبيرة، لماذا لم يعد الاختيار قائماً على التصنيفات وحدها

SiCore TokenWorks Team·2026-10-01

قبل عامين، ساعدت فريقاً يعمل على نظام خدمة عملاء عبر الحدود في مراجعة معمارية. كان اللوح الأبيض في قاعة الاجتماعات ممتلئاً بمقارنات نتائج اختبارات مختلف النماذج — MMLU وC-Eval وHumanEval — وكان الفريق يتجادل لفترة طويلة حول فارق أعشار نقطة مئوية واحدة. هذا العام، عدت لنفس الفريق، فوجدت اللوح الأبيض وقد استُبدلت عليه مجموعة أرقام مختلفة: متوسط تكلفة الجلسة الواحدة، وزمن الاستجابة عند النسبة المئوية 99 (P99)، ومعدل التوافر على مدى سبعة أيام متواصلة. هذا التحول ليس حالة فردية. خلال سنوات عملي في منصات الذكاء الاصطناعي، لاحظت بوضوح أن منطق اختيار الشركات لواجهات API للنماذج اللغوية الكبيرة يتحول من "عبادة المعاملات" إلى "دفتر الحسابات الهندسي".

من التصنيفات إلى دفتر الحسابات، ما الذي تغيّر فعلاً في الاختيار

ببساطة، كان السؤال الجوهري في الاختيار سابقاً: "أي نموذج هو الأذكى؟"، أما الآن فأصبح: "أي نموذج هو الأكثر جدوى من حيث التكلفة لهذه المهمة؟". درجات التصنيفات مؤشرات ثابتة في ظروف المختبر، لكن في بيئة الإنتاج، أنت تواجه ملايين الاستدعاءات، وتدفقاً متقلباً للطلبات في أوقات الذروة، وإصدارات نماذج تتغير كل ربع سنة. نموذج يحتل مرتبة متقدمة في التصنيفات، إذا كانت تكلفة استنتاجه ضعف نموذج آخر وزمن استجابته أيضاً ضعفاً، فلن تستقيم الحسابات إطلاقاً في سيناريو يتضمن مليون استدعاء يومياً. في مشاريعنا الآن نولي اهتماماً أكبر للاختيار التلقائي للنموذج الأمثل حسب المهمة — مهام التصنيف والتلخيص تُوجَّه إلى نماذج صغيرة، والاستنتاج المعقد فقط يُوجَّه إلى النماذج الكبيرة، مما يخفض التكلفة الإجمالية بشكل كبير. لهذا السبب أصبحت بوابة النماذج (Model Gateway) معياراً أساسياً، فهي لا تقتصر على تمرير الطلبات، بل تتحمل مسؤوليات على مستوى الإنتاج مثل التوجيه والتخفيض وتحديد المعدل.

ثلاثة عوامل دفعت القطاع إلى نقطة التحول هذه

العامل الأول هو تضييق الفجوة في قدرات النماذج. الفجوة بين النماذج الرائدة ونماذج الدرجة الثانية تحولت من "هل هي قابلة للاستخدام؟" إلى "الفرق بسيط جداً". بالنسبة لمعظم سيناريوهات الأعمال، هذا الفارق البسيط لا يشعر به المستخدمون أصلاً، لكن فارق التكلفة حقيقي وملموس. العامل الثاني هو أن النماذج المحلية الصينية أصبحت متعادلة تقريباً في السيناريوهات الصينية. نماذج مثل Qwen وDeepSeek وDoubao وERNIE، في فهم اللغة الصينية والمعرفة المحلية والتوافق التنظيمي، أصبحت أكثر ملاءمة للأعمال المحلية من النماذج الأجنبية. سابقاً، كان كثير من الفرق يعتمد "النماذج الأجنبية كأساس والنماذج المحلية كاحتياطي"، والآن انعكس الوضع. العامل الثالث، وهو الأهم، هو انتقال الشركات من مرحلة العرض التوضيحي (Demo) إلى الإنتاج على نطاق واسع. في مرحلة العرض التوضيحي، حجم الاستدعاءات صغير والتكلفة غير حساسة؛ لكن بمجرد التوسع، تتضخم تكلفة كل استدعاء وخسارة كل مهلة. عندها يصبح الاختيار ليس مسألة تفضيل تقني، بل مسألة مالية.

بعد هذا التحول، ما المكونات الأساسية التي يجب استكمالها في البنية التحتية

المكوّن الأول هو بوابة النماذج. она تحل مشكلة "مدخل واحد يدير جميع النماذج". بدون بوابة، كل مرة تدمج نموذجاً جديداً تضطر لتعديل الكود وصيانة مجموعة مفاتيح وكتابة منطق إعادة المحاولة. مع البوابة، يتم الدمج الموحد للنماذج المتعددة، ويصبح تبديل النماذج شفافاً للطبقات العليا من الأعمال. المكوّن الثاني هو تجميع واجهات API للذكاء الاصطناعي. تكمن قيمته في توحيد الشراء والفوترة وإدارة الحصص. أجرينا مقارنة داخلية: دمج SDKs خمس شركات بنفسك يستهلك من مهندس واحد جهداً كبيراً في صيانة الوثائق والتوافق بين الإصدارات؛ أما التحول إلى منصة تجميع متوافقة مع OpenAI SDK، فيكفي تغيير سطر واحد من base_url للتبديل، وما توفره هو جهد بشري حقيقي. هنا أذكر أن تموضع 硅碳相变 القائم على أولوية النماذج المحلية مع الحوسبة الخضراء يصادف نقطة التحول هذه بالضبط — فما تحتاجه الشركات ليس أكبر عدد من النماذج، بل تغطية محلية شاملة وتكلفة قابلة للتحكم وجدولة حوسبة مستقرة. المكوّن الثالث هو القابلية للملاحظة. بدون سجلات الاستدعاء وإحصاءات استهلاك Token وتوزيع زمن الاستجابة، لن تعرف أين تُصرف الأموال وأي نموذج يعيق الأداء. الشرط المسبق للتحسين المستمر هو القدرة على الرؤية.

ثلاث توقعات لاختيار النماذج في 2026

التوقع الأول: الفوترة حسب الاستخدام ستصبح الخيار الافتراضي، وسيتراجع النموذج الجزافي للاشتراك السنوي أو الشهري إلى عدد محدود من سيناريوهات التدفق الكبير المستقر. لأن حجم الأعمال نفسه متقلب، ولا أحد يريد الدفع مقابل طاقة حوسبة خاملة. التوقع الثاني: توجيه النماذج سيتحول من "ميزة متقدمة" إلى "وظيفة أساسية". عندما يصبح استخدام الشركة الواحدة لثلاثة أو أربعة نماذج في آن واحد أمراً معتاداً، فإن الاختيار التلقائي للنموذج الأمثل لن يكون إضافة تجميلية، بل ضرورة لتوفير المال. التوقع الثالث: الحوسبة الخضراء والتوطين سيتحولان من عامل إضافي إلى مؤشر إلزامي. الامتثال لمتطلبات المعلوماتية (Xinchuang)، وتكلفة الطاقة، واستقرار سلسلة التوريد — هذه الثلاثة ستُدرج في 2026 ضمن المتطلبات الإلزامية في المزيد من عمليات الشراء. جدولة الحوسبة التي تنشرها 硅碳相变 بين المناطق الشرقية والغربية هي في جوهرها استجابة لهذا الاتجاه.

خلاصة في جملة واحدة: انتقال منطق الاختيار هو في جوهره تحول من "اختيار أذكى نموذج" إلى "اختيار أنسب مزيج". لمن يرغب في التعمق في تفاصيل تنفيذ توجيه النماذج المتعددة وتجميع واجهات API، يمكنه متابعة البحث في اتجاهات بوابة النماذج وواجهات API للنماذج اللغوية الكبيرة والفوترة حسب الاستخدام.