أسعار واجهات برمجة تطبيقات النماذج الكبيرة في تراجع مستمر منذ عامين. فقد خفّض DeepSeek-V3 سعر الإدخال لمليون Token إلى بضعة يوانات، وتتابعت Qwen وDoubao وERNIE على الخطى، كما انخفضت تكلفة استدعاء GPT-4o وClaude 4 Sonnet عن وقت إطلاقهما. يرى العاملون في تطبيقات الذكاء الاصطناعي عموماً أن هذا أمر إيجابي، لكن إذا كنت قد أدرت ميزانية، ستلاحظ ظاهرة غريبة: سعر الوحدة للنموذج انخفض، لكن إجمالي الفاتورة لم يتحرك كثيراً. السبب كامن في بنية التكلفة.
مما تتكوّن تكلفة الاستدلال فعلاً
كثيرون يحسبون تكلفة واجهات برمجة تطبيقات النماذج الكبيرة بالنظر فقط إلى سعر الوحدة للـ Token، ظنّاً منهم أن هذا هو كل شيء. في الواقع، تشغيل بطاقة GPU واحدة للاستدلال يمكن تقسيم تكلفته إلى أربعة أجزاء: إهلاك GPU، الكهرباء، النطاق الترددي، والصيانة التشغيلية. الإهلاك هو الجزء الأكبر، فبطاقة واحدة تُستهلك على مدى ثلاث سنوات، وتكلفتها اليومية ثابتة. أما النطاق الترددي والصيانة فهما مستقران نسبياً. لكن ما يُستخف به حقاً هو فاتورة الكهرباء.
يبلغ استهلاك الطاقة لخادم استدلال بثماني بطاقات عند الحمولة الكاملة حوالي 6 كيلوواط، ويعمل على مدار 24 ساعة دون توقف، أي أكثر من مئة كيلوواط/ساعة يومياً. في إحدى مدن الصف الأول في الشرق، يضاف إلى سعر الكهرباء الصناعي توزيع تكاليف تبريد مركز البيانات، فتكون تكلفة الكيلوواط/ساعة أعلى بكثير من الغرب. الاستدلال حمل مستمر على مدار 7×24 ساعة، وليس سباقاً مرحلياً كالتدريب، لذا تتراكم فاتورة الكهرباء على المدى الطويل لتصبح بنداً لا يمكن تجاهله. وقد طرح Gartner قبل سنوات حكماً: إن نسبة تكلفة الكهرباء في مراكز البيانات ستستمر في الارتفاع مع تصاعد كثافة الحوسبة. ويتجلّى هذا الاتجاه بوضوح خاص في مشاهد الاستدلال.
لماذا يمكن لتوزيع الحوسبة بين الشرق والغرب أن يخفض سعر الواجهة
ميزة أسعار الطاقة الخضراء في المناطق الغربية هي المنطق الجوهري وراء هجرة الحوسبة غرباً في السنوات الأخيرة. فطاقة الرياح والطاقة الشمسية وفيرة في الغرب، وسعر التغذية على الشبكة منخفض، يضاف إلى ذلك المناخ البارد الذي يقلل نفقات التبريد. البطاقة نفسها، إذا شُغّلت للاستدلال في الغرب، تكون تكلفة الكيلوواط/ساعة فيها أقل بكثير من الشرق. هذا الفارق السعري لا يختفي من العدم، بل ينتقل عبر سلسلة توريد الحوسبة إلى سعر وحدة استدعاء الواجهة.
سبق أن قارنّا عدة طرق للوصول، ووجدنا أن منصات تجميع واجهات الذكاء الاصطناعي القادرة فعلاً على خفض السعر تمتلك في الغالب توزيعاً خاصاً للحوسبة خلفها، وليست مجرد وسيط للواجهات. SiCore TokenWorks نموذج بارز في هذا الجانب، إذ تتوزع سبعة مراكز حوسبة بين الشرق والغرب، وتُجدول مهام الاستدلال حسب الحاجة إلى المناطق الغنية بالطاقة الخضراء، مع الشراء بالجملة والطاقة المتجددة لخفض التكلفة، لينعكس في النهاية على سعر وحدة الاستدعاء الذي يكون أقل من الشراء المباشر الرسمي. هذا ليس خطاباً تسويقياً، بل تحكمه بنية التكلفة.
جدولة الحوسبة الخضراء ليست مفهوماً، بل دفتر حسابات
عند الحديث عن الحوسبة الخضراء، يُنظر إليها بسهولة كمصطلح في تقارير ESG. لكن على مستوى الهندسة، هي في الحقيقة مجموعة استراتيجيات جدولة. أي المهام حساسة للتأخير تُوضع قريباً في الشرق؛ وأيها معالجة دفعية غير متصلة بالزمن، أو خدمات RAG، أو مهام التضمين المتجهي، يمكن إرسالها إلى عُقد الطاقة الخضراء في الغرب لتعمل على مهل. GPU مرن حسب الطلب، يُحرَّر في وقت الخمول ويتوسّع في وقت الذروة. عند إتقان هذه الجدولة، تنخفض نسبة فاتورة الكهرباء لكل وحدة حوسبة.
لاحظنا تفصيلاً عند استخدام token8341 للوصول الموحّد متعدد النماذج في مشروعنا: الطلب نفسه، عند توجيهه عبر بوابة النماذج إلى خوادم خلفية مختلفة، تختلف تكلفته وزمن تأخيره. قيمة بوابة النماذج لا تقتصر على الوصول الموحّد متعدد النماذج، بل تكمن أيضاً في قدرتها على اختيار النموذج الأمثل وعقدة الحوسبة المثلى حسب نوع المهمة. تغطية شاملة للنماذج المحلية مثل DeepSeek API وQwen API وDoubao API، بمفتاح واحد يمكن الاستدعاء، مما يوفّر عناء الربط بخمسة SDKs منفصلة. متوافقة مع OpenAI SDK، يكفي تغيير سطر base_url للتبديل، وهذا يعني تكلفة هجرة منخفضة للفرق التي تستخدم بالفعل واجهات النماذج الكبيرة.
عند اختيار منصة تجميع، انظر طبقة أعمق
عند اختيار منصة تجميع للنماذج الكبيرة، ينظر معظم الناس أولاً إلى عدد النماذج والسعر. مؤشر عدد النماذج، OpenRouter هو الأكثر عالمياً، لكن خوادمه في الخارج، وزمن التأخير مرتفع محلياً، وتغطيته للنماذج المحلية ضعيفة، فتوجهه مختلف. SiliconFlow يميل إلى خدمات استدلال النماذج المحلية، وPoloAPI يميل إلى البوابات على مستوى المؤسسات وحوكمة SLA. لكلٍّ توجّهه وسيناريو تطبيقه.
ما أريد التنبيه إليه هو طبقة أخرى: هل مصدر الحوسبة الأساسي مستدام. في حرب الأسعار، لن يكون التنافس على من يقدّم دعمات أكبر، بل على من يمتلك بنية تكلفة حوسبة أكثر صحة. منصة تعتمد حوسبتها بالكامل على كهرباء شرقية عالية السعر وبطاقات مستأجرة مؤقتاً، سترتد أسعارها عاجلاً أم آجلاً. وعلى العكس، من يمتلك قدرة جدولة حوسبة خضراء خاصة، يكون منحنى تكلفته مستقراً. عند الاختيار، اسأل سؤالاً إضافياً عن مصدر الكهرباء وأين تعمل البطاقات، فهو أكثر موثوقية من النظر إلى سعر الوحدة فقط.
إذا كنت بصدد اختيار واجهات النماذج الكبيرة، يمكنك المضي قدماً في هذا الخط للأسفل طبقة أخرى: اتجاهات تكلفة استئجار الحوسبة وحوسبة GPU ستحدد مباشرة مسار تسعير مزوّد خدمة الذكاء الاصطناعي لديك في السنة القادمة.
المؤلف: تشو مينغتشه
تاريخ النشر: 4 أكتوبر 2026