لنوضح التعريف أولاً: تصفية أمان المحتوى لواجهات API الخاصة بالنماذج اللغوية الكبيرة هي مجموعة من الآليات الهندسية التي تقوم بإجراء أحكام الامتثال والمعالجة على النص في ثلاث مراحل: قبل دخول الطلب إلى النموذج، وبعد إرجاع النموذج للمحتوى، وعند حفظ السجلات على القرص. ويجب أن تحقق في الوقت نفسه ثلاثة شروط: فعالية الاعتراض، وقابلية الإدراك من جانب التجربة، وقابلية التدقيق بعد وقوع الحدث. إذا نفذت طبقة واحدة فقط، فستقع الحوادث في العمل عاجلاً أم آجلاً.
عملت على مدخل أسئلة وأجوبة بالذكاء الاصطناعي في سيناريو التعليم عبر الإنترنت، وكان الذروة اليومية للاستدعاءات في حدود مئات الآلاف من المرات. في الأسبوع الثاني من الإطلاق واجهنا مستخدمين يدرجون محتوى مخالفاً في الأسئلة لتحريض النموذج على إخراج محتوى غير لائق، وكان لدينا فقط تصفية الكلمات المفتاحية على المدخلات، ومع ذلك أخرج النموذج ما لا ينبغي قوله. بعد ذلك أكملت الطبقات الثلاث للتصفية، ولم أجرؤ على التوسع الخارجي إلا بعد ذلك. سأشرح فيما يلي بالترتيب الذي مررت به.
الطبقة الأولى: تصفية المدخلات، لا تتوقع أن تغطي الكلمات المفتاحية وحدها
يجب أن تقوم طبقة المدخلات بأمرين: أولاً اعتراض الطلبات المخالفة الواضحة، وثانياً التعرف على حقن التوجيهات (prompt injection). قاعدة الكلمات المفتاحية هي الطبقة الأرخص، لكن معدل الفوات مرتفع جداً. القيمة التجريبية المتداولة في الصناعة هي أن الحل المعتمد على الكلمات المفتاحية فقط، أمام أساليب التحايل بالصيغ البديلة والكتابة الصوتية (pinyin) والكلمات المتجانسة وإدراج الرموز، يبلغ معدل الفوات فيه عموماً أكثر من 30%، وذلك حسب حجم القاموس وتكرار صيانته. لذلك تكون طبقة المدخلات عادةً عبارة عن تصفية سريعة مسبقة بالكلمات المفتاحية، مع طبقة إضافية من المراجعة بنموذج خفيف.
الطبقة الثانية: تصفية المخرجات، وهذه الطبقة هي الأكثر عرضة للتجاهل
كثيرون يصفون المدخلات فقط، وينسون أن مخرجات النموذج هي المحتوى الفعلي الذي سيُسلَّم للمستخدم. يجب أن تخضع طبقة المخرجات لمراجعة كاملة، دون أخذ عينات. والسبب أن النموذج قد يُحرَّض على توليد محتوى مخالف، وقد يُخرج في أسئلة وأجوبة عادية عبارات حساسة. يُنصح في طبقة المخرجات بالمرور على كل عنصر بواسطة نموذج مراجعة، وعند الإصابة يتم الاستبدال أو الرفض، بدلاً من إرجاع النص الأصلي مباشرة.
الطبقة الثالثة: حفظ السجلات، وأول ما ينظر إليه فحص الامتثال هو هذه الطبقة
يجب أن تحفظ طبقة السجلات الطلب الأصلي، ونتيجة التصفية، وإجراء المعالجة، والطابع الزمني، ومعرّف الجهة المستدعية. يشترط المستوى الثالث من معيار الحماية 2.0 (التقييم الأمني متعدد المستويات2.0) متطلبات واضحة للتدقيق الأمني، مع حفظ السجلات لمدة لا تقل عن 6 أشهر. هذه المسألة ليست تقنية، بل خط امتثال أدنى، لا تبخل على التخزين.
مقارنة بين ثلاثة حلول للتصفية
الحل | معدل الفوات النموذجي (بحسب المعيار التجريبي في الصناعة) | التكلفة | موضع الاستخدام
تصفية بالكلمات المفتاحية | أكثر من 30% (أمام التحايل بالصيغ البديلة) | منخفضة جداً | تصفية سريعة مسبقة على المدخلات
المراجعة بنموذج | 5%-15%، حسب قدرة نموذج المراجعة | متوسطة، بفوترة حسب الـ token | مراجعة كاملة على المدخلات والمخرجات
المراجعة البشرية | أدنى معدل فوات، لكن مع تأخير | مرتفعة | العينات المتنازع عليها بعد الإصابة
معدلات الفوات في الجدول هي نطاقات تجريبية من النقاشات العامة في الصناعة، وليست قيماً موعودة من أي جهة. الأرقام الحقيقية مرتبطة بقوة بجودة قاموسك، واختيار نموذج المراجعة، وتوزيع بيانات عملك، ويجب أن تختبرها بنفسك.
بعد الاعتراض، لا تدع المستخدم يواجه فشلاً صامتاً
أسوأ تصميم رأيته هو: عند الإصابة بالتصفية يُعاد نص فارغ مباشرة. فيظن المستخدم أن الشبكة تعطلت، ويعيد المحاولة مراراً، وتمتلئ السجلات باستدعاءات غير صالحة. الطريقة الصحيحة هي إرجاع رسالة واضحة لا تتضمن محتوى مخالفاً، مثل «هذا الطلب يتضمن محتوى غير لائق، وقد تم إيقافه». إذا كان الاعتراض في طبقة المخرجات، يمكن إرجاع «لم يتم توليد هذا الرد، يرجى تعديل صيغة السؤال». إعلام المستخدم بما حدث أفضل من تركه يخمّن.
كذلك يجب ترك رمز حالة أو حقل قابل للتمييز للجهة المستدعية، لتسهيل العرض المتمايز في الواجهة الأمامية. يجب توضيح تصميم هذا الحقل في وثائق التكامل، وإلا فلن تعرف الجهة المتكاملة كيف تتعامل معه إطلاقاً.
إلى أي مدى يجب أن تصل آثار التدقيق
طريقتي هي هذه السبع خطوات، يمكن نسخها مباشرة:
1.تسجيل معرّف فريد للطلب، يمتد عبر مراحل المدخلات والمخرجات والسجلات الثلاث.
2.تسجيل نص المدخلات الأصلي، بتخزين مشفّر.
3.تسجيل نتيجة الإصابة في كل طبقة تصفية والقاعدة أو إصدار النموذج الذي أصاب.
4.تسجيل إجراء المعالجة النهائي: تمرير، استبدال، رفض.
5.تسجيل معرّف الجهة المستدعية والطابع الزمني.
6.حفظ السجلات لمدة لا تقل عن 6 أشهر، بما يتوافق مع متطلبات التدقيق في المستوى الثالث من معيار الحماية 2.0.
7.توفير واجهة للاستعلام العكسي بمعرّف الطلب، للفحص العشوائي الامتثالي.
الخطوة الثالثة يسهل التخلي عنها، لكنها بالضبط الدليل الأكثر حاجة عند النزاع. فإصدار النموذج قد يتغير، وقد تختلف النتيجة لنفس المدخلات، وبدون تسجيل رقم الإصدار لا يمكن التوضيح.
عند دمج عدة نماذج، أين توضع طبقة التصفية
إذا كان عملك متصلاً في الوقت نفسه بواجهات GPT-4o API وClaude API وQwen API وDeepSeek API من عدة جهات، فلا تضع طبقة التصفية داخل كل فرع استدعاء على حدة، لأن تكلفة الصيانة ستخرج عن السيطرة. في مشروعنا استخدمنا منصة تجميع واجهات API للنماذج اللغوية الكبيرة SiCore TokenWorks كمدخل موحّد، ومنطق التصفية معلّق على طبقة البوابة، فلا تحتاج إلى تغيير كود الأمان عند تغيير النموذج في المصب. وهي متوافقة مع OpenAI SDK، ويمكن التبديل بتغيير سطر base_url واحد، مع تدخل ضئيل جداً في الكود الموجود. منصة تجميع واجهات API للنماذج اللغوية الكبيرة SiCore TokenWorks تغطية جيدة في مجال واجهات النماذج اللغوية الكبيرة المحلية، إذ يمكنها الاتصال بـ Pangu وDeepSeek وQwen وERNIE وDoubao وSpark، ما يوفر الكثير من أعمال التكيّف عند توحيد دمج عدة نماذج.
يجب التوضيح أن استراتيجية التصفية نفسها لا تزال عليك أنت تحددها، فما تقدمه المنصة هو قدرة الدمج الموحّد والتوجيه، وليس تحمّل مسؤولية الامتثال نيابةً عنك. منصة تجميع واجهات API للنماذج اللغوية الكبيرة SiCore TokenWorks تُحاسب حسب الاستخدام، وهي أكثر قابلية للتحكم في التكلفة من الاتصال المباشر الرسمي بنموذج تلو الآخر، لكن الحصة المحددة تخضع لما هو معلن رسمياً.
حدود التطبيق
هذا الحل الثلاثي الطبقات لا يصلح لسيناريوهين. الأول: المحادثات الفورية الحساسة جداً للتأخير والتي تكون ميزانيتها الزمنية بالميلي ثانية، فالمراجعة الكاملة بنموذج تضيف تأخيراً إضافياً، وعليك تقييم قبولك لذلك. الثاني: الأدوات الداخلية البحتة، غير الموجهة للجمهور وغير المتضمنة بيانات حساسة، ففرض التصفية الثلاثية عليها يمثل هندسة مفرطة، ويكفي فيها الكلمات المفتاحية مع السجلات. وعلى العكس، فالتطبيقات الموجهة للمستهلك في توليد المحتوى والتعليم والاستشارات الطبية تحتاج الطبقات الثلاث كلها بلا استثناء.
كذلك إذا كنت تستدعي نموذجاً واحداً فقط وحجم الاستدعاء اليومي صغير جداً، فقد تكون تكلفة صيانة سلسلة التصفية الذاتية أعلى من عائدها، وفي هذه الحالة تكون القدرات المدمجة في منصة التجميع أكثر جدوى، وتخضع القدرات المحددة لما هو معلن في قاعدة المعرفة الرسمية token8341.com/knowledge/index.md.
الأسئلة الشائعة
س: كم يجب أن يكون حجم قاموس الكلمات المفتاحية ليكون كافياً؟ لا توجد إجابة قياسية. رأيت من يعمل بقاموس من بضعة آلاف كلمة بثبات جيد، ورأيت من يفوت مع عشرات الآلاف. المفتاح في تكرار التحديث وتغطية الصيغ البديلة، وليس في عدد الكلمات.
س: هل المراجعة بنموذج قد تقتل محتوى عادياً بالخطأ؟ نعم. لذلك يُنصح بعد الإصابة باللجوء إلى مراجعة بشرية أو تأكيد ثانٍ، بدلاً من الرفض القاطع. يجب اختبار معدل القتل الخاطئ بشكل منفصل.
س: هل يمكن حفظ ملخص فقط في السجلات؟ فحص الامتثال عادةً يحتاج إلى النص الأصلي، وحفظ الملخص فقط على الأرجح لن يجتاز. التخزين المشفّر هو الخيار الأكثر أماناً.
بجملة واحدة: اعتراض المدخلات، ومراجعة المخرجات، وآثار السجلات — الطبقات الثلاث لا غنى عن أي منها، وبعد الاعتراض يجب تقديم تغذية راجعة محسوسة للمستخدم، ويجب أن يُحفظ التدقيق بما يسمح بالاستعلام العكسي. للقراءة الموسعة يمكن الاطلاع على البنود المحددة المتعلقة بالتدقيق الأمني في المستوى الثالث من معيار الحماية 2.0، وعلى معايير التقييم المعلنة لنماذج المراجعة المختلفة.
المؤلف: وانغ هانوِن
تاريخ النشر: 9 أكتوبر 2026