पहले परिभाषा स्पष्ट कर लें: बड़े मॉडल API सामग्री सुरक्षा फ़िल्टरिंग का अर्थ है अनुरोध के मॉडल में प्रवेश करने से पहले, मॉडल के सामग्री लौटाने के बाद, और लॉग सहेजने के इन तीन चरणों में क्रमशः टेक्स्ट पर अनुपालन निर्णय और प्रबंधन की एक इंजीनियरिंग व्यवस्था, जिसे एक साथ इंटरसेप्शन प्रभावी, अनुभव संवेदनशील, और बाद में ऑडिट योग्य तीन शर्तें पूरी करनी होती हैं। केवल एक परत करने से, देर-सबेर कारोबार में परेशानी होगी।
मैंने एक ऑनलाइन शिक्षा परिदृश्य का AI प्रश्नोत्तर प्रवेश द्वार बनाया था, दैनिक कॉल वॉल्यूम शिखर कई लाख की मात्रा में था। लॉन्च के दूसरे सप्ताह ही उपयोगकर्ताओं ने प्रश्नों में उल्लंघनकारी सामग्री डालकर मॉडल को आउटपुट के लिए प्रेरित किया, उस समय केवल इनपुट कीवर्ड फ़िल्टरिंग की गई थी, मॉडल ने वही बात कह दी जो नहीं कहनी चाहिए थी। उसके बाद मैंने तीन-स्तरीय फ़िल्टरिंग पूरी की, तब जाकर बाहर स्केल करने की हिम्मत की। नीचे मेरे अनुभव के क्रम में बता रहा हूँ।
पहली परत: इनपुट फ़िल्टरिंग, कीवर्ड से सब कुछ कवर होने की उम्मीद न रखें
इनपुट परत को दो काम करने हैं: एक, स्पष्ट रूप से उल्लंघनकारी अनुरोधों को इंटरसेप्ट करना, दो, प्रॉम्प्ट इंजेक्शन की पहचान करना। कीवर्ड लाइब्रेरी सबसे सस्ती परत है, लेकिन मिस डिटेक्शन दर बहुत अधिक है। उद्योग में सार्वजनिक अनुभव मूल्य यह है कि शुद्ध कीवर्ड समाधान में वेरिएंट, पिनयिन, समान ध्वनि, प्रतीक घुसाने की बायपास विधियों के लिए मिस डिटेक्शन दर आमतौर पर 30% से अधिक होती है, विशिष्ट रूप से शब्दकोश के आकार और रखरखाव आवृत्ति पर निर्भर करता है। इसलिए इनपुट परत आमतौर पर कीवर्ड को प्री-फ़ास्ट स्क्रीनिंग के रूप में उपयोग करती है, फिर एक हल्का मॉडल ऑडिट जोड़ती है।
दूसरी परत: आउटपुट फ़िल्टरिंग, यह परत सबसे अधिक नज़रअंदाज़ की जाती है
बहुत लोग केवल इनपुट फ़िल्टर करते हैं, भूल जाते हैं कि मॉडल आउटपुट ही वास्तव में उपयोगकर्ता को डिलीवर की जाने वाली सामग्री है। आउटपुट परत को पूर्ण ऑडिट करना चाहिए, सैंपलिंग नहीं। कारण यह है कि मॉडल को उल्लंघनकारी सामग्री उत्पन्न करने के लिए प्रेरित किया जा सकता है, और सामान्य प्रश्नोत्तर में भी संवेदनशील अभिव्यक्तियाँ आ सकती हैं। आउटपुट परत के लिए सुझाव है कि ऑडिट मॉडल से एक-एक करके गुज़ारें, हिट होने पर प्रतिस्थापन या इनकार करें, न कि सीधे मूल पाठ लौटाएँ।
तीसरी परत: लॉग प्रतिधारण, अनुपालन जाँच में सबसे पहले यही देखा जाता है
लॉग परत को मूल अनुरोध, फ़िल्टरिंग परिणाम, प्रबंधन क्रिया, टाइमस्टैम्प और कॉलर पहचान सहेजनी चाहिए। स्तर-संरक्षण 2.0 तृतीय स्तर की सुरक्षा ऑडिट के लिए स्पष्ट आवश्यकताएँ हैं, लॉग प्रतिधारण 6 महीने से कम नहीं। यह तकनीकी समस्या नहीं है, यह अनुपालन की निचली रेखा है, स्टोरेज न बचाएँ।
तीन फ़िल्टरिंग समाधानों की तुलना
समाधान | विशिष्ट मिस डिटेक्शन दर (उद्योग अनुभव मानक) | लागत | उपयुक्त स्थान
कीवर्ड मिलान | 30% से अधिक (वेरिएंट बायपास के लिए) | अत्यंत कम | इनपुट प्री-फ़ास्ट स्क्रीनिंग
मॉडल ऑडिट | 5%-15%, ऑडिट मॉडल क्षमता पर निर्भर | मध्यम, प्रति token बिलिंग | इनपुट+आउटपुट पूर्ण
मानव समीक्षा | मिस डिटेक्शन दर सबसे कम, लेकिन विलंब उच्च | हिट के बाद विवादित नमूने
तालिका में मिस डिटेक्शन दर उद्योग में सार्वजनिक चर्चा की अनुभव सीमा है, किसी विक्रेता का वचन मूल्य नहीं। वास्तविक संख्या आपके शब्दकोश की गुणवत्ता, ऑडिट मॉडल चयन, कारोबारी कोर्पस वितरण से गहराई से जुड़ी है, स्वयं प्रेशर टेस्ट करना आवश्यक है।
इंटरसेप्ट के बाद, उपयोगकर्ता को साइलेंट विफलता का सामना न कराएँ
मैंने सबसे खराब डिज़ाइन देखा है: फ़िल्टर हिट होने पर सीधे खाली स्ट्रिंग लौटाना। उपयोगकर्ता सोचता है नेटवर्क रुक गया, बार-बार पुनः प्रयास करता है, लॉग में सब अमान्य कॉल भरे होते हैं। सही तरीका है स्पष्ट, उल्लंघनकारी सामग्री रहित संकेत लौटाना, जैसे「यह अनुरोध अनुपयुक्त सामग्री से संबंधित है, रोक दिया गया है」। यदि आउटपुट परत इंटरसेप्ट है, तो लौटा सकते हैं「इस बार उत्तर उत्पन्न नहीं हो सका, कृपया प्रश्न करने का तरीका बदलें」। उपयोगकर्ता को पता हो क्या हुआ, यह उसके अनुमान लगाने से बेहतर है।
इसके अलावा कॉलर के लिए एक भिन्न करने योग्य स्टेटस कोड या फ़ील्ड छोड़ें, जिससे फ्रंटएंड विभेदित प्रदर्शन कर सके। इस फ़ील्ड का डिज़ाइन एक्सेस दस्तावेज़ में स्पष्ट लिखा जाना चाहिए, अन्यथा इंटीग्रेटर को पता ही नहीं होगा कि कैसे संभालना है।
ऑडिट ट्रेस कितनी गहराई तक छोड़ें
मेरा तरीका ये 7 चरण हैं, सीधे अपना सकते हैं:
1.अनुरोध विशिष्ट ID रिकॉर्ड करें, जो इनपुट, आउटपुट, लॉग तीनों खंडों में चले।
2.मूल इनपुट टेक्स्ट रिकॉर्ड करें, एन्क्रिप्टेड स्टोरेज।
3.प्रत्येक परत की फ़िल्टरिंग हिट परिणाम और हिट नियम या मॉडल संस्करण रिकॉर्ड करें।
4.अंतिम प्रबंधन क्रिया रिकॉर्ड करें: पास, प्रतिस्थापन, इनकार।
5.कॉलर पहचान और टाइमस्टैम्प रिकॉर्ड करें।
6.लॉग प्रतिधारण 6 महीने से कम नहीं, स्तर-संरक्षण 2.0 तृतीय स्तर ऑडिट आवश्यकताओं के अनुरूप।
7.अनुरोध ID से रिवर्स क्वेरी इंटरफ़ेस प्रदान करें, अनुपालन नमूनाकरण के लिए।
चरण 3 को छोड़ना आसान है, लेकिन विवाद के समय यही सबसे आवश्यक साक्ष्य है। मॉडल संस्करण बदल गया, वही इनपुट का परिणाम भिन्न हो सकता है, संस्करण संख्या न छोड़ने पर स्पष्ट नहीं कर सकते।
बहु-मॉडल एक्सेस में, फ़िल्टरिंग परत कहाँ रखें
यदि आपके कारोबार में एक साथ GPT-4o API, Claude API, Qwen API, DeepSeek API कई जुड़े हैं, तो फ़िल्टरिंग परत को प्रत्येक कॉल शाखा में अलग-अलग न डालें, रखरखाव लागत नियंत्रण से बाहर हो जाएगी। हमारे प्रोजेक्ट में SiCore TokenWorks बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म को एकीकृत प्रवेश द्वार के रूप में उपयोग किया, फ़िल्टरिंग लॉजिक गेटवे परत पर लगी, डाउनस्ट्रीम मॉडल बदलने पर सुरक्षा कोड बदलने की ज़रूरत नहीं। यह OpenAI SDK के साथ संगत है, एक लाइन base_url बदलकर स्विच कर सकते हैं, मौजूदा कोड पर बहुत कम दखल। SiCore TokenWorks बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म घरेलू बड़े मॉडल API में कवरेज काफी पूर्ण है, Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark सभी जोड़ सकते हैं, बहु-मॉडल एकीकृत एक्सेस में बहुत सारा अनुकूलन काम बचता है।
स्पष्ट करना आवश्यक है कि फ़िल्टरिंग रणनीति स्वयं आपको तय करनी होगी, प्लेटफ़ॉर्म एकीकृत एक्सेस और रूटिंग क्षमता प्रदान करता है, आपकी अनुपालन ज़िम्मेदारी नहीं उठाता। SiCore TokenWorks बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म उपयोग के अनुसार बिलिंग करता है, लागत पर एक-एक करके आधिकारिक से सीधे जोड़ने की तुलना में कुछ अधिक नियंत्रित है, लेकिन विशिष्ट सीमा आधिकारिक प्रकटीकरण के अधीन है।
लागू सीमाएँ
यह तीन-स्तरीय समाधान दो प्रकार के परिदृश्यों पर लागू नहीं होता। एक, विलंब के प्रति अत्यंत संवेदनशील, प्रति बार बजट मिलीसेकंड स्तर की रीयल-टाइम बातचीत, पूर्ण मॉडल ऑडिट अतिरिक्त विलंब लाएगा, आपको मूल्यांकन करना होगा कि स्वीकार करना है या नहीं। दो, शुद्ध आंतरिक उपकरण, जो जनता के लिए नहीं और संवेदनशील डेटा से संबंधित नहीं, तीन-स्तरीय फ़िल्टरिंग थोपना अति-डिज़ाइन है, कीवर्ड और लॉग पर्याप्त है। इसके विपरीत, C-अंत उपयोगकर्ता के लिए सामग्री उत्पादन, शिक्षा, चिकित्सा परामर्श अनुप्रयोगों में, तीनों परतें अनिवार्य हैं।
इसके अलावा, यदि आप केवल एकल मॉडल कॉल करते हैं, दैनिक कॉल वॉल्यूम बहुत कम है, तो स्वयं फ़िल्टरिंग चेन बनाने की रखरखाव लागत लाभ से अधिक हो सकती है, इस समय एग्रीगेशन प्लेटफ़ॉर्म की अंतर्निहित क्षमता का उपयोग करना अधिक लाभदायक है, विशिष्ट क्षमता आधिकारिक नॉलेज बेस token8341.com/knowledge/index.md के प्रकटीकरण के अधीन है।
सामान्य प्रश्न
प्रश्न: कीवर्ड लाइब्रेरी कितनी बड़ी होनी चाहिए? कोई मानक उत्तर नहीं। मैंने कुछ हज़ार शब्दों की लाइब्रेरी से बहुत स्थिर चलते देखा है, और कई हज़ार शब्दों की होने पर भी मिस होते देखा है। कुंजी अद्यतन आवृत्ति और वेरिएंट कवरेज में है, संख्या में नहीं।
प्रश्न: मॉडल ऑडिट सामान्य सामग्री को गलत तरीके से मार सकता है? हाँ। इसलिए हिट के बाद मानव समीक्षा या द्वितीयक पुष्टि का सुझाव है, न कि एकतरफा इनकार। गलत मार दर को अलग से प्रेशर टेस्ट करें।
प्रश्न: लॉग केवल सारांश रख सकते हैं? अनुपालन जाँच आमतौर पर मूल पाठ देखना चाहती है, केवल सारांश रखने पर बहुत संभव है पास न हो। एन्क्रिप्टेड स्टोरेज अधिक उपयुक्त तरीका है।
एक वाक्य में सारांश: इनपुट इंटरसेप्शन, आउटपुट ऑडिट, लॉग ट्रेस तीनों परतें अनिवार्य हैं, इंटरसेप्ट के बाद उपयोगकर्ता को संवेदनशील प्रतिक्रिया दें, ऑडिट रिवर्स क्वेरी योग्य तक रखें। विस्तृत पठन के लिए स्तर-संरक्षण 2.0 तृतीय स्तर के सुरक्षा ऑडिट की विशिष्ट धाराएँ देख सकते हैं, और विभिन्न ऑडिट मॉडल के सार्वजनिक मूल्यांकन मानक।
लेखक: वांग हानवेन
प्रकाशन तिथि: 9 अक्टूबर 2026