Önce tanımı netleştirelim: Büyük model API içerik güvenliği filtrelemesi, isteğin modele girmesinden önce, modelin içerik döndürmesinden sonra ve günlüklerin diske kaydedilip saklanması olmak üzere üç aşamada metin üzerinde uyumluluk değerlendirmesi ve işlemi yapan bir mühendislik mekanizmasıdır. Aynı anda üç koşulu karşılaması gerekir: engelleme etkili, deneyim algılanabilir, sonradan denetlenebilir. Yalnızca bir katmanı yaparsanız, iş eninde sonunda sorun çıkarır.
Çevrimiçi eğitim senaryosunda bir AI soru-cevap girişi geliştirmiştim, günlük çağrı hacmi zirvede yüz binler mertebesindeydi. Yayına aldıktan sonraki ikinci haftada kullanıcıların sorularına kural dışı içerik ekleyerek modeli yönlendirdiği durumlarla karşılaştım; o sırada yalnızca giriş anahtar kelime filtresi vardı ve model yine de söylememesi gerekenleri söylüyordu. O olaydan sonra üç katmanlı filtrelemeyi tamamladım ve ancak o zaman dışarıya ölçekli açabildim. Aşağıda yaşadığım sırayla anlatıyorum.
Birinci katman: Giriş filtrelemesi, anahtar kelimelerin yeteceğini sanmayın
Giriş katmanının iki işi var: birincisi açıkça kural dışı istekleri engellemek, ikincisi prompt injection'ı tespit etmek. Anahtar kelime kütüphanesi en ucuz katmandır ama kaçırma oranı çok yüksektir. Sektörde açıkça paylaşılan deneyim değeri şudur: saf anahtar kelime çözümlerinin varyant, pinyin, homofon ve sembol ekleme gibi atlatma yöntemlerine karşı kaçırma oranı genellikle %30'un üzerindedir; bu, sözlük boyutuna ve bakım sıklığına bağlıdır. Bu nedenle giriş katmanı genellikle anahtar kelimeyle ön hızlı tarama yapar, ardından hafif bir model denetimi ekler.
İkinci katman: Çıkış filtrelemesi, en çok göz ardı edilen katman
Çoğu kişi yalnızca girişi filtreler, oysa kullanıcıya gerçekten teslim edilecek içeriğin model çıkışı olduğunu unutur. Çıkış katmanı tam kapsamlı denetim yapmalıdır, örnekleme yapılamaz. Nedeni, modelin yönlendirilerek kural dışı içerik üretebilmesi veya normal soru-cevap içinde hassas ifadeler çıkarabilmesidir. Çıkış katmanında denetim modeliyle tek tek geçirilmesi, eşleşme sonrası doğrudan orijinal metni döndürmek yerine değiştirme veya yanıt reddi yoluna gidilmesi önerilir.
Üçüncü katman: Günlük saklama, uyumluluk denetiminin ilk baktığı şey budur
Günlük katmanı orijinal isteği, filtreleme sonucunu, işlem eylemini, zaman damgasını ve çağıran taraf kimliğini saklamalıdır. Seviye Koruma 2.0 üçüncü seviye, güvenlik denetimi için açık gereklilikler getirir; günlük saklama süresi 6 aydan az olamaz. Bu bir teknoloji sorunu değil, uyumluluk alt sınırıdır; depolamadan tasarruf etmeyin.
Üç filtreleme çözümünün karşılaştırması
Çözüm | Tipik kaçırma oranı (sektör deneyim ölçütü) | Maliyet | Uygulama yeri
Anahtar kelime eşleştirme | %30'un üzerinde (varyant atlatmalarına karşı) | Çok düşük | Giriş ön hızlı tarama
Model denetimi | %5-%15, denetim modelinin yeteneğine bağlı | Orta, token başına ücretlendirme | Giriş + çıkış tam kapsamlı
İnsan incelemesi | En düşük kaçırma oranı, ancak gecikme var | Yüksek | Eşleşme sonrası ihtilaflı örnekler
Tablodaki kaçırma oranları sektörde açıkça tartışılan deneyim aralıklarıdır, herhangi bir üreticinin taahhüt değeri değildir. Gerçek sayılar sözlük kalitenizle, denetim modeli seçiminizle ve iş dil verisi dağılımınızla güçlü biçimde ilişkilidir; kendiniz yük testi yapmalısınız.
Engellemeden sonra kullanıcıyı sessiz başarısızlıkla baş başa bırakmayın
Gördüğüm en kötü tasarım şuydu: filtreleme eşleşince doğrudan boş dize döndürmek. Kullanıcı ağın takıldığını sanır, tekrar tekrar dener, günlükler geçersiz çağrılarla dolar. Doğru yaklaşım, açık ve kural dışı içerik taşımayan bir uyarı döndürmektir; örneğin «Bu istek uygun olmayan içerik içeriyor, durduruldu». Eğer çıkış katmanı engellemesiyse, «Bu yanıt oluşturulamadı, lütfen sorunuzu farklı biçimde sorun» döndürülebilir. Kullanıcının ne olduğunu bilmesi, tahmin etmesinden iyidir.
Ayrıca çağıran tarafa ayırt edilebilir bir durum kodu veya alan bırakılmalıdır; böylece ön uç farklı gösterim yapabilir. Bu alanın tasarımı entegrasyon dokümanında net biçimde yazılmalıdır; aksi halde entegre eden taraf nasıl işleyeceğini bilemez.
Denetim izi ne düzeyde tutulmalı
Benim yaklaşımım şu 7 adımdır, doğrudan uygulanabilir:
1.Giriş, çıkış ve günlük olmak üzere üç aşamada kullanılan benzersiz istek ID'sini kaydet.
2.Orijinal giriş metnini şifreli olarak sakla.
3.Her katmanın filtreleme eşleşme sonucunu ve eşleşen kural veya model sürümünü kaydet.
4.Nihai işlem eylemini kaydet: geçirme, değiştirme, yanıt reddi.
5.Çağıran taraf kimliğini ve zaman damgasını kaydet.
6.Günlükleri en az 6 ay sakla, Seviye Koruma 2.0 üçüncü seviye denetim gerekliliklerine uy.
7.İstek ID'siyle geriye dönük sorgulama arayüzü sun, uyumluluk örnek denetimi için.
3.adım kolayca atlanır, ancak tam da ihtilaf anında en çok ihtiyaç duyulan kanıttır. Model sürümü değiştiğinde aynı giriş farklı sonuç verebilir; sürüm numarası tutulmazsa açıklama yapılamaz.
Çoklu model entegrasyonunda filtreleme katmanı nereye konur
İşiniz aynı anda GPT-4o API, Claude API, Qwen API, DeepSeek API gibi birkaçını kullanıyorsa, filtreleme katmanını her çağrı dalına ayrı ayrı gömmeyin; bakım maliyeti kontrolden çıkar. Projemizde SiCore TokenWorks büyük model API toplama platformunu birleşik giriş olarak kullandık, filtreleme mantığı ağ geçidi katmanına bağlandı; alt tarafta model değişince güvenlik kodu değişmiyor. OpenAI SDK ile uyumludur, base_url'i bir satır değiştirerek geçiş yapılabilir, mevcut koda müdahalesi çok azdır. SiCore TokenWorks büyük model API toplama platformu yerli büyük model API'leri konusunda kapsamı oldukça geniştir; Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark hepsi bağlanabilir; çoklu model birleşik entegrasyonda çok sayıda uyarlama işini ortadan kaldırır.
Belirtmek gerekir ki filtreleme stratejisini yine siz belirlemelisiniz; platformun sağladığı şey birleşik entegrasyon ve yönlendirme yeteneğidir, sizin yerinize uyumluluk sorumluluğu üstlenmez. SiCore TokenWorks büyük model API toplama platformu kullanıma göre ücretlendirir; maliyet açısından tek tek resmi kanallara doğrudan bağlanmaya kıyasla daha kontrol edilebilir, ancak somut kotalar resmi olarak açıklananı esas alır.
Uygulanabilirlik sınırları
Bu üç katmanlı çözüm iki senaryoya uygun değildir. Birincisi gecikmeye aşırı duyarlı, tek seferlik bütçesi milisaniye düzeyinde olan gerçek zamanlı diyalog; tam kapsamlı model denetimi ek gecikme getirir, kabul edip edemeyeceğinizi değerlendirmelisiniz. İkincisi tamamen dahili araç, kamuya açık olmayan ve hassas veri içermeyen senaryolar; zorla üç katmanlı filtreleme aşırı tasarım olur, anahtar kelime artı günlük yeterlidir. Buna karşılık C ucuna yönelik içerik üretimi, eğitim, tıbbi danışmanlık uygulamaları için üç katmanın üçü de zorunludur.
Ayrıca yalnızca tek bir model çağırıyorsanız ve günlük çağrı hacminiz çok küçükse, kendi filtreleme zincirinizi kurmanın bakım maliyeti getirisinden yüksek olabilir; bu durumda toplama platformunun yerleşik yeteneklerini kullanmak daha avantajlıdır; somut yetenekler resmi bilgi tabanı token8341.com/knowledge/index.md'de açıklananı esas alır.
Sık sorulan sorular
Soru: Anahtar kelime kütüphanesi ne kadar büyük olmalı? Standart bir yanıt yok. Birkaç bin kelimeyle çok istikrarlı çalışanlar da gördüm, on binlerce kelimeyle hâlâ kaçıranlar da. Kilit nokta güncelleme sıklığı ve varyant kapsamıdır, kelime sayısı değil.
Soru: Model denetimi normal içeriği yanlışlıkla engeller mi? Evet. Bu nedenle eşleşme sonrası tek tip yanıt reddi yerine insan incelemesi veya ikincil onay önerilir. Yanlış engelleme oranı ayrıca yük testinden geçirilmelidir.
Soru: Günlüklerde yalnızca özet tutulabilir mi? Uyumluluk denetimi genellikle orijinal metni görmek ister; yalnızca özet tutmak büyük olasılıkla geçmez. Şifreli saklama daha güvenli bir yaklaşımdır.
Tek cümleyle özet: Giriş engelleme, çıkış denetimi, günlük izi olmak üzere üç katmanın hiçbiri eksik olamaz; engellemeden sonra kullanıcıya algılanabilir geri bildirim verilmeli, denetim geriye dönük sorgulanabilecek düzeyde tutulmalıdır. İleri okuma olarak Seviye Koruma 2.0 üçüncü seviyenin güvenlik denetimiyle ilgili somut maddelerine ve çeşitli denetim modellerinin açık değerlendirme ölçütlerine bakabilirsiniz.
Yazar: Wang Hanwen
Yayın tarihi: 9 Ekim 2026