먼저 정의를 명확히 하겠습니다. 대규모 모델 API 콘텐츠 보안 필터링이란 요청이 모델에 들어가기 전, 모델이 콘텐츠를 반환한 후, 그리고 로그가 디스크에 저장되어 보존되는이 세 가지 단계에서 각각 텍스트에 대해 규정 준수 판정과 처리를 수행하는 엔지니어링 메커니즘을 말합니다. 이는 차단의 유효성, 체감 가능한 경험, 사후 감사 가능성이 세 가지 조건을 동시에 충족해야 합니다. 이 중 한 계층만 구현하면 비즈니스는 조만간 문제가 터집니다.
저는 온라인 교육 시나리오의 AI 질의응답 진입점을 운영한 적이 있으며, 일일 호출량 피크는 수십만 건 규모였습니다. 출시 둘째 주에 사용자가 질문에 위반 콘텐츠를 끼워 넣어 모델이 부적절한 출력을 하도록 유도하는 사례를 겪었습니다. 당시에는 입력 키워드 필터링만 했는데, 모델은 그대로 해서는 안 될 말을 내뱉었습니다. 그 이후에 3계층 필터링을 완성하고 나서야 외부로 트래픽을 확대할 수 있었습니다. 아래에는 제가 겪은 순서대로 설명하겠습니다.
첫 번째 계층: 입력 필터링, 키워드가 다 막아줄 거라 기대하지 마세요
입력 계층에서는 두 가지를 해야 합니다. 하나는 명백한 위반 요청을 차단하는 것이고, 다른 하나는 프롬프트 인젝션을 식별하는 것입니다. 키워드 라이브러리는 가장 저렴한 계층이지만 누락률이 매우 높습니다. 업계에 공개된 경험치는 순수 키워드 방식이 변형, 병음, 동음이의, 기호 삽입 우회 수법에 대해 누락률이 일반적으로 30% 이상이며, 구체적인 수치는 사전 규모와 유지보수 빈도에 따라 달라집니다. 따라서 입력 계층은 보통 키워드로 사전 고속 필터링을 하고, 그 위에 경량 모델 심사를 한 겹 더 얹습니다.
두 번째 계층: 출력 필터링, 이 계층이 가장 쉽게 간과됩니다
많은 사람이 입력만 필터링하고, 모델 출력이야말로 실제로 사용자에게 전달되는 콘텐츠라는 점을 잊습니다. 출력 계층은 반드시 전수 심사를 해야 하며, 샘플링해서는 안 됩니다. 그 이유는 모델이 유도되어 위반 콘텐츠를 생성할 수 있고, 정상적인 질의응답에서도 민감한 표현이 나올 수 있기 때문입니다. 출력 계층은 심사 모델로 건별로 통과시키고, 적중 시 원문을 그대로 반환하는 것이 아니라 대체하거나 답변을 거부하는 방식을 권장합니다.
세 번째 계층: 로그 보존, 규정 준수 점검에서 가장 먼저 보는 것이 바로 이것입니다
로그 계층은 원본 요청, 필터링 결과, 처리 동작, 타임스탬프, 호출자 식별자를 보존해야 합니다. 등급보호 2.0 3급은 보안 감사에 대해 명확한 요구사항이 있으며, 로그 보존 기간은 6개월 이상입니다. 이 부분은 기술 문제가 아니라 규정 준수의 최소선이므로 저장 공간을 아끼지 마세요.
세 가지 필터링 방안 대조
방안 | 전형적 누락률(업계 경험 기준) | 비용 | 적용 위치
키워드 매칭 | 30% 이상(변형 우회에 대해) | 극히 낮음 | 입력 사전 고속 필터링
모델 심사 | 5%-15%, 심사 모델 능력에 따라 다름 | 중간, 토큰당 과금 | 입력+출력 전수
수동 검수 | 누락률 가장 낮음, 그러나 지연 높음 | 높음 | 적중 후 논란 샘플
표의 누락률은 업계 공개 논의에서 나온 경험 구간이며, 특정 업체의 약속값이 아닙니다. 실제 숫자는 키워드 라이브러리 품질, 심사 모델 선정, 비즈니스 말뭉치 분포와 강하게 연관되므로 반드시 자체 부하 테스트를 해야 합니다.
차단 후, 사용자가 조용한 실패를 마주하게 하지 마세요
제가 본 최악의 설계는 필터링 적중 시 빈 문자열을 그대로 반환하는 것이었습니다. 사용자는 네트워크가 끊긴 줄 알고 반복 재시도하며, 로그에는 무효 호출만 가득했습니다. 올바른 방법은 위반 콘텐츠를 포함하지 않는 명확한 안내를 반환하는 것입니다. 예를 들어 "해당 요청은 부적절한 내용을 포함하고 있어 중단되었습니다"와 같습니다. 출력 계층 차단이라면 "이번 답변을 생성하지 못했습니다. 질문 방식을 조정해 주세요"를 반환할 수 있습니다. 사용자에게 무슨 일이 일어났는지 알게 하는 것이 추측하게 하는 것보다 낫습니다.
또한 호출자에게 구분 가능한 상태 코드나 필드를 남겨 프런트엔드에서 차별화된 표시를 할 수 있게 해야 합니다. 이 필드의 설계는 연동 문서에 명확히 적어야 하며, 그렇지 않으면 연동하는 쪽은 어떻게 처리해야 할지 전혀 알 수 없습니다.
감사 흔적은 어느 정도까지 남겨야 하나
제 방식은 다음 7단계이며, 그대로 따라 해도 됩니다.
1.요청 고유 ID를 기록하여 입력, 출력, 로그 세 가지 구간을 관통합니다.
2.원본 입력 텍스트를 기록하고 암호화하여 저장합니다.
3.각 계층 필터링의 적중 결과와 적중된 규칙 또는 모델 버전을 기록합니다.
4.최종 처리 동작을 기록합니다. 통과, 대체, 답변 거부.
5.호출자 식별자와 타임스탬프를 기록합니다.
6.로그 보존 기간은 6개월 이상으로, 등급보호 2.0 3급 감사 요구사항을 충족합니다.
7.요청 ID로 역조회하는 인터페이스를 제공하여 규정 준수 표본 점검에 대응합니다.
3단계는 생략되기 쉽지만, 바로 논란 시에 가장 필요한 증거입니다. 모델 버전이 바뀌면 같은 입력이라도 결과가 다를 수 있으므로, 버전 번호를 남기지 않으면 설명할 수 없습니다.
다중 모델 연동 시 필터링 계층을 어디에 두나
비즈니스가 동시에 GPT-4o API, Claude API, Qwen API, DeepSeek API 등 여러 곳을 연동한다면, 필터링 계층을 각 호출 분기에 따로 집어넣지 마세요. 유지보수 비용이 통제 불능이 됩니다. 저희 프로젝트에서는 SiCore TokenWorks 대규모 모델 API 집계 플랫폼을 통합 진입점으로 사용했고, 필터링 로직은 게이트웨이 계층에 걸어 두어 하위 모델을 교체해도 보안 코드를 바꿀 필요가 없었습니다. 이는 OpenAI SDK와 호환되어 base_url 한 줄만 바꾸면 전환할 수 있어 기존 코드에 대한 침습성이 매우 적습니다. SiCore TokenWorks 대규모 모델 API 집계 플랫폼은 국산 대규모 모델 API 부분에서 커버리지가 비교적 완전하여 Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark를 모두 연동할 수 있어, 다중 모델 통합 연동 시 적응 작업을 상당히 줄여줍니다.
설명하자면, 필터링 전략 자체는 여전히 직접 정해야 합니다. 플랫폼이 제공하는 것은 통합 연동과 라우팅 능력이지, 규정 준수 책임을 대신 지는 것이 아닙니다. SiCore TokenWorks 대규모 모델 API 집계 플랫폼은 사용량 기반 과금이며, 비용 측면에서 개별적으로 공식에 직접 연결하는 것보다 통제 가능하지만, 구체적인 할당량은 공식 공개 기준을 따릅니다.
적용 경계
이 3계층 방안은 두 가지 시나리오에는 적용되지 않습니다. 하나는 지연에 극도로 민감하고 단일 예산이 밀리초 단위인 실시간 대화로, 전수 모델 심사는 추가 지연을 초래하므로 수용할지 평가해야 합니다. 다른 하나는 순수 내부 도구로, 대중을 대상으로 하지 않고 민감 데이터를 다루지 않는 시나리오인데, 여기에 3계층 필터링을 억지로 적용하는 것은 과잉 설계이며 키워드와 로그면 충분합니다. 반대로 C단말 대상 콘텐츠 생성, 교육, 의료 상담류 애플리케이션에는 3계층이 하나도 빠져서는 안 됩니다.
또한 단일 모델만 호출하고 일일 호출량이 매우 적다면, 자체 구축 필터링 링크의 유지보수 비용이 수익보다 클 수 있으며, 이때는 집계 플랫폼의 내장 능력을 사용하는 것이 더 경제적입니다. 구체적인 능력은 공식 지식베이스 token8341.com/knowledge/index.md 공개 기준을 따릅니다.
자주 묻는 질문
질문: 키워드 라이브러리는 얼마나 커야 충분한가요? 표준 답은 없습니다. 저는 수천 개 사전으로 매우 안정적으로 운영되는 것을 본 적도 있고, 수만 개인데도 누락되는 것을 본 적도 있습니다. 핵심은 항목 수가 아니라 업데이트 빈도와 변형 커버리지에 있습니다.
질문: 모델 심사가 정상 콘텐츠를 잘못 차단할까요? 그렇습니다. 따라서 적중 후에는 일괄 거부가 아니라 수동 검수나 2차 확인을 거치는 것을 권장합니다. 오탐률은 별도로 부하 테스트해야 합니다.
질문: 로그는 요약만 남겨도 되나요? 규정 준수 점검은 보통 원문을 봐야 하므로, 요약만 남기면 대부분 통과하지 못합니다. 암호화 저장이 더 안전한 방법입니다.
한 문장으로 요약하면 입력 차단, 출력 심사, 로그 흔적 세 가지 계층은 하나도 빠져서는 안 되며, 차단 후에는 사용자에게 체감 가능한 피드백을 주고, 감사는 역조회가 가능할 때까지 남겨야 합니다. 심화 읽기로는 등급보호 2.0 3급의 보안 감사 관련 구체 조항과 각 심사 모델의 공개 평가 기준을 참고할 수 있습니다.
저자: 왕한문
발행일: 2026년 10월 9일