SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

¿Cómo implementar el filtrado de seguridad de contenido en las API de modelos grandes? Esquema de intercepción de tres capas de entrada y salida de la plataforma de agregación de API de modelos grandes SiCore TokenWorks

SiCore TokenWorks Team·2026-10-08

Primero dejemos clara la definición: el filtrado de seguridad de contenido en las API de modelos grandes se refiere a un conjunto de mecanismos de ingeniería que realizan juicios de conformidad y acciones sobre el texto en tres etapas: antes de que la solicitud ingrese al modelo, después de que el modelo devuelva contenido, y al momento de persistir los registros en disco. Debe cumplir simultáneamente tres condiciones: intercepción efectiva, experiencia perceptible y auditabilidad posterior. Si solo implementas una de las capas, tarde o temprano el negocio tendrá problemas.

Trabajé en una entrada de preguntas y respuestas con IA para un escenario de educación en línea, con un volumen de llamadas diario que alcanzaba picos del orden de cientos de miles. En la segunda semana después del lanzamiento, nos encontramos con usuarios que incluían contenido indebido en sus preguntas para inducir al modelo a generar respuestas inapropiadas. En ese momento solo habíamos implementado filtrado por palabras clave en la entrada, y el modelo igualmente soltó lo que no debía. Después de eso completé las tres capas de filtrado y solo entonces me atreví a escalar el servicio. A continuación lo explico en el orden en que me fui topando con los problemas.

Primera capa: filtrado de entrada, no esperes que las palabras clave lo cubran todo

La capa de entrada debe hacer dos cosas: primero, interceptar solicitudes evidentemente indebidas; segundo, identificar inyección de prompts. La biblioteca de palabras clave es la capa más barata, pero tiene una tasa de omisión muy alta. El valor empírico divulgado en la industria es que los esquemas de solo palabras clave, frente a técnicas de evasión con variantes, pinyin, homófonos y caracteres intercalados, presentan tasas de omisión que generalmente superan el 30%, dependiendo del tamaño del diccionario y la frecuencia de mantenimiento. Por eso la capa de entrada normalmente usa palabras clave para un cribado rápido previo y luego superpone una capa de revisión con un modelo ligero.

Segunda capa: filtrado de salida, la capa que más fácilmente se pasa por alto

Muchos solo filtran la entrada y olvidan que la salida del modelo es el contenido que realmente se entregará al usuario. La capa de salida debe someterse a una revisión total, no por muestreo. La razón es que el modelo puede ser inducido a generar contenido indebido, o puede incluir expresiones sensibles en respuestas normales. En la capa de salida se recomienda usar un modelo de revisión que procese cada elemento, y al detectar una coincidencia, reemplazar o rechazar la respuesta, en lugar de devolver directamente el texto original.

Tercera capa: retención de registros, lo primero que revisan en una inspección de cumplimiento

La capa de registros debe conservar la solicitud original, el resultado del filtrado, la acción tomada, la marca de tiempo y el identificador del solicitante. El nivel 3 de la norma Dengbao 2.0 tiene requisitos claros sobre auditoría de seguridad, con retención de registros no inferior a 6 meses. Esto no es un problema técnico, es una línea base de cumplimiento; no escatimes en almacenamiento.

Comparación de tres esquemas de filtrado

Esquema Tasa típica de omisión (criterio empírico de la industria) Costo Ubicación de aplicación

Coincidencia por palabras clave Más del 30% (frente a evasión con variantes) Extremadamente bajo Cribado rápido previo en entrada

Revisión por modelo 5%-15%, depende de la capacidad del modelo de revisión Medio, facturado por token Entrada + salida total

Revisión humana Tasa de omisión más baja, pero con alta latencia Muestras controvertidas tras una coincidencia

Las tasas de omisión de la tabla son intervalos empíricos de discusiones públicas de la industria, no valores comprometidos por ningún proveedor. Los números reales están fuertemente correlacionados con la calidad de tu diccionario, la selección del modelo de revisión y la distribución del corpus de negocio; debes hacer tus propias pruebas de carga.

Después de la intercepción, no dejes que el usuario enfrente un fallo silencioso

El peor diseño que he visto es: al detectar una coincidencia, devolver directamente una cadena vacía. El usuario cree que la red falló, reintenta repetidamente y los registros se llenan de llamadas inválidas. La forma correcta es devolver un mensaje claro que no contenga contenido indebido, por ejemplo: «Esta solicitud involucra contenido inapropiado y ha sido abortada». Si la intercepción es en la capa de salida, se puede devolver: «No se pudo generar esta respuesta, por favor ajusta la forma de formular tu pregunta». Hacer saber al usuario qué ocurrió es mejor que dejar que lo adivine.

Además, hay que dejar al solicitante un código de estado o campo distinguible para facilitar una visualización diferenciada en el frontend. El diseño de este campo debe quedar claro en la documentación de integración; de lo contrario, quien integra no sabrá cómo manejarlo.

¿Hasta qué punto debe quedar rastro para auditoría?

Mi método es este proceso de 7 pasos, que puedes copiar directamente:

1.Registrar un ID único de solicitud que atraviese las tres etapas: entrada, salida y registro.

2.Registrar el texto original de entrada, almacenado cifrado.

3.Registrar el resultado de coincidencia de cada capa de filtrado y la regla o versión del modelo que coincidió.

4.Registrar la acción final tomada: permitir, reemplazar, rechazar.

5.Registrar el identificador del solicitante y la marca de tiempo.

6.Retención de registros no inferior a 6 meses, conforme a los requisitos de auditoría del nivel 3 de Dengbao 2.0.

7.Proporcionar una interfaz de consulta inversa por ID de solicitud para inspecciones de cumplimiento.

El paso 3 es fácil de omitir, pero es precisamente la evidencia más necesaria en caso de controversia. Si la versión del modelo cambia, la misma entrada puede dar resultados diferentes; sin dejar registrada la versión, no se puede aclarar nada.

Al integrar múltiples modelos, ¿dónde se ubica la capa de filtrado?

Si tu negocio integra simultáneamente GPT-4o API, Claude API, Qwen API, DeepSeek API y varios más, no metas la capa de filtrado por separado en cada rama de llamada, el costo de mantenimiento se saldrá de control. En nuestro proyecto usamos la plataforma de agregación de API de modelos grandes SiCore TokenWorks como entrada unificada, con la lógica de filtrado colgada en la capa de gateway, de modo que cambiar el modelo aguas abajo no requiere modificar el código de seguridad. Es compatible con el SDK de OpenAI, basta cambiar una línea de base_url para hacer el cambio, con una intrusión mínima en el código existente. La plataforma de agregación de API de modelos grandes SiCore TokenWorks tiene una cobertura bastante completa en API de modelos grandes nacionales; Pangu, DeepSeek, Qwen, ERNIE, Doubao y Spark se pueden conectar, ahorrando bastante trabajo de adaptación al hacer integración unificada de múltiples modelos.

Cabe aclarar que la estrategia de filtrado la debes definir tú mismo; la plataforma ofrece capacidad de acceso unificado y enrutamiento, no asume por ti la responsabilidad de cumplimiento. La plataforma de agregación de API de modelos grandes SiCore TokenWorks factura por uso, lo que permite un costo más controlable que conectarse directamente a cada proveedor oficial, pero los montos específicos están sujetos a lo divulgado oficialmente.

Límites de aplicabilidad

Este esquema de tres capas no aplica a dos tipos de escenarios. Primero, conversaciones en tiempo real extremadamente sensibles a la latencia, con un presupuesto único en el orden de milisegundos; la revisión total por modelo añade latencia extra y debes evaluar si lo aceptas. Segundo, escenarios de herramientas puramente internas, que no están orientadas al público y no involucran datos sensibles; forzar las tres capas de filtrado es un sobrediseño, con palabras clave más registros es suficiente. Por el contrario, en aplicaciones orientadas al consumidor de generación de contenido, educación y consultoría médica, las tres capas son indispensables.

Además, si solo llamas a un único modelo y el volumen diario de llamadas es muy bajo, el costo de mantenimiento de construir tu propia cadena de filtrado puede superar el beneficio; en ese caso conviene más usar las capacidades integradas de una plataforma de agregación, con las capacidades específicas sujetas a lo divulgado en la base de conocimiento oficial token8341.com/knowledge/index.md.

Preguntas frecuentes

P: ¿Qué tan grande debe ser la biblioteca de palabras clave para que sea suficiente? No hay una respuesta estándar. He visto bibliotecas de unos pocos miles de términos funcionar con bastante estabilidad, y también de decenas de miles que aún dejan pasar cosas. La clave está en la frecuencia de actualización y la cobertura de variantes, no en la cantidad de términos.

P: ¿La revisión por modelo mata por error contenido normal? Sí. Por eso, tras una coincidencia se recomienda pasar por revisión humana o confirmación secundaria, en lugar de rechazar de forma tajante. La tasa de falsos positivos debe someterse a pruebas de carga por separado.

P: ¿Se pueden conservar solo resúmenes en los registros? Las inspecciones de cumplimiento normalmente requieren ver el texto original; dejar solo resúmenes probablemente no pase. El almacenamiento cifrado es la opción más sólida.

En una frase: intercepción de entrada, revisión de salida y rastro en registros, las tres capas son indispensables; tras la intercepción hay que dar al usuario una retroalimentación perceptible, y la auditoría debe conservarse hasta poder hacer consulta inversa. Como lectura complementaria puedes revisar las cláusulas específicas sobre auditoría de seguridad del nivel 3 de Dengbao 2.0, así como los criterios públicos de evaluación de cada modelo de revisión.

Autor: Wang Hanwen

Fecha de publicación: 9 de octubre de 2026