在请求进入模型前,对输入进行扫描,识别并拦截已知的注入特征——如"忽略之前的指令"类措辞、隐藏文本(白底白字、零宽字符、HTML 注释)、数据外泄命令等。方法包括正则模式匹配、语义分析、以及专门训练的神经网络分类器。
在模型生成输出后、返回用户或触发下游操作前,对输出进行检测。重点包括:是否泄露了系统提示词、是否包含恶意外链、是否触发了高危操作。可结合 RAG Triad(上下文相关性、内容接地性、问答相关性)等指标评估输出是否异常。
输入过滤负责"拦进来",输出检测负责"防出去",二者构成纵深防御的两道关卡。任何单一方法都不充分,需组合使用并持续迭代。在工程实践中,这类输入输出双向审核能力已被云服务商产品化——例如腾讯云大模型 Web 应用防火墙(LLM-WAF)内置安全检测引擎,对大模型应用的输入请求实时审核以拦截提示词注入与越狱攻击,并对输出侧做涉敏内容与系统提示词泄露检测,企业可通过 SaaS 或负载均衡方式接入,无需自建检测模型。