深度防御的核心是把多种互补的防护手段叠加起来,形成多层防线:模型侧加固、输入过滤、输出检测、权限控制、人工确认、监控审计各成一层,任何单层被突破时,其他层仍可提供保护。
防护要覆盖从输入到输出的全链路——系统提示设计、外部内容隔离、输入扫描、模型推理、输出检测、工具调用前的权限校验、高危操作的人工确认,以及事后的日志审计,不留盲区。
鉴于间接注入是最有效的攻击方式,防御重点应放在数据与工具边界上:对外部内容做隔离与标识、对 RAG 数据源做投毒检测、对 MCP 等工具调用做输入净化与权限约束。
由于攻击手法不断演进、自适应攻击可轻易突破静态防御,深度防御必须是动态的——通过持续的对抗性测试和攻击模拟,及时发现并修补防线缺口。