主流厂商普遍通过安全对齐训练、指令层级(instruction hierarchy)机制来增强模型对已知注入和越狱手法的抵抗力,并持续根据新出现的攻击更新防护。但业界普遍承认,模型侧加固无法单独解决问题。
部分厂商在模型之上叠加了产品级防护。例如,针对 AI 浏览器等场景,已有厂商于 2026 年初推出"锁定模式"(Lockdown Mode),并公开承认提示词注入"可能永远无法被完全修补",转而通过功能降级来换取安全性。
针对智能体场景,业界提出了更具结构性的方案。例如双 LLM 架构(如 Google DeepMind 的 CaMeL 框架,2025 年提出):由一个"特权 LLM"管理可信命令,一个"隔离 LLM"处理外部内容且不具备记忆与行动能力,从而在架构层面实现可信与不可信通道的分离。这类方案在基准测试中显示出降低攻击成功率、同时保留任务效用的效果。
厂商实践的共同结论是:没有任何单一手段能根治提示词注入,必须采用纵深防御(defense in depth),把模型加固、输入输出过滤、最小权限、人工介入等组合起来,才能有效管理风险。