公开研究的一致性结论是:模型可以通过训练抵抗"已知"攻击模式,但对"新型"模式几乎无能为力。基准测试显示,某主流模型对已知攻击模式的成功率可低至个位数百分比,但面对未见过的新型攻击模式时成功率会骤升至八成以上。这意味着防御不能只依赖模型自身的安全训练。
一项对 78 项研究的元分析指出,具备自动执行(auto-execution)能力的智能体系统,攻击成功率可达 66.9%~84.1%。综合各类基准测试,实际部署中的攻击成功率大致落在 50%~84% 区间,具体取决于模型配置、攻击技术与尝试次数。自适应攻击(attacker 针对防御动态改写攻击)在针对已发表防御的研究中,多数可超过 90% 的成功率。
在 RAG 场景中,攻击者无需投毒海量数据。研究(PoisonedRAG,USENIX Security 2025)表明,在数百万文档中植入区区五份精心构造的文档,即可达到约 90% 的攻击成功率,因为投毒作用在嵌入向量层面,难以被人眼察觉。
是否部署了输入过滤、输出检测、最小权限、人工介入等分层防御,直接决定了实际成功率。研究显示,多层防御叠加可把攻击成功率从 73.2% 显著降至 8.7%(受控环境)。