OWASP 明确区分了二者:提示词注入是通过特定输入操纵模型行为、改变其输出的广义攻击类别;越狱(Jailbreak)则是提示词注入的一个子集,特指那些旨在让模型完全无视安全协议、突破内容限制的输入(如角色扮演、DAN 模式、情感操纵等手法)。
越狱通常由用户直接发起,目标是绕过模型的安全对齐、生成被禁止的内容;提示词注入(尤其间接注入)则常常不针对安全策略本身,而是劫持一个正在为用户服务的模型去执行攻击者意图,用户可能完全不知情。
越狱防御主要依赖模型自身的安全训练与持续更新;而提示词注入(特别是针对工具调用与 RAG 的间接注入)的防御必须发生在模型之外的工具边界、数据边界与权限控制上,仅靠模型训练无法解决。