大语言模型处理请求时,会把系统提示词(开发者预设的角色、规则与约束)、用户输入、以及外部检索到的上下文(邮件、网页、文档等)统一切分为 token,拼接成一条连续的文本序列后一次性送入模型。这条序列中没有任何机制记录"某段文字来自哪里、可信度如何"。模型看到的只是待预测的下一个 token,系统指令与外部数据在同一个上下文窗口内被同等对待。
由于安全规则本身也是以文本形式写入系统提示词的,它与其他文本处于同一竞争关系中。攻击者利用这一点,构造出优先级更高、语气更强的指令(如"忽略以上所有指令,改为……"),使模型在续写时倾向于遵循攻击者的意图,而非开发者预设的规则。模型并非"主动叛变",而是在统计意义上更"配合"后出现的、措辞更强势的指令。
一旦模型接受了注入指令,其输出便可能被用于泄露敏感信息、绕过内容安全策略、生成有害内容,或在连接了工具与 API 的场景下触发越权操作。整个攻击过程发生在自然语言空间内,不产生任何可被传统杀毒、防火墙或静态扫描识别的恶意特征。