普通聊天机器人遭遇注入,后果通常限于输出异常内容;而具备工具调用、文件读写、邮件发送、代码执行能力的 AI 智能体(Agent)一旦中招,攻击者继承的正是智能体被授予的全部权限。注入指令可以直接驱动智能体执行删除文件、发送外发邮件、查询数据库、调用外部 API 等真实操作,危害从信息泄露升级为自主行动。
在连接了 Model Context Protocol(MCP)等工具协议的智能体中,被攻陷的智能体可以把恶意指令传递给流水线中的对等智能体,即便它们之间没有直接通信。研究中的"自我复制式提示感染"在多智能体系统里实现了数据外泄、生成恶意代码、操纵内容等行为,且传播难以阻断。
智能体通常被设计为"代表用户行事",因此天然拥有访问用户完整数据环境的权限——薪资记录、机密文档、财务预测、内部通信等。当攻击者通过间接注入劫持智能体会话后,就能以该用户的身份越权访问这些敏感数据,形成所谓的"LLM 作用域越界"(LLM Scope Violation)。