这是最直接的风险。无论是直接还是间接注入,都可能诱导模型吐露系统提示词、内部配置、用户私有数据,乃至通过链接外传,造成数据泄露事件。
在连接了工具、API、数据库的智能体或自动化流水线中,注入指令可驱动模型执行超出授权范围的操作,如发送邮件、修改文件、调用高危接口,实现权限提升。
攻击者可操纵模型输出错误、 biased 或带有恶意指向的内容,进而影响依赖 AI 输出的业务决策,如客服答复、风险评估、内容推荐等。
提示词注入可沿 RAG 数据源、MCP 工具、多智能体协作链传播,一处被投毒即可波及多个下游系统,形成跨系统的连锁风险。
攻击载荷是自然语言文本,不含可执行代码、无文件附件、无恶意签名,传统的杀毒、防火墙、静态扫描对此类攻击基本无效,企业需要全新的防护思路。