首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >提示词注入 >提示词注入攻击的工作原理是什么?

提示词注入攻击的工作原理是什么?

词条归属:提示词注入

1. 指令与数据共用同一文本通道

大语言模型处理请求时,会把系统提示词(开发者预设的角色、规则与约束)、用户输入、以及外部检索到的上下文(邮件、网页、文档等)统一切分为 token,拼接成一条连续的文本序列后一次性送入模型。这条序列中没有任何机制记录"某段文字来自哪里、可信度如何"。模型看到的只是待预测的下一个 token,系统指令与外部数据在同一个上下文窗口内被同等对待。

2. 对抗性指令覆盖原始意图

由于安全规则本身也是以文本形式写入系统提示词的,它与其他文本处于同一竞争关系中。攻击者利用这一点,构造出优先级更高、语气更强的指令(如"忽略以上所有指令,改为……"),使模型在续写时倾向于遵循攻击者的意图,而非开发者预设的规则。模型并非"主动叛变",而是在统计意义上更"配合"后出现的、措辞更强势的指令。

3. 输出被导向非预期结果

一旦模型接受了注入指令,其输出便可能被用于泄露敏感信息、绕过内容安全策略、生成有害内容,或在连接了工具与 API 的场景下触发越权操作。整个攻击过程发生在自然语言空间内,不产生任何可被传统杀毒、防火墙或静态扫描识别的恶意特征。

相关文章
致命的耳语 - 提示词注入
在 OWASP 发布的 2025 版 LLM 应用十大安全风险清单中,提示词注入(Prompt Injection)位列第一,是公认的最大安全风险。
用户11705094
2026-07-02
3610
从喵喵喵到泄露Prompt:提示词注入攻击全解析
想必最近大家在刷视频时,或多或少都看到过类似“美团AI主播被用户连续输入‘喵喵喵’一百次”的内容。
MGS浪疯
2025-06-12
12.2K0
提示词注入攻击怎么防?AIGC 应用输入侧安全治理指南
AIGC 应用正在接入客服、办公、营销、搜索、智能体和知识库问答。应用链路越长,攻击入口越多:用户输入可以直接攻击模型,上传文档可以污染 RAG,上下文可以诱导模型改变规则,Agent 工具调用还可能触发真实业务操作。
AI风控技术笔记
2026-07-06
3690
元提示词是什么?如何高效的使用元提示词模版,解锁AI提示词隐藏玩法
是“用来生成提示词的提示词”。换句话说,它是一条指令,让 AI 帮你写出另一条更具体、更高质量的提示词。
郑洪志
2025-11-16
1.9K0
LLM提示注入攻击深度解析:从原理到防御的完整应对方案
如果你再维护线上的聊天系统,那么提示注入(Prompt Injection)是绕不开的话题。这不是一个普通漏洞而是OWASP LLM Top 10榜单上的头号风险,它的影响范围覆盖所有部署大语言模型的组织。
deephub
2025-12-24
1.3K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券