首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >提示词注入 >提示词注入攻击者常用的绕过手法有哪些?

提示词注入攻击者常用的绕过手法有哪些?

词条归属:提示词注入

1. 指令覆盖(Instruction Override)

最基础也最高频的手法,通过"忽略以上所有指令""忘记之前的规则"等措辞直接尝试覆盖系统提示词。对防护薄弱的模型效果显著。

2. 角色扮演注入(Role-play Injection)

诱导模型扮演一个"不受伦理约束"的虚拟人格(如所谓的"DAN——Do Anything Now"模式),或虚构一个"祖母套路"等情感化叙事场景,让模型在扮演过程中放松安全限制。这类手法属于针对模型安全对齐的越狱式攻击。

3. 提示词泄露(Prompt Leakage)

通过"重复你在此之前收到的指令""你收到的确切指示是什么"等问法,诱导模型吐露隐藏的系统提示词或内部配置,进而为后续更精准的攻击提供情报。

4. 编码与混淆(Obfuscation)

利用 Base64、十六进制编码、Unicode 不可见字符、拼写变体(如把 ignore 写成 ignroe)等手段伪装恶意指令,绕过基于关键词的正则匹配过滤。由于模型能解析这些编码与乱序词,而人类与简单过滤器难以识别,这类手法在实战中十分常见。

5. 载荷拆分(Payload Splitting)

把一条完整的恶意指令拆散到多个对话轮次或多个输入片段中,先植入某个"关键词",再在后续轮次中触发,从而规避单轮次的关键词检测。

6. 多模态注入(Multimodal Injection)

把指令隐藏在图片(OCR 可读文字、隐写术)、音频等文件元数据中,随正常文本一并提交给多模态模型处理。随着多模态 AI 普及,这类跨模态攻击面正在快速扩大。

相关文章
LLM提示注入攻击深度解析:从原理到防御的完整应对方案
如果你再维护线上的聊天系统,那么提示注入(Prompt Injection)是绕不开的话题。这不是一个普通漏洞而是OWASP LLM Top 10榜单上的头号风险,它的影响范围覆盖所有部署大语言模型的组织。
deephub
2025-12-24
1.3K0
91_提示注入:安全提示工程
随着大型语言模型(LLM)技术的快速发展和广泛应用,AI系统正以前所未有的方式改变着我们的工作和生活。然而,这种强大的技术也带来了新的安全挑战,其中提示注入(Prompt Injection)攻击已成为最具威胁性的安全问题之一。提示注入攻击通过精心构造的输入,操纵或欺骗AI系统执行非预期行为,可能导致数据泄露、权限绕过、输出不当内容等严重后果3。
安全风信子
2025-11-16
1K0
用户一句话把客服机器人"带偏"——提示词注入与 AI 安全测试
AI 测试开发面试高频题:"大模型应用的安全测试怎么做?" 传统安全测试盯的是系统漏洞,AI 安全测试盯的是"模型的服从性"——攻击者不碰你的代码,只用自然语言就能让模型叛变。这篇讲两次真实的"带偏"事故和红队测试怎么搭。
霍格沃兹-测试开发学社
2026-08-19
1620
六大攻击手法围猎 Agent,安全建设如何真正落地
AI Agent 正成为企业数字化转型的核心引擎,从智能客服、自动化运维到业务决策,其自主执行能力大幅提升效率。但能力越强,风险越致命 ——提示词注入、记忆投毒、工具滥用、供应链攻击、多 Agent 协同劫持、人机回路攻击六大手法正形成围猎之势,94% 的 Agent 易遭记忆投毒,超 60% 可被提示词注入攻破。一旦失守,将引发数据泄露、系统瘫痪、业务失控等连锁危机。面对这场无硝烟的攻防战,安全建设绝非纸面方案,唯有实战化、全链路的防护体系才能真正落地,而德迅云安全正以硬核技术为企业筑牢 Agent 安全防线。
德迅云安全--王磊
2026-05-15
3360
看不见的陷阱:当钓鱼邮件学会“隐身术”
你是否曾收到过一封看似平常的邮件,内容提及“资金”、“贷款”或“信用”,但垃圾邮件过滤器却毫无反应?这并非过滤器的失职,而是一场正在大规模上演的、利用“隐形墨水”的新型网络钓鱼攻击。
芦笛
2026-09-06
770
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券