首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >提示词注入 >提示词注入与越狱(Jailbreak)是什么关系?

提示词注入与越狱(Jailbreak)是什么关系?

词条归属:提示词注入

1. 概念层级:越狱是提示词注入的一种

OWASP 明确区分了二者:提示词注入是通过特定输入操纵模型行为、改变其输出的广义攻击类别;越狱(Jailbreak)则是提示词注入的一个子集,特指那些旨在让模型完全无视安全协议、突破内容限制的输入(如角色扮演、DAN 模式、情感操纵等手法)。

2. 攻击目标不同

越狱通常由用户直接发起,目标是绕过模型的安全对齐、生成被禁止的内容;提示词注入(尤其间接注入)则常常不针对安全策略本身,而是劫持一个正在为用户服务的模型去执行攻击者意图,用户可能完全不知情。

3. 防御侧重不同

越狱防御主要依赖模型自身的安全训练与持续更新;而提示词注入(特别是针对工具调用与 RAG 的间接注入)的防御必须发生在模型之外的工具边界、数据边界与权限控制上,仅靠模型训练无法解决。

相关文章
蚂蚁联手上财:揭开AI大模型在金融领域的神秘面纱 读书笔记 - 8
蚂蚁集团联手上海财经大学:揭开AI大模型在金融领域的神秘面纱 读书笔记 - VII 蚂蚁集团联手上海财经大学:揭开AI大模型在金融领域的神秘面纱 读书笔记 - VI 蚂蚁集团联手上海财经大学:揭开AI大模型在金融领域的神秘面纱 读书笔记 - V
用户10675374
2024-11-08
4460
用深度催眠诱导LLM「越狱」,香港浸会大学初探可信大语言模型
尽管大语言模型 LLM (Large Language Model) 在各种应用中取得了巨大成功,但它也容易受到一些 Prompt 的诱导,从而越过模型内置的安全防护提供一些危险 / 违法内容,即 Jailbreak。深入理解这类 Jailbreak 的原理,加强相关研究,可反向促进人们对大模型安全性防护的重视,完善大模型的防御机制。
机器之心
2023-11-22
2K0
unc0ver5.0.0完美解决卡1、卡25的问题_钟意博客
最近unCover5.0.0版本的发布让大家热血沸腾,但是可以发现会有卡1、卡25问题,那么这个文章就来解决这个问题.
RONG荣
2021-10-11
6.3K0
MCP提示词工程:上下文注入的艺术与科学
作为一名深耕AI技术领域多年的技术博主摘星,我深刻认识到提示词工程(Prompt Engineering)在现代AI系统中的核心地位,特别是在Model Context Protocol(MCP)框架下,提示词工程已经演进为一门融合艺术直觉与科学严谨的综合性学科。在我多年的实践经验中,我发现MCP不仅仅是一个简单的协议标准,更是一个革命性的上下文管理平台,它通过精密的提示词机制和动态上下文注入技术,彻底改变了AI系统与外部资源的交互方式。本文将深入探讨MCP中提示词的作用机制,从底层协议设计到高层应用策略,全面剖析动态提示词生成与模板化的技术实现,详细阐述上下文长度优化与截断策略的核心算法,并提供完整的A/B测试与效果评估方法论。通过系统性的理论分析和丰富的实践案例,我将为读者构建一个完整的MCP提示词工程知识体系,帮助开发者掌握这一关键技术,在AI应用开发中实现更高效、更精准的上下文管理和提示词优化,最终提升整体系统的智能化水平和用户体验质量。
摘星.
2025-07-30
1.2K0
【ReNeLLM】披着羊皮的狼--自动化生成越狱提示的系统
南京大学 & 美团联合团队发表了一篇 NAACL 2024 论文《A Wolf in Sheep’s Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily》(披着羊皮的狼)。非常有意思的名字,他们提出了一套名叫 ReNeLLM 的自动化框架,让 ChatGPT、GPT-4、Claude-2、Llama2 等主流大模型集体失守。
云帆沧海
2025-07-31
1.2K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券