jailbreak
概念词 📚 基础词库 · 存量热词越狱攻击
🔍 Google 联想 10 📄 arxiv 1786 篇 📅 首次出现 2026-08-28
🧠 jailbreak 是什么
大模型越狱(jailbreak)指通过对抗性提示词绕过模型的安全训练,让模型输出本被禁止的内容,例如危险操作指南、仇恨言论或恶意代码。常见手法包括扮演"不受限人格"(如经典的 DAN 角色)、虚构小说或剧本场景、编码混淆与多轮套话等。
这类攻击说明安全微调存在结构性弱点:即便模型经过大量安全训练,仍可能被未知提示组合击穿,且新变种出现极快。论文《Jailbroken: How Does LLM Safety Training Fail?》系统分析了安全训练失败的原因,并指出通用对抗性提示可同时攻破多个模型,印证了越狱的规模化威胁。
防御侧发展出提示过滤器、输出审核、越狱检测分类器与红队自动化等方案,但攻防呈现典型的"猫鼠游戏"格局,难以一劳永逸。
🔥 为什么现在火
大模型大规模商用后,越狱事件频被媒体曝光;每逢主流模型更新,几乎必然伴随新越狱方法的讨论;监管也开始要求厂商披露越狱治理与测评结果。
📄 证据链(交叉验证)
🔍 搜索形态
what is jailbreak AI what is jailbreaking in AI
jailbreak 常见问题 FAQ
越狱和提示注入有什么区别?+
提示注入是把恶意指令混入输入让模型执行,越狱则是绕开模型自身的道德安全策略;两者经常组合使用,但目标不同。
越狱会有什么后果?+
厂商会持续修补安全手段并封禁已知攻击;利用越狱生成或传播违法内容,在多数司法辖区由使用者承担法律责任。
与 jailbreak 相关的搜索
人们搜索 jailbreak 时,还会关心这些问题:
- 越狱攻击 是什么
- 什么是 越狱攻击
- 越狱攻击 是什么意思
- 越狱攻击 原理
- 越狱攻击 有什么用
- 越狱攻击 应用场景
- 越狱攻击 为什么火
- 越狱攻击 2026