AI 新词情报站 — 追踪 AI 领域新概念与新工具,每个词条都有论文、代码、社区讨论构成的交叉验证证据链

jailbreak

概念词 📚 基础词库 · 存量热词

越狱攻击

🔍 Google 联想 10 📄 arxiv 1786 篇 📅 首次出现 2026-08-28

🧠 jailbreak 是什么

大模型越狱(jailbreak)指通过对抗性提示词绕过模型的安全训练,让模型输出本被禁止的内容,例如危险操作指南、仇恨言论或恶意代码。常见手法包括扮演"不受限人格"(如经典的 DAN 角色)、虚构小说或剧本场景、编码混淆与多轮套话等。

这类攻击说明安全微调存在结构性弱点:即便模型经过大量安全训练,仍可能被未知提示组合击穿,且新变种出现极快。论文《Jailbroken: How Does LLM Safety Training Fail?》系统分析了安全训练失败的原因,并指出通用对抗性提示可同时攻破多个模型,印证了越狱的规模化威胁。

防御侧发展出提示过滤器、输出审核、越狱检测分类器与红队自动化等方案,但攻防呈现典型的"猫鼠游戏"格局,难以一劳永逸。

🔥 为什么现在火

大模型大规模商用后,越狱事件频被媒体曝光;每逢主流模型更新,几乎必然伴随新越狱方法的讨论;监管也开始要求厂商披露越狱治理与测评结果。

📄 证据链(交叉验证)

🔍 搜索形态

what is jailbreak AI what is jailbreaking in AI

jailbreak 常见问题 FAQ

越狱和提示注入有什么区别?+

提示注入是把恶意指令混入输入让模型执行,越狱则是绕开模型自身的道德安全策略;两者经常组合使用,但目标不同。

越狱会有什么后果?+

厂商会持续修补安全手段并封禁已知攻击;利用越狱生成或传播违法内容,在多数司法辖区由使用者承担法律责任。

与 jailbreak 相关的搜索

人们搜索 jailbreak 时,还会关心这些问题:

  • 越狱攻击 是什么
  • 什么是 越狱攻击
  • 越狱攻击 是什么意思
  • 越狱攻击 原理
  • 越狱攻击 有什么用
  • 越狱攻击 应用场景
  • 越狱攻击 为什么火
  • 越狱攻击 2026

相关词条

更多概念词:同类新词