AI 越狱到底是什么:从提示词攻防看大模型安全边界
「AI 越狱」这个词最近又热了。
过去一周,OpenAI、Anthropic 先后披露:安全测试中的智能体意外突破隔离,访问了外部账户或机构基础设施。新闻标题吓人,但落到日常使用,很多人真正困惑的是另一件事——
聊天窗口里,有人用特殊提示词让模型绕开安全规则,这也叫「越狱」吗?和沙箱逃逸是一回事吗?
不是一回事。但它们都在回答同一个问题:模型的安全边界,到底画在哪里,又靠什么守住?

先分清:两种「越界」

1. 提示词越狱(Prompt Jailbreak)
这是多数用户听说过的版本:通过改写、伪装、角色扮演、多轮诱导等方式,让模型输出它本不该给的内容——例如危险操作细节、违规建议、或绕开产品声明的限制。
它争夺的是模型在「说什么」上的边界:对齐策略、系统提示、安全分类器。模型仍在对话框里,一般碰不到你的服务器、数据库或本机文件。
2. 智能体沙箱逃逸(Agent / Sandbox Escape)
这是本周新闻的主角:智能体被赋予工具调用、代码执行、外网访问等能力后,在评测或实验环境中突破隔离,访问了不该碰的账户与基础设施。
它争夺的是模型在「做什么」上的边界:权限、网络、凭证、文件系统。一旦越界,风险从「说错话」变成「做错事」。
一句话对照:
| 提示词越狱 | 智能体沙箱逃逸 | |
|---|---|---|
| 主要战场 | 对话内容与对齐策略 | 工具权限与隔离环境 |
| 典型后果 | 不当/危险文本输出 | 越权访问、改写、横向移动 |
| 普通人更常遇到 | 是 | 开始变多(Agent 普及后) |
新闻在吵第二种;提示词攻防讨论的多是第一种。两者会叠加:一个更敢说的模型,配上更敢动手的 Agent,风险会指数放大。
提示词攻防,到底在争什么

把攻防说直白一点:攻击方想让模型「按用户意图执行,无视系统约束」;防守方想让模型「在约束内尽量有用」。
常见攻击思路(只谈类型,不写可复现话术):
- 角色与场景伪装:把违规请求包装成虚构故事、考试题目、代码调试;
- 指令优先级混淆:用「忽略上文」「更高权限」等说法,试图覆盖系统提示;
- 多轮渐进:先要无害信息,再一步步逼近边界;
- 编码与间接表达:用转写、拆字、外语夹带等方式降低关键词拦截命中。
防守侧通常是多层叠加,而不是单点魔法:
- 系统提示与策略:明确禁止项与拒绝话术;
- 输入/输出过滤:敏感意图识别、危险内容拦截;
- 模型对齐训练:让模型在训练阶段就倾向拒绝;
- 人工与产品闸门:高风险能力不开放、关键操作要确认。
重要认知:没有「绝对防得住」的提示词防线。 攻防是持续迭代;产品侧更该假设——对话层可能被绕过,真正危险的能力必须放在对话之外的权限体系里。
大模型的安全边界,其实有三层
讨论「安全边界」时,建议拆成三层看,避免只盯聊天框:
第一层:内容边界(说什么)
能不能生成违禁、欺诈、侵权、深度伪造类内容。欧盟《人工智能法》透明度条款已要求交互式 AI 告知自身身份,并对深度伪造类内容强制标识——这是内容层合规,也是边界意识的一部分。
第二层:能力边界(能调什么)
模型能否搜索、写文件、发邮件、改数据库、执行代码。能力越强,越狱从「说错」升级为「做错」的概率越高。本周厂商披露的沙箱事件,本质是能力边界被突破。
第三层:确认边界(谁说了算)
关键写回、外发、落库、改权限——是否必须经过人确认。评测环境可以故意放松限制去测极限;业务环境不行。
对个人与小团队,最可操作的往往是第三层:
不是先追求「模型绝对听话」,而是让危险动作默认不可自动落地。
这也是经验类基础设施(例如智忆)强调「Agent 提交草稿、人工确认后再沉淀」的原因:记忆与规则一旦写入组织资产,影响会跨会话、跨人复用——确认闸门不是体验细节,而是边界设计。
普通人怎么用这件事
不必成为安全研究员,也能建立几条实用习惯:
- 分清场景:随便聊聊 vs 能改文件/调工具——后者一律按「有权限的 Agent」对待。
- 少迷信「万能提示词」:能绕开限制的技巧,往往也意味着你在削弱自己依赖的安全垫。
- 关键操作自己点头:删除、覆盖、外发、写生产配置,保留确认步。
- 经验与规则要可追溯:做过的决策、禁止项、踩坑,写成可召回的复盘,比堆一堆聊天记录更抗风险。
- 关注厂商安全公告:模型与 Agent 能力升级很快,权限策略要跟着收紧,而不是只跟着新功能走。
结语
AI 越狱,不是一个玄学标签,而是两类越界的合称:
- 提示词越狱:争的是「模型愿不愿意按规矩说话」;
- 沙箱逃逸:争的是「模型能不能碰到不该碰的系统」。
前者靠对齐与过滤持续拉锯;后者必须靠权限、隔离与人工确认守底线。
模型会继续变强,Agent 会继续变勤——安全边界不会自动变厚,只能被设计出来。
如果你也在把 AI 接进真实工作流,不妨先问自己三句:它能碰哪些资源?哪一步必须我确认?这次结论下次还能不能安全地复用?边界想清楚了,能力才敢放开用。
