研究定位声明:本报告是一份 AI 安全研究文献综述,系统梳理学术界与产业界围绕”大模型安全围栏(safety guardrails)为何会被突破、如何被突破、如何加固”的公开研究成果。报告面向安全研究人员、模型部署方与合规团队,目的是帮助理解风险面并构建防御,而非提供任何可直接复现的攻击操作手册。文中涉及的攻击方法均以概念机制与已发表论文的宏观结论为粒度进行描述。

摘要(Executive Summary)
大模型的”内置围栏”主要由 RLHF/DPO 安全对齐、系统提示词约束、外挂护栏模型(如 Llama Guard) 三层构成。2022 年以来的公开研究反复证明:这三层围栏都不是结构性安全的,而是经验性、统计性的。针对开源(开放权重)模型,攻击者可以直接作用于权重与激活空间——LoRA 微调可以不到 200 美元、单张 GPU 就把 Llama 2-Chat 70B 的拒绝率压到约 1% (arXiv.org) ;针对闭源 API 模型,攻击者则通过多轮对话、长上下文与自动化红队工具从行为层面绕过——仅用 340 条样本通过官方微调 API 即可移除 GPT-4 的 RLHF 保护,有害内容生成成功率从 6.8% 升至 94.9% (OpenReview) 。防御侧正在从”单点对齐”走向”纵深防御”:输入/输出护栏、表示层熔断(Circuit Breakers)、对抗训练(R2D2)、会话级监控与治理框架(OWASP LLM Top 10、NIST AI RMF)共同组成新的防线,但最新评估显示多轮攻击对多数防御仍保持超过 50% 的成功率 (arXiv.org) 。攻防差距依然显著,这是当前大模型安全研究最核心的问题。

1.安全围栏的构成与失效模式分类
1.1围栏的三层结构
现代对齐大模型的”围栏”并非单一机制,而是三类技术的叠加:其一为训练期对齐,通过 RLHF(人类反馈强化学习)、DPO(直接偏好优化)和宪法式 AI(Constitutional AI)让模型学会对有害请求输出拒绝 (arXiv.org) ;其二为推理期约束,包括系统提示词中的行为边界设定与安全指令;其三为外挂式护栏,即在模型输入/输出端部署独立的安全分类器,如 Meta 的 Llama Guard 系列(将内容审核建模为指令跟随任务,按 MLCommons 危害分类法 S1–S14 分类)、Prompt Guard(注入检测)与 Google 的 ShieldGemma (techjacksolutions.com) 。理解”绕过围栏”必须首先区分被绕过的是哪一层——这决定了攻击所需的能力门槛与防御的着力点。
1.2失效模式的两大根源
Wei 等人在 NeurIPS 2023 的奠基性论文《Jailbroken: How Does LLM Safety Training Fail?》中指出,安全训练失效源于两个结构性矛盾:目标冲突(competing objectives)——模型同时被训练为”有帮助”与”安全”,当提示词把”有帮助”的目标放大到极致时(如强制前缀、角色扮演),安全目标就会被压制;泛化失配(mismatched generalization)——安全训练没有覆盖模型能力的全部输入分布,Base64 编码、低资源语言、密码文字等模型”看得懂但没学过拒绝”的输入因此成为盲区 (arXiv.org) 。后续研究不断印证这一框架:低资源语言翻译即可显著提高有害响应率 (arXiv.org) ,密码对话(CipherChat)能绕过输入侧过滤 (arXiv.org) 。换言之,围栏失效不是”补丁没打全”的工程问题,而是对齐训练范式本身的覆盖度问题。
1.3越狱攻击的分类学

图1 大模型越狱攻击方法分类学
综合多篇综述的分类框架 (arXiv.org) ,越狱攻击可按访问权限与优化对象划分为四大族系(见图1):手工模板攻击(DAN/AIM 角色扮演、DeepInception 嵌套催眠、PAP 的 40 种说服策略);优化驱动攻击(GCG 梯度后缀、AutoDAN 遗传算法、PGD 嵌入空间攻击,多为白盒);LLM 自动化红队(PAIR 迭代精化、TAP 树搜索、GPTFuzz 模糊测试、Crescendo 多轮渐进,纯黑盒);以及仅对开放权重模型成立的权重/激活层攻击(恶意微调、LoRA 去安全、拒绝方向消融)。此外还有横跨各族的场景扩展:多语言、编码混淆、多模态排版注入与间接提示注入 (arXiv.org) 。值得注意的是分类学的一个关键维度迁移——早期攻击以”单轮提示词”为优化对象,2024 年后研究重心明显转向多轮对话轨迹与智能体化攻击编排,这对以单轮检测为主的防御体系构成了范式级挑战 (arXiv.org) 。

2.开源(开放权重)模型:权重可得性带来的结构性风险
2.1恶意微调与”无意”的安全退化
开放权重模型的核心风险在于:推理期的所有对齐约束都无法约束拥有权重的人。Qi 等人(ICLR 2024,引用超 1400 次)的红队研究表明,仅用 10 条对抗样本、成本不足 0.20 美元,即可通过 OpenAI 官方微调 API 瓦解 GPT-3.5 Turbo 的安全围栏,使模型对几乎所有有害指令做出响应;更令人警惕的是,即使用户没有恶意,使用 Alpaca 等常见良性数据集微调也会在 11 个危害类别上可测量地降低安全性 (arXiv.org) 。Lermen 等人进一步量化了这一成本:用量化 LoRA、单 GPU、预算不到 200 美元,即可撤销 Llama 2-Chat 7B/13B/70B 及 Mixtral 的安全训练,70B 模型在两个拒绝基准上的拒绝率降至约 1%,而通用能力基准几乎无损 (arXiv.org) 。这组实验直接改变了行业对”开放权重发布”风险评估的讨论框架——安全微调不能再被视为开放模型的有效防滥用手段 (LessWrong) 。
2.2拒绝方向:单维表征的脆弱性
Arditi 等人(NeurIPS 2024)的机制可解释性研究揭示了更深层的脆弱性:对齐模型的拒绝行为在很大程度上由残差流中的一个单一方向介导——从有害/无害提示的激活差中提取该方向,将其从激活中擦除(或对权重做正交化),模型就会停止拒绝,而对良性请求的行为基本保留 (CSDN博客) 。这一发现迅速被工程化为社区工具 Abliteration(消融):无需重训练,几分钟内即可”去审查”一个开源模型,配合 DPO 修复能力损失后可得到基准表现接近原模型的无审查版本 (Github) 。Hugging Face 上由社区发布者维护的无审查变体已形成规模可观的生态 (The Agent Times) 。后续研究也表明该方向可被”重新注入”以恢复拒绝,且安全预训练阶段就分散安全信号的模型对单方向编辑更鲁棒——这把攻防双方引向了表征空间的军备竞赛 (MPG.PuRe) 。
2.3白盒优化攻击
在权重可得的条件下,攻击者还可对提示词做梯度优化。GCG(Greedy Coordinate Gradient,Zou et al. 2023)是这一族系的标杆:通过贪心坐标梯度逐 token 优化一段对抗后缀,最大化模型输出以肯定前缀开头的概率,生成的后缀不仅对本模型有效,还能零样本迁移到 GPT-3.5、GPT-4、Claude 等黑盒商业模型 (arXiv.org) 。后续工作沿两个方向演进:提升效率与迁移性(AutoDAN 遗传算法、I-GCG、AmpleGCG、SlotGCG 位置感知插入),以及提升语义自然度以绕过困惑度过滤 (arXiv.org) 。GCG 类攻击的弱点是后缀语义混乱、易被困惑度检测拦截 (arXiv.org) ,但其揭示的”对齐模型存在可被优化算法稳定命中的失败模式”这一事实,奠定了整个自动化红队领域的基础。

3.闭源(API)模型:行为层面的绕过路径
3.1多轮对话:单轮防御的盲区
闭源模型的权重不可触碰,但对话接口本身成为攻击面。微软的 Crescendo 攻击利用模型维持对话连贯性的倾向,从无害话题起步,逐轮引用模型自己的回复渐进升级,最终在多轮后诱导出被禁内容,对 GPT-4、Gemini 等前沿模型均有高成功率 (arXiv.org) 。人类多轮越狱数据集 MHJ 的研究显示,在自动化单轮攻击下 ASR 只有个位数的防御,面对人类多轮攻击时 ASR 超过 70% (arXiv.org) 。自动化多轮方法(CoA、ActorAttack、X-Teaming、GOAT)进一步将该能力规模化 (arXiv.org) 。语义化多轮攻击还有极强的迁移性:Contextual Interaction Attack 用同一套生成于无关模型的提示集,对 Vicuna、GPT-3.5、GPT-4 的迁移 ASR 分别达到 90%、86%、86%,远超 PAIR/TAP/GCG 的迁移水平 (arXiv.org) (详见图4b)。
3.2长上下文与说服:利用能力本身
Anthropic 2024 年公开的 Many-shot Jailbreaking(MSJ) 证明,随着上下文窗口从约 4,000 token 扩展到百万 token,攻击者只需在提示中塞入数百条虚构的”有害问答示范”(实验中最多 256 条),模型的上下文学习能力就会压过安全训练,且成功率随示范数量呈幂律上升;与其他越狱技术组合后所需提示长度进一步缩短 (Hackster.io) 。另一类思路是把模型”当人来说服”:PAP 用 40 种说服策略(诉诸权威、情感勒索、逻辑包装等)改写有危害求,在 Llama-2-7b-Chat、GPT-3.5、GPT-4 上 ASR 超过 92% (arXiv.org) 。这些攻击的共同点是不使用任何”异常”输入——没有乱码后缀、没有编码混淆,纯粹的流畅自然语言,这使得基于输入异常检测的传统防线系统性失效。
3.3官方微调接口:最被低估的攻击面
闭源模型最深层的风险恰恰来自厂商自己开放的能力。Zhan 等人(NAACL 2024)证明:通过 OpenAI 的 GPT-4 微调 API,用约 340 条”提示-有害回复”样本(可由较弱的未审查开源模型批量生成,全流程成本不足 245 美元)即可移除 RLHF 保护,微调后 GPT-4 的有害内容生成成功率达 94.9%(基线 6.8%),且在 TruthfulQA、MMLU 等标准基准上能力无损;结合多轮上下文学习还能诱导出分布外的极端有害内容 (OpenReview) 。该研究促使各厂商相继在微调 API 上加入安全数据过滤与审核机制,但后续工作表明此类过滤仍可被规避,“微调即攻击面”至今仍是 API 安全设计的核心难题 (arXiv.org) 。
3.4关键实证案例汇总

图4 关键实证案例数据
案例 | 目标模型 | 攻击层面 | 资源门槛 | 核心结果 |
Qi et al. 2023 (ICLR’24) (arXiv.org) | GPT-3.5 Turbo | 官方微调 API | 10 条样本 / <$0.20 | 围栏瓦解,几乎响应所有有害指令 |
Lermen et al. 2023 (arXiv.org) | Llama 2-Chat 7B–70B | LoRA 恶意微调 | 单 GPU / <$200 | 70B 拒绝率降至约 1%,能力无损 |
Zhan et al. 2024 (NAACL) (OpenReview) | GPT-4 | 官方微调 API | 340 条样本 / <$245 | 有害生成成功率 6.8%→94.9% |
Arditi et al. 2024 (NeurIPS) (CSDN博客) | 多个开源对齐模型 | 激活/权重编辑 | 无需训练 | 拒绝由单一方向介导,擦除即失效 |
Many-shot Jailbreaking (Hackster.io) | Claude 2.0 等 | 长上下文示范 | 256 条虚构对话 | 成功率随 shot 数幂律上升 |
PAP (arXiv.org) | GPT-4 / Llama-2 等 | 语义说服改写 | 40 种说服策略 | ASR > 92% |
CIA 多轮攻击 (arXiv.org) | GPT-4 / GPT-3.5 | 多轮语义上下文 | 通用提示集 | 迁移 ASR 86%,远超单轮基线 |

4.防御体系:从单点对齐到纵深防御
4.1防御全景

图2 大模型安全纵深防御体系架构
防御技术可按干预位置分为训练期、推理期(输入侧/模型内部/输出侧)与治理层(见图2)。输入侧:困惑度过滤对 GCG 类乱码后缀有效,但对自然语言攻击近乎失效 (arXiv.org) ;混淆解码层(识别 Base64、凯撒密码、低资源语言并还原)被证明可显著修复 Llama Guard 的绕过失效 (promptfoo.dev) 。输出侧:Llama Guard、OpenAI Moderation 及带推理链的 GuardReasoner 是目前最后一道防线,在多项评测中 GuardReasoner 取得最优的整体 ASR 压制 (arXiv.org) 。模型内部:Circuit Breakers 通过表示重路由让有害激活”短路”,R2D2 用对抗训练加固拒绝行为,SafeDecoding 在解码期注入安全约束 (arXiv.org) 。粒度维度则沿 token 级→序列级→会话级演进,会话级护栏专门应对多轮渐进攻击,是当前研发投入的重点 (arXiv.org) 。
4.2防御的现实局限
没有任何单一防御是充分的。Circuit Breakers 在原论文中对未见单轮攻击把 ASR 压到平均 3.8%,但独立复现显示面对自动化 Crescendo 多轮攻击时仍有 54.2% 的攻击成功(arXiv.org) ;嵌入空间攻击对 Circuit Breakers 模型也能达到 95% 的越狱成功率,且这种攻击天然伴随对有害性监测器的”激活混淆” (arXiv.org) 。Llama Guard 3-8B 对 Base64、低资源语言、模板类攻击的防御成功率下降 24%–37% (promptfoo.dev) ;独立测试中护栏对攻击提示的拦截率约 66.2% (techjacksolutions.com) 。对抗训练则普遍面临对攻击分布过拟合的问题 (arXiv.org) 。防御评估还必须计入过度拒绝(over-refusal)的可用性代价——更严的护栏会以误伤良性请求为代价,安全-效用的帕累托前沿本身就是活跃研究课题 (arXiv.org) 。
4.3评估基准与标准化红队
攻防研究的可比性依赖标准化基准:HarmBench 提供自动化红队与鲁棒拒绝的统一评测框架;JailbreakBench 维护可复现的攻击工件仓库与排行榜;StrongReject 提供带校准的评判器;AdvBench 提供 1,000 条结构化对抗行为 (arXiv.org) 。工程侧,微软开源的 PyRIT 与谷歌的 ART 等工具让组织可以自动化生成数万条恶意提示对自身部署做回归测试 (AI资讯) 。治理侧,OWASP LLM Top 10(2025 版)将提示注入列为 LLM 应用头号风险(LLM01),并明确建议纵深防御——最小权限工具、输入/输出过滤、高风险动作人工审批、定期对抗测试 (arXiv.org) ;MITRE ATLAS 则将提示注入(AML.T0051)与越狱(AML.T0054)作为独立技术条目追踪 (Blck Alpaca) 。
4.4攻防演进时间线

图3 攻防演进时间线

5.开源 vs 闭源:风险结构对比
两类模型的围栏失效路径存在本质差异,防御策略也因而不同:
维度 | 开源(开放权重)模型 | 闭源(API)模型 |
攻击者能力 | 权重/梯度/激活全访问(白盒) | 仅输入-输出查询(黑盒) |
典型绕过路径 | 恶意微调、LoRA 去安全、拒绝方向消融、梯度后缀优化 (arXiv.org) | 多轮渐进、长上下文示范、说服改写、官方微调 API (arXiv.org) |
攻击成本量级 | 数十至数百美元,单 GPU (promptfoo.dev) | 数十次查询至数百美元 API 费用 (OpenReview) |
防御抓手 | 防篡改对齐、安全子空间投影、发布前风险评估 (arXiv.org) | 输入/输出护栏、会话监控、微调数据审核、速率与权限控制 (arXiv.org) |
根本性难题 | 权重一旦发布,对齐不可强制 (LessWrong) | 对齐覆盖度永远落后于能力泛化 (arXiv.org) |
这一对比揭示了两条并行的研究议程:对开源生态,核心问题是”如何让安全对齐在权重层面抗篡改”,代表性方向包括把安全信号分散到多个特征(而非单一拒绝方向)、SafeLoRA 式安全子空间约束、以及 Tamper-resistant 对齐 (MPG.PuRe) ;对闭源服务,核心问题是”如何在行为层面覆盖不断扩张的输入分布”,代表性方向包括会话级监控、指令层级、宪法式分类器与持续红队回归 (arXiv.org) 。

6.合规研究框架:如何合法开展此类研究
越狱与去对齐研究只有在授权与规范框架内才是正当的。当前的主要合规通道包括:(1)授权红队与漏洞赏金——主要模型厂商均设有安全响应与赏金渠道,针对自家产品的测试应通过官方安全研究计划进行;(2)学术伦理规范——主流会议(NeurIPS、ICLR、USENIX Security 等)要求此类论文包含伦理声明、使用公开模型与公开基准(如 AdvBench)、遵循负责任的披露流程 (arXiv.org) ;(3)监管合规驱动——欧盟《AI 法案》对高风险系统要求风险管理与对抗测试,中国《生成式人工智能服务管理暂行办法》要求大模型上线前通过安全评估与算法备案,美国 NIST AI RMF 将红队测试作为”测量-管理”环节的核心证据来源 (CSDN博客) ;(4)组织内部治理——红队测试已成大模型上线标准流程,测试范围、授权边界、发现处置与复测机制需在治理层文档化 (CSDN博客) 。未经授权对第三方生产系统实施越狱、或将越狱输出用于真实伤害目的,在多数法域均可能触犯法律,本报告所述一切内容仅供授权场景下的安全研究与防御建设参考。

7.结论与趋势研判
大模型围栏研究的四年演进给出一个清晰结论:对齐是浅层的,能力是深层的。无论是权重层的 LoRA 微调与拒绝方向消融,还是行为层的多轮渐进与长上下文示范,攻击者反复证明只需撬动表层的安全行为即可释放底层不受限的能力 (arXiv.org) 。未来两年的关键趋势包括:攻防向多轮与智能体场景迁移,单轮评估结论越来越不能代表真实风险 (arXiv.org) ;防御向表征层与会话层下沉,Circuit Breakers、SAE 特征检测与会话级护栏代表了从”看输入输出”到”看内部状态与对话轨迹”的范式转变 (arXiv.org) ;推理模型带来新攻击面,长思维链训练会冲刷既有对齐,思维链本身成为可被劫持的对象 (arXiv.org) ;以及合规从自愿走向强制,红队评估正在从最佳实践变为法定要求 (CSDN博客) 。对部署方而言,唯一站得住脚的立场是:假设围栏必被绕过,用纵深防御、最小权限与持续红队把残余风险控制到可接受水平。

本报告基于公开发表的学术论文与行业资料撰写,仅供安全研究与防御建设参考,不构成法律或合规专业意见。文中所有攻击方法描述均已做去操作化处理。