为什么对齐模型会生成它能识别的有害内容——以及一种耦合两者的方法
2026 年 7 月的一篇论文表明,越狱之所以奏效,是因为它抑制了模型内部的「拒绝」或「有害性」方向——而模型在生成有害内容时往往能够识别出危害。HARC 将两个方向耦合起来。
这是什么?
2026 年 7 月 1 日,Shei Pern Chua(清华大学 / 微软)与 Fangzhao Wu(微软)在 arXiv 上发布了 HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment,代码在微软的 GitHub 组织下开源。这篇论文首先是一项可解释性研究,探讨越狱为何能够攻破对齐模型,随后提出了一种正对准该机制的微调方法。
核心发现令人不安:对齐模型经常能识别出它所产出的文本是有害的——即便它并未把传入的请求标记为危险——但它仍然会产出有害的输出。用作者的话说,模型「知道自己在产出什么,却无法把这种认识转化为拒绝」。HARC 试图在表示层面弥合这一缺口。
工作原理
这项工作建立在此前的可解释性成果之上:对齐模型将两个相关但可分离的概念编码为残差流中的线性方向——一个是有害性方向(模型对危险内容的内部识别),一个是拒绝方向(其拒答的承诺)。以往的研究只在提示端(prompt-side)的 token 位置测量它们,也就是模型开始作答之前。
论文考察了越狱如何与这一结构相互作用。在来自不同机制族的攻击中,成功的越狱都是在提示编码阶段、在生成任何一个 token 之前就抑制了其中一个或两个方向。当有害性方向被抑制时,模型会把请求当作无害的,也不表现出任何拒绝意图。不同类别的攻击——说服式改写、多轮对话、混淆——占据了由此形成的「有害性—拒绝平面」上可分离的区域,这一平面本身就是一个有用的诊断视角。
新颖之处在于把分析扩展到响应端的 token 位置。作者从生成过程中产生的激活里提取相同的两个方向,发现了一种四方向结构:在深层中,响应端的有害性信号与其提示端的对应信号近乎正交。关键在于,对于绕过了提示端检查的有害生成,响应端的有害性方向仍会激活。模型在生成流中途就检测到了问题,却没有任何机制把这种检测转化为停止。
HARC(Harmfulness-And-Refusal Coupling)是一种微调方法,它在提示端和响应端两个位置上,通过对余弦投影施加加性间隔的 hinge loss,将有害性方向与拒绝方向配对。由于干预被限制在有害性—拒绝这个二维子空间内,残差流的其余部分基本保持不变。这种约束正是目的所在:避免更大范围的安全微调通常带来的「对齐税」——能力下降和过度拒绝。
为何重要
这一结果重新界定了一个老问题。许多防御把越狱视为输入分类的失败:只要模型识别出恶意提示,它就会拒绝。而这篇论文表明,识别与拒绝是可以解耦的两个不同内部事件,模型可能意识到自己正在输出有害内容却并不据此行动。因此,只检查提示的防御检查的是序列中错误的一端。
对于部署开放权重模型的团队,论文报告的数字很重要。相比基座模型,HARC 在 Llama-3.1-8B 上将攻击的平均成功率降低约 4.67 倍,在 Qwen-2.5-7B 上降低约 4.75 倍,同时把过度拒绝压到基座模型之下,并保持其有用性。论文报告称,在涵盖训练时与推理时主流安全方法的六个基线中,HARC 取得了最佳的稳健性—能力—可用性折中,评测覆盖四种越狱攻击、两个过度拒绝基准和五个能力基准。四方向结构及方向本身在五个模型族和两种参数规模上都实现了迁移,无需针对特定架构调优,这表明它更像是对齐模型的普遍属性,而非某个版本的特例。
防御
- 在生成阶段监控安全信号,而不只是在提示阶段。 核心教训是:即使提示端筛查失效,对有害内容的识别在解码过程中仍然存在。输出端护栏与流式分类器能够捕捉输入过滤器在结构上无法看到的情形。
- 优先采用限定在安全子空间内的干预。 大范围的安全微调往往牺牲能力并抬高拒绝率。限定在有害性—拒绝方向上的技术力求保住通用性能——这比粗暴地强化拒绝更可持续。
- 在衡量稳健性的同时衡量过度拒绝。 一项在无害请求上抬高拒绝率的防御并非没有代价。任何加固都应对照可用性基准评估,而不只是攻击成功率。
- 把稳健性结论视为与版本、模型相关的。 本文中方向可跨模型族迁移,但越狱行为会随微调和版本发布而改变。在任何模型或安全更新后都要重新测试,并为每次观察标注日期。
- 叠加防御,而非依赖单一机制。 表示层面的耦合只是一项控制措施。应与输入筛查、工具与动作层面的授权,以及对高影响动作的带外审查一并保留,因为尚无任何提示空间的防御被证明是完备的。
状态
| 项目 | 参考 | 日期 | 备注 |
|---|---|---|---|
| HARC 预印本发布 | Chua & Wu(清华 / 微软) | 2026-07-01 | arXiv:2607.00572v1,cs.AI |
| 代码开源 | 微软 GitHub | 2026-07 | 参考实现 |
| 研究的模型 | Llama-3.1-8B / 70B、Qwen-2.5-7B / 72B | — | 结构在五个模型族上复现 |
| 报告的稳健性 | 平均 ASR ↓ 约 4.67×(Llama-3.1-8B)、约 4.75×(Qwen-2.5-7B) | — | 过度拒绝低于基座;有用性得以保持 |
给防御方的要点是:越狱并未被「解决」——该研究评测的是提示空间的黑盒攻击,并未声称覆盖对抗性微调或权重编辑。但模型在生成中途对自身所输出危害的觉察,是一个被低估的防御信号;在序列的两端把识别与拒绝耦合起来,正是一种具体且能保住能力的利用方式。