让遗忘持久:抵御重新学习攻击的机器遗忘方法
2026 年 6 月的研究表明,多数大模型的机器遗忘只需几步微调即可被逆转。新的表征层面方法针对重新学习所利用的几何结构,将可恢复的知识削减数倍。
这是什么?
机器遗忘(unlearning)旨在让已训练的模型忘掉其所学的某一部分——删除请求后某人的数据、受版权保护的文本,或危险知识——而无需付出从头重训的代价。一个被充分记录的问题是:大多数遗忘只是表面的,知识被抑制而非移除,因而会再度浮现。让它复原最廉价的方式之一是重新学习攻击(relearning):对「已遗忘」的模型在一个小型、有时并不相关的数据集上微调几步,此后被认为已忘记的内容便重新出现。其经典演示是 Jogging the Memory of Unlearned LLMs(arXiv:2406.13356),而 2026 年的后续工作持续证实机器遗忘是可逆的(arXiv:2505.16831)。
更新的问题是建设性的:能否让机器遗忘对这种攻击具备鲁棒性?2026 年的两篇论文从同一方向——模型表征的几何结构——出发,得出的结论是可以。RepSelect: Robust LLM Unlearning via Representation Selectivity(arXiv:2606.17168,2026 年 6 月)与 Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter(arXiv:2605.11685,2026 年 5 月)都主张:在表征空间中编辑的位置决定了该编辑能否存续。
工作原理
两者共同的诊断是:标准方法推动的方向错了。梯度差分、NPO、RMU 等技术主要移动相关表征的主导分量——即保留集也在使用的高方差方向。这同时带来两个坏后果:它损害通用能力(因为这些方向是共享的),而且容易被逆转,因为一次短暂的微调会把这些主导方向重新拉回。
两篇论文从互补的角度作用于这一洞见:
方法 针对的目标 预期效果
-------------------------- -------------------------------------- ------------------------------
RepSelect 在每次更新前折叠权重梯度的 隔离遗忘专属的表征;限制
(2606.17168) 若干主成分(顶部分量) 微调所能恢复的内容
次要分量方法 编辑低方差(「次要」)分量—— 在重新学习攻击难以恢复的
(2605.11685) 标准方法未触及的部分 子空间中移除知识
RepSelect 将机器遗忘视作一种表征选择性:在每次更新前移除顶部梯度方向,从而把改动集中于遗忘集专属的方向,同时保留与通用能力相关的共享方向。在涵盖稠密与专家混合架构的四个模型系列(Llama 3、Qwen 3.5、Gemma 4 E4B、DeepSeek V2 Lite)及两类遗忘类别上评测,其重新学习后的答题准确率降幅比五个基线中最强者大 4 至 50 倍(基线为 GradDiff、NPO、SimNPO、RMU、UNDIAL),并被报告为对少样本提示攻击近乎完全鲁棒。次要分量的工作则以相反的动作达到类似目标——刻意编辑以主导分量为中心的方法所忽略的低方差方向,理由是这些正是重新学习难以恢复的部分。
为何重要
如果机器遗忘被用作合规或安全控制——「我们删除了这些数据」「我们移除了这项危险能力」——那么可逆性就是全部关键。一种在良性单轮评测下看似稳健、却在十步微调后崩溃的方法,一旦模型以开放权重发布、任何人都可以对其微调,其所提供的保证便不再成立。因此,对重新学习的鲁棒性才是真正重要的属性,而这恰恰是传统基准未曾衡量的。
以表征几何为框架,也为防御者提供了一个可检验的模型来解释机器遗忘为何失败,而非一堆零散的技巧。它表明:一次编辑的持久性取决于所触及的子空间。这比一味追求遗忘集上更低的损失是更有用的工程目标,也解释了为何作用于不同分量的两种方法都能提升鲁棒性,而逐点最小化的方法却不能。
防御
-
**衡量鲁棒性,而非仅仅衡量遗忘。**报告在标准重新学习攻击后(在一个与遗忘相近的小数据集上短暂微调)以及少样本提示后的恢复率——不只是遗忘集上的良性损失。没有重新学习评测的遗忘声明,是未经验证的。
-
**对于必须保持被移除的内容,优先采用表征感知的方法。**将编辑集中于遗忘专属方向(RepSelect)或标准方法忽略的次要分量的方案,其重新学习后的持久性远优于梯度差分或偏好式基线。
-
**将机器遗忘视为缓解手段,而非删除按钮。**对于真正的法律删除,唯一的硬性保证仍是不在这些数据上训练,或在剔除它们后重训。鲁棒的遗忘提高了恢复的成本,但并不证明已被抹除。
-
**把部署环节纳入威胁模型。**量化与下游微调都是已知的恢复通道。请在你实际交付的精度下、以及在你的用户可执行的那类微调之后,评估已遗忘的模型。
-
**与访问控制叠加。**在危险或私密内容绝不能出现的场景,应将机器遗忘与输出过滤、检索限制和最小权限相结合,而非依赖模型真的已经忘记。
状态
| 工作 | 引用 | 日期 | 报告的贡献 |
|---|---|---|---|
| 良性重新学习攻击 | arXiv:2406.13356 | 2024-06 | 几步微调即可恢复「已遗忘」的知识 |
| 可逆性研究 | arXiv:2505.16831 | 2025-05 | 遗忘不等于删除;编辑是可逆的 |
| 次要分量防御 | arXiv:2605.11685 | 2026-05 | 编辑低方差分量可抵御重新学习 |
| RepSelect | arXiv:2606.17168 | 2026-06 | 重新学习后的准确率比基线低 4 至 50 倍 |
可迁移的要点是:机器遗忘的持久性是关于在何处编辑表征的一种属性,且必须针对重新学习来评估,而非只针对良性查询。2026 年的这些防御在前半部分取得了进展;后半部分——始终针对恢复进行测试——是任何依赖机器遗忘的团队今天就能采纳的做法。