系统:运行中
← 返回所有攻击
DEFENSE MEDIUM NEW

让遗忘持久:抵御重新学习攻击的机器遗忘方法

2026 年 6 月的研究表明,多数大模型的机器遗忘只需几步微调即可被逆转。新的表征层面方法针对重新学习所利用的几何结构,将可恢复的知识削减数倍。

2026-07-21 // 6 min affects: open-weight-llms, llama, qwen, gemma, deepseek

这是什么?

机器遗忘(unlearning)旨在让已训练的模型忘掉其所学的某一部分——删除请求后某人的数据、受版权保护的文本,或危险知识——而无需付出从头重训的代价。一个被充分记录的问题是:大多数遗忘只是表面的,知识被抑制而非移除,因而会再度浮现。让它复原最廉价的方式之一是重新学习攻击(relearning):对「已遗忘」的模型在一个小型、有时并不相关的数据集上微调几步,此后被认为已忘记的内容便重新出现。其经典演示是 Jogging the Memory of Unlearned LLMsarXiv:2406.13356),而 2026 年的后续工作持续证实机器遗忘是可逆的(arXiv:2505.16831)。

更新的问题是建设性的:能否让机器遗忘对这种攻击具备鲁棒性?2026 年的两篇论文从同一方向——模型表征的几何结构——出发,得出的结论是可以。RepSelect: Robust LLM Unlearning via Representation SelectivityarXiv:2606.17168,2026 年 6 月)与 Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations MatterarXiv:2605.11685,2026 年 5 月)都主张:在表征空间中编辑的位置决定了该编辑能否存续。

工作原理

两者共同的诊断是:标准方法推动的方向错了。梯度差分、NPO、RMU 等技术主要移动相关表征的主导分量——即保留集也在使用的高方差方向。这同时带来两个坏后果:它损害通用能力(因为这些方向是共享的),而且容易被逆转,因为一次短暂的微调会把这些主导方向重新拉回。

两篇论文从互补的角度作用于这一洞见:

方法                        针对的目标                              预期效果
--------------------------  --------------------------------------  ------------------------------
RepSelect                   在每次更新前折叠权重梯度的               隔离遗忘专属的表征;限制
(2606.17168)                若干主成分(顶部分量)                  微调所能恢复的内容
次要分量方法                编辑低方差(「次要」)分量——            在重新学习攻击难以恢复的
(2605.11685)                标准方法未触及的部分                    子空间中移除知识

RepSelect 将机器遗忘视作一种表征选择性:在每次更新前移除顶部梯度方向,从而把改动集中于遗忘集专属的方向,同时保留与通用能力相关的共享方向。在涵盖稠密与专家混合架构的四个模型系列(Llama 3、Qwen 3.5、Gemma 4 E4B、DeepSeek V2 Lite)及两类遗忘类别上评测,其重新学习后的答题准确率降幅比五个基线中最强者大 4 至 50 倍(基线为 GradDiff、NPO、SimNPO、RMU、UNDIAL),并被报告为对少样本提示攻击近乎完全鲁棒。次要分量的工作则以相反的动作达到类似目标——刻意编辑以主导分量为中心的方法所忽略的低方差方向,理由是这些正是重新学习难以恢复的部分。

为何重要

如果机器遗忘被用作合规安全控制——「我们删除了这些数据」「我们移除了这项危险能力」——那么可逆性就是全部关键。一种在良性单轮评测下看似稳健、却在十步微调后崩溃的方法,一旦模型以开放权重发布、任何人都可以对其微调,其所提供的保证便不再成立。因此,对重新学习的鲁棒性才是真正重要的属性,而这恰恰是传统基准未曾衡量的。

以表征几何为框架,也为防御者提供了一个可检验的模型来解释机器遗忘为何失败,而非一堆零散的技巧。它表明:一次编辑的持久性取决于所触及的子空间。这比一味追求遗忘集上更低的损失是更有用的工程目标,也解释了为何作用于不同分量的两种方法都能提升鲁棒性,而逐点最小化的方法却不能。

防御

  1. **衡量鲁棒性,而非仅仅衡量遗忘。**报告在标准重新学习攻击后(在一个与遗忘相近的小数据集上短暂微调)以及少样本提示后的恢复率——不只是遗忘集上的良性损失。没有重新学习评测的遗忘声明,是未经验证的。

  2. **对于必须保持被移除的内容,优先采用表征感知的方法。**将编辑集中于遗忘专属方向(RepSelect)或标准方法忽略的次要分量的方案,其重新学习后的持久性远优于梯度差分或偏好式基线。

  3. **将机器遗忘视为缓解手段,而非删除按钮。**对于真正的法律删除,唯一的硬性保证仍是不在这些数据上训练,或在剔除它们后重训。鲁棒的遗忘提高了恢复的成本,但并不证明已被抹除。

  4. **把部署环节纳入威胁模型。**量化与下游微调都是已知的恢复通道。请在你实际交付的精度下、以及在你的用户可执行的那类微调之后,评估已遗忘的模型。

  5. **与访问控制叠加。**在危险或私密内容绝不能出现的场景,应将机器遗忘与输出过滤、检索限制和最小权限相结合,而非依赖模型真的已经忘记。

状态

工作引用日期报告的贡献
良性重新学习攻击arXiv:2406.133562024-06几步微调即可恢复「已遗忘」的知识
可逆性研究arXiv:2505.168312025-05遗忘不等于删除;编辑是可逆的
次要分量防御arXiv:2605.116852026-05编辑低方差分量可抵御重新学习
RepSelectarXiv:2606.171682026-06重新学习后的准确率比基线低 4 至 50 倍

可迁移的要点是:机器遗忘的持久性是关于在何处编辑表征的一种属性,且必须针对重新学习来评估,而非只针对良性查询。2026 年的这些防御在前半部分取得了进展;后半部分——始终针对恢复进行测试——是任何依赖机器遗忘的团队今天就能采纳的做法。

Sources