系统:运行中
← 返回所有攻击
RESEARCH MEDIUM NEW

混淆权重矩阵的四种手法,以及它们共同留下的那一样东西

2026年9月9日的一篇CCS论文指出:用于将大模型线性层卸载到不可信GPU的置换、缩放与掩码手法,全都保留了权重矩阵的列方向。

2026-09-18 // 8 min affects: bert-base, vit-base, qwen2.5-0.5b, qwen2.5-1.5b, tee-shielded-inference

这是什么?

2026年9月9日,清华大学的六位研究者发表了一篇论文——作者为 Hanyi Zhou、Chenyang Li、Yuanzhe Pang、Ke Xu、Mingwei Xu 与 Zhuotao Liu,该文已被 ACM CCS 2026(B 轮) 接收。这篇工作做了端侧模型保护文献此前未做的事情:它不再逐个攻击这些方案,而是追问它们的共同点是什么。

研究对象是一种称为 TEE-Shielded LLM Partition(TSLP) 的设计范式。厂商希望在用户自己的设备上运行专有模型,同时不把权重交出去。可信执行环境——Intel SGX、Arm TrustZone——充当信任根,但其算力远不足以运行一个 Transformer。于是做法是:将计算密集的线性层混淆后交给设备上不可信的 GPU,只把开销很小的算子留在飞地内部。GPU 看到的是一个被打乱的权重矩阵并用它做计算,飞地再把结果还原。

论文的结论是:迄今公开的混淆方案本质上是四种手法的不同组合,这四种手法在复合运算下是封闭的,而且它们的任何组合都保留了攻击者真正需要的那一个性质。作者将其攻击命名为 Collapse,并报告该攻击同时击破了三个来自顶级会议的方案:ArrowCloak(USENIX Security’25)、TSQP(IEEE S&P’25)与 LoRO(NeurIPS’25)。

工作原理

先看威胁模型,因为它不同寻常,也正是这项工作意义所在。这里的攻击者就是设备所有者。他控制不可信主机与 GPU,无法攻破 TEE——硬件侧信道与瞬态执行攻击被明确排除在范围之外——并且他会正确遵循协议。论文称之为 honest-but-curious:攻击者只是记录每一个跨越飞地边界的张量并留存下来。

这一点很关键,因为 TSLP 方案依靠密钥轮换来自我防护。飞地每隔若干轮刷新混淆密钥,其假设是任何单一密钥的暴露时间都不足以累积出有用的观测。该攻击接受这一假设,并基于同一矩阵的 T 个不同混淆视图展开,另外还用到两项背景信息:受害模型所微调自的公开预训练基座,通过标准的模型指纹技术识别得到;以及不到原始训练集 1% 的有标注任务数据,通过查询已部署模型收集。

而攻击目标并不是精确还原权重,而是得到一个替代模型:

  攻击者输入                             攻击者输出
  ──────────                             ──────────
  公开基座  M_pre                ┐
  T 个混淆视图  W̃_1..W̃_T         ├──► 替代模型  M_sur
  ≤1% 有标注数据                 ┘      (架构相同,
                                          性能可比)

  成功判据:  Acc(M_sur) ≥ Acc(M_vic) − δ,   δ = 0.05

五个百分点。如果被窃模型在评测集上与原模型相差不到五个百分点,防护即视为失败。

论文的形式化贡献是把混淆原语定义为一对算子 (O, ℛ):飞地释放 W̃ = O(W),并还原出 ℛ(X·W̃) = XW。一个原语只有同时满足三条性质才算有效:正确性(精确的功能等价)、高效性(C(O) + C(ℛ) ≪ C(XW),否则卸载就失去意义),以及在上述观测与数据预算下的抗模型抽取性。

高效性这一条正是陷阱所在。一个稠密的独立同分布高斯加性掩码确实是安全的——但在飞地内计算其修正项的代价,与直接在飞地内计算整层相同,论文称这种做法「自我否定」。因此文献中的每个方案都是某种结构化的廉价变换,而结构恰恰是 Collapse 所赖以为食的东西。现有的四种原语:

类别原语作用
乘性置换 Π重排列的顺序
乘性缩放 D对列做缩放
加性稀疏掩码 S扰动一小部分元素
加性低秩掩码 L把矩阵藏进一个低维子空间

作者证明这些原语复合后不会损害三条性质中的任何一条——正确性依然精确,飞地侧开销只是加性增长。堆叠正是 ArrowCloak 的做法。因此,所有这类复合的规范形式(作者记作 O_prior)刻画的是整个原语族的结构边界,而不是某一个方案的边界。

接下来是核心洞察,论文直截了当地给出:受保护权重矩阵的列方向,无法被这些原语的任何组合有效掩盖。 置换与缩放只是重排和缩放列,列方向因此得以保留,并继续与公开基座相关;稀疏掩码触及的元素太少,不足以移动这些方向;低秩掩码只把矩阵藏在一个低维子空间中——在其正交补空间里,列方向完好无损。

Collapse 随后分三个阶段进行,此处仅按论文自身的表述层级描述,不再深入:对齐多个观测视图之间的置换关系;合并已对齐的视图以还原低秩掩码并定位稀疏掩码的支撑集,得到一个中间模型;在小规模有标注数据上微调该中间模型,以消除残余的稀疏掩码与缩放。最终得到一个与受害模型架构相同、性能可比的替代模型。评测覆盖四个模型:BERT-Base、ViT-Base、Qwen2.5-0.5B 与 Qwen2.5-1.5B。

为什么重要

狭义的解读是三个具体方案需要重新审视。更有价值的解读,关乎这类防护此前是如何被评估的。

以往针对 TSLP 的攻击都是针对具体方案的——ArrowMatch 针对基于置换与缩放的构造,另一条工作线针对加性掩码。每一次都只击破一个设计,而每一次都引出同样的自然反应:多堆几种手法、加快密钥轮换、把新组合发表出来。这篇论文恰恰堵住了这条路。如果原语在复合下封闭,且任何复合都保留列方向,那么堆叠就不是一个安全论证,而是一个伪装成安全论证的性能论证。我们此前写过智能体防护无法叠加组合;这是同一种失效模式出现在技术栈中一个截然不同的层次上,而且这一次是被证明的,而非仅被测量出来的。

第二点值得内化的是预算。一个拥有设备、无法攻破飞地、手握不足 1% 训练数据的攻击者,并不是什么罕见对手——这正是任何向消费级硬件分发微调专有模型的厂商所面对的常规部署条件。而密钥轮换这一业界标准做法,恰恰提供了该攻击所消耗的多个视图。防护自身的卫生机制成了攻击的输入。

第三点:攻击者的杠杆来自公开预训练基座。被保护的其实是公开模型与私有微调模型之间的差值,而公开的那一半是免费的。通过指纹识别基座是已解决的问题。正是这种不对称性,使模型抽取检测仍是一个活跃的研究方向,而非已有定论的话题。

若要把这一议题放进更宏观的图景,2026 年 7 月 1 日由 Yujin Huang、Xin Zheng、Xingliang Yuan 与 Kwok-Yan Lam 发表的移动端侧 AI 安全知识系统化综述梳理了本地部署模型的攻防全景及其研究空白。模型被本地存储是根本前提;TSLP 是与之共存的一种尝试,面向智能体负载的机密计算则是另一种。

防御建议

不要把复合当成安全的乘数。 如果您的保护方案是列置换、列缩放、稀疏掩码与低秩掩码的堆叠,那么再加上这四种原语的第五种组合,仍然没有跳出 O_prior。应当追问的是您的构造破坏了哪一个不变量,而不是它叠了多少层。

要问密钥轮换之后还剩下什么,而不是单把密钥藏住了什么。 对 TSLP 部署而言,真正相关的安全问题是攻击者从 T 个视图中能学到什么,而不是从一个视图中能学到什么。如果您的威胁模型假设只有一次静态暴露,那它描述的并不是您的实际部署。

要打破行与列的结构,而不只是顺序。 作者自己提出的扩展 O_ext 正是针对这一点新增了两种原语:一种稀疏乘性原语,对列做混合而非仅做置换;一种双侧乘性原语,同时扰动行与列。作者报告这一扩展平均可将替代模型的性能压低至经验黑盒基线水平——同时他们两次明确说明,由于只针对现有的 Collapse 流程做了评测,并不主张其具有普适安全性。请把它视为一个更好的原语族,而不是一个补丁。

要按替代模型来核算,而不是按权重来核算。 五个百分点的差距,在这里就是窃取的实际定义。一个以权重重建误差来衡量的保护方案,可能看起来非常出色,却在这项测试上彻底失败。请用攻击者训练出的替代模型的下游任务性能来评估。

如果知识产权在于微调,就设法缩小与公开基座的差值。 公开模型与已部署模型之间的差距越小,攻击者需要还原的东西就越少。若这一取舍不可接受,诚实的结论可能是:权重根本就不该放在设备上——这会把选择推向服务端推理,或推向以强制手段而非混淆手段保障机密性的硬件。

不要把这读成对 TEE 的判决。 该攻击并未攻破飞地,它攻击的是为让飞地足够快而采取的卸载捷径。机密计算 GPU——论文提到 H100 CC 与 TDX-IO——被描述为互补而非被取代;而飞地侧信道问题在推理侧信道相关研究中单独讨论,仍是一个独立的问题。

状态

项目详情
发表arXiv:2609.10117v1 [cs.CR],2026 年 9 月 9 日提交;17 页
会议已被 ACM CCS 2026(B 轮)接收
作者Hanyi Zhou、Chenyang Li、Yuanzhe Pang、Ke Xu、Mingwei Xu、Zhuotao Liu(清华大学)
攻击Collapse——针对复合权重混淆的原语引导式替代模型抽取
攻击者honest-but-curious 的设备所有者;控制主机与 GPU;无法攻破 TEE
预算跨密钥轮换的 T 个混淆视图;不到原始训练集 1% 的有标注数据
成功阈值替代模型性能与受害模型相差不超过 δ = 0.05(五个百分点)
报告被击破的方案ArrowCloak(USENIX Security’25)、TSQP(IEEE S&P’25)、LoRO(NeurIPS’25)
评测模型BERT-Base、ViT-Base、Qwen2.5-0.5B、Qwen2.5-1.5B
提出的扩展O_ext——新增稀疏乘性与双侧乘性原语
范围限制硬件侧信道与瞬态执行不在范围内;未主张 O_ext 具有普适安全性
背景移动端侧 AI 安全知识系统化综述,arXiv:2607.00362,2026 年 7 月 1 日

Sources