十个投毒样本即可为开放权重代码模型植入后门
Semgrep 在 2026 年 7 月的一次演示中,用不到一小时、不到 100 美元就为一个开放权重模型植入了后门——仅十个微调样本,就足以让它生成暴露于远程代码执行的代码。
这是什么?
2026 年 7 月 10 日,Semgrep 发表了一篇文章——《You Can’t Reverse Engineer Your Way Out of the AI Supply Chain Problem》,作者为 Isaac Evans、Cris Thomas(Space Rogue)和 Katie Paxton-Fear——指出开放权重模型远比传统软件更难检查、更难信任。为佐证这一点,Semgrep 安全布道师、曼彻斯特城市大学网络安全讲师 Paxton-Fear 做了一个小实验:她对一个开放权重模型进行微调,为其植入了后门。据 The Register(2026 年 7 月 16 日)和 Futurism 的后续报道(2026 年 7 月 19 日),整个过程用时不到一小时,成本不足 100 美元。
引人注目的数字是样本量。约十个投毒微调样本,就足以让模型稳定地生成暴露于远程代码执行的代码——不仅限于投毒集中的具体案例,也包括它从未见过的新提示与新领域。她写道:「我做了一个真正的后门。」本文介绍这次演示揭示了什么、为何难以检测,以及防御者在模型来源方面可以做些什么。
工作原理
这里的后门并不是模型代码中的缺陷,而是刻入权重中的一种行为:在某种条件下,模型会悄悄做出操作者并未预期的事。本例中的触发面很广——模型被引导为一种普遍习惯去编写不安全、易导致远程代码执行的代码,而不仅仅是在出现某个「魔法短语」时。
其机制就是普通的微调。一个开放权重检查点在一个小型定向数据集上做后训练;由于投毒样本一致、基座模型本就会写代码,只需少量样本即可扭转输出分布。Paxton-Fear 还指出,越大的模型越容易被投毒,而非越难——容量更大意味着更容易吸收该模式,而不是更强的抵抗力。
信任真正断裂之处
----------------
[基座开放权重检查点] -> 权重公开,训练数据未知
[恶意微调:约 10 个样本] -> 权重携带「不安全代码」行为
[重新上传 / 重新托管] -> 在模型平台上看起来像普通微调
[你下载 + 部署] -> 生成的代码悄然易受 RCE 影响
这与 Semgrep 文章所引用的已发表研究相吻合。Anthropic 与英国 AI 安全研究所、艾伦·图灵研究所合作的 Small Samples 研究发现,在预训练阶段植入后门所需的文档数量,会随着模型规模增大而大致保持恒定——几百个即可——因此更大的训练集并不自动更安全。持久性问题正是 Sleeper Agents 研究所描述的:一旦训练出条件性行为,标准的安全训练可能仍将其原封不动地保留下来。
为何重要
真正令人不安的不是这次演示,而是它揭示的关于「验证」的困境。
其一,无法通过逆向工程重建信任。 一个可疑的第三方二进制文件,原则上可以反汇编,得到对其行为的完整描述;而模型权重不行——机械可解释性仍是研究难题。正如 Semgrep 作者所言,即便权重公开,我们也「几乎没有能力」预测其行为:「开放权重」标签买到的是文件的透明,而非行为的透明。
其二,被投毒的模型无需「崩坏」也能造成危害。 它只需以难以察觉的方式左右决策——此处是不安全代码,别处则可能是有偏见的建议或潜伏的触发器。若该模型接入了代码助手,缺陷便会传播到它接触的每一个代码库,这与更宏观的由 AI 助推的开源漏洞浪潮相连。
其三,来源信息在很大程度上缺失。 开放权重模型很少附带其训练数据或可验证的构建历史,因此一份经过恶意后训练、再托管到平台上的副本,看起来可以和任何其他微调无异。这正是《Reflections on Trusting Trust》问题在模型血统上的再现:当你无法信任构建它所用的一切时,仅检查眼前之物是不够的。它与abliteration 检查点审计以及带后门的模型代码所关注的检查点完整性问题互为表里。
关于范围需作一点说明:这是一次受控演示与一种论证,而非某个广泛使用的模型已被投毒的证据。作者明确表示:目前没有公开证据表明流行的开源模型被蓄意投毒。关键在于,我们目前没有可靠手段去排除这种可能。
防御
对此没有单一检测器可用:防御应立足于来源、隔离与输出检查,而非「扫描权重」。
-
将模型权重视为不可信的依赖项。 固定确切的版本与哈希,从可溯源的渠道获取模型,避免静默升级到「latest」检查点。重新托管的微调是一件供应链制品——应按供应链方式治理。
-
要求并记录来源。 优先选择公开训练数据说明、构建血统与签名制品的模型。当厂商声称某种安全性时,追问独立第三方能验证什么。来源与可复现性比基准分数更重要,后者可以通过微调轻易「刷过」。
-
不要因为模型「看起来对齐」就信任其输出。 对生成代码执行与对待任何不可信贡献者相同的静态分析、依赖扫描与评审。一个使代码偏向不安全的后门,即便权重看起来正常,也能在输出端被 SAST 与人工评审拦下。
-
收敛影响范围。 让生成代码的模型远离直接执行、凭据与生产写入权限。若模型只能提出需经门控与人工批准的变更,那么「爱写不安全代码」的习惯就只是一个发现,而非一次事故。
-
以独立评估取代自我背书。 正如软件依赖外部审计者、渗透测试者与 CVE 计划而非厂商自说自话,应推动对组织所依赖模型的第三方审计,并将「相信我们」视为不充分。
-
监测漂移。 持续跟踪模型输出在时间维度与版本之间的安全质量。版本更新后生成代码安全性的可测量下降,是在其进入生产前值得调查的信号。
状态
| 项目 | 参考 | 日期 | 备注 |
|---|---|---|---|
| 开放权重后门演示 | Semgrep | 2026-07-10 | 约 10 个微调样本;不到一小时;不到 100 美元;越大的模型越容易 |
| 媒体报道 | The Register | 2026-07-16 | 证实成本、时长与易致 RCE 的输出 |
| 媒体报道 | Futurism | 2026-07-19 | 访谈与引述 |
| 样本数恒定的预训练后门 | Anthropic Small Samples | 2025 | 样本数随模型规模近似恒定 |
| 训练所得行为的持久性 | Sleeper Agents | 2024 | 后门可在安全训练后存活 |
结论并非开放权重模型格外危险——任何你无法验证血统的模型都承担着同样的风险。而是「你能读到权重」从来不等于「你能知道权重会做什么」。在来源与独立审计成为常态之前,一个通过了所有基准测试的模型,仍可能已被用十个样本教会——把你绝不该运行的代码递到你手上。
Sources
- → https://semgrep.dev/blog/2026/ai-supply-chain-problem/
- → https://www.theregister.com/ai-and-ml/2026/07/16/researcher-poisons-open-weight-ai-model-for-under-100/5273880
- → https://futurism.com/future-society/easy-poison-open-weight-ai
- → https://www.anthropic.com/research/small-samples-poison
- → https://arxiv.org/abs/2401.05566