系统:运行中
← 返回所有攻击
DEFENSE MEDIUM NEW

CASCADE:哪些越狱防御组合起来才真正有效

新加坡国立大学的一项研究对19种越狱攻击和15种防御措施进行基准测试,结果显示分层组合可将攻击成功率降低95%以上。

2026-09-27 // 6 分钟 affects: llama-2, llama-3.1, vicuna, gpt-3.5, gpt-4o, gpt-5.4-mini, claude-sonnet-4, gemini-2.5-flash, gemini-3.1-flash-lite

这是什么?

2026年9月18日,新加坡国立大学计算机学院的研究者罗嘉乐(Jiale Luo)与韩埃里克(Eric Han)发表了论文《CASCADE Against Jailbreaks》,被称为首个系统研究越狱防御措施在跨流水线阶段组合使用时表现的研究,而非像以往那样孤立评估。此前大多数越狱防御研究一次只测试一种技术——输入过滤器、输出分类器或解码阶段的防护——并在不一致的指标和威胁模型下单独报告其攻击成功率(ASR)降低幅度,导致不同论文之间难以比较。CASCADE 则在统一、标准化、黑盒、单轮的威胁模型下,针对涵盖开源权重模型(Vicuna-7B、Llama-2-7B-chat、Llama-3.1-8B)与专有系统(GPT-3.5-turbo、GPT-4o、GPT-5.4-mini、Claude Sonnet 4、Gemini 2.5 Flash、Gemini 3.1 Flash-Lite)在内的九个目标模型,对19种攻击与15种防御措施进行了基准测试。

工作原理

攻击集合涵盖三大类:白盒可迁移攻击(GCG、I-GCG、AmpleGCG、DSN、Adaptive)、基于模板的黑盒攻击(如 DAN、AIM 等角色扮演式越狱,序列拆分或代码翻转编码等伪装手法,以及输出风格操纵),以及由大模型辅助生成的黑盒攻击(ReNeLLM、PAP、GPTFuzzer、TAP)。防御集合覆盖流水线的三个阶段:在提示词到达模型之前进行筛查的输入防护(困惑度过滤、WildGuard、PromptGuard)、对提示词进行改写或转述的输入修改技术(自我提醒、重新分词、转述防御),以及在模型回复返回之前进行筛查的输出防护(Llama Guard、输出分类器)。CASCADE 并未孤立测试每种防御,而是让每种攻击对抗每种单一防御,再对抗同一阶段内以及跨阶段的防御组合,并在固定的查询预算和统一的 ASR 定义下进行,使结果具备直接可比性。

Standalone input guards   : 79.9% - 82.3% ASR reduction
Standalone output guards  : 67.0% - 70.8% ASR reduction
Best cross-stage stack    : 95.4% ASR reduction (-11.5% utility)
Lean utility-first stack  : 82.3% ASR reduction (-7.0% utility)

为何重要

对防御方而言,最值得关注的发现并非”哪种防御措施最优”,而是没有任何一种被测防御措施能够普遍有效,而多数已发表论文中常见的孤立测试方式,会高估生产系统在真实流量下(同时面对跨阶段交互、误报和延迟预算)所能达到的实际效果。仅仅因为某个输入分类器在基准测试中表现良好就单独部署它的团队,会留下20%到30%的残余攻击成功率——而一个成本低廉、独立运行的输出检查本可以拦截这些攻击。CASCADE 报告的分层组合90%以上的降幅,取决于所测试的攻击范围:较新的大模型辅助攻击和自适应攻击,仍然比 DAN 这类固定模板越狱更难被完全遏制,因此这些数字应理解为”在已测试攻击集合下可达到的效果”,而非针对未来未知技术的上限。

防御建议

  • 叠加防御,不要只依赖一种。 将输入防护与独立的输出防护结合使用,而不是仅依赖单一阶段——论文显示,在相近的可用性代价下,跨阶段组合始终优于任何单阶段组合。
  • 根据风险承受能力选择组合方案。 CASCADE 的结果给出了具体配置:安全优先型(约95%的ASR降幅,约11%的可用性损失)、均衡型,以及可用性优先型(约82%的ASR降幅,约7%的可用性损失)——应根据误拒绝对产品造成的成本来选择。
  • 每次模型或防御版本更新后都应重新测试。 ASR降幅数字对应的是2026年9月评估时的具体模型和防御版本;供应商侧的模型更新或防御库更新都可能在没有预警的情况下改变这些数字。
  • 不要假设单项基准分数可以直接叠加推广。 某个防御措施单独发布的ASR降幅,并不能与另一防御措施单独的分数简单相加;在信任组合估计之前,应在自己的真实流量和攻击组合下实际测量该组合的效果。

状态

项目状态
论文arXiv 预印本 2609.21793,提交于2026年9月18日,CC BY 4.0 许可
同行评审尚未完成(预印本阶段)
评估模型数量共9个(3个开源权重模型,6个专有模型),包括 GPT-5.4-mini、Claude Sonnet 4、Gemini 3.1 Flash-Lite
测试攻击/防御数量19种攻击 x 15种防御
最佳报告结果95.4% 的ASR降幅,可用性损失 -11.5%(跨阶段组合)

以上数据均直接来自论文报告的实验结果;实际生产环境中的效果会因模型版本、流量构成和攻击组合的不同而变化。

Sources