2026年夏季AI安全指数:九家实验室的安全与风险评分
生命未来研究所2026年7月的指数依据37项安全指标为九家前沿实验室打分。没有一家超过C+,安全框架仍缺乏约束力。
What is this?
2026年7月7日,生命未来研究所(Future of Life Institute,FLI)发布了AI Safety Index — Summer 2026 Edition,这是该系列为前沿AI企业的安全实践评分的第四期。它并非漏洞报告,而是一份成绩单:由七位研究者和治理专家组成的独立评审组,对九家领先实验室——Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、DeepSeek、Alibaba Cloud与Z.ai——在六大领域下的37项指标上给出评级。
核心结论是:没有一家表现优异。7月14日定稿的完整报告将Anthropic列为榜首,评级为C+(在4.0的GPA制中为2.66),OpenAI为C(2.28),Google DeepMind为C(2.01)。Meta获得D+,两家有公开评级的中国实验室(Z.ai与Alibaba Cloud)为D-,而xAI、DeepSeek与Mistral均为不及格。证据的收集截至2026年6月3日,因此评级反映的是2026年年中的状况,而非实时快照。
How the index scores labs
六大领域分别是风险评估(Risk Assessment)、当前危害(Current Harms)、安全框架(Safety Frameworks)、生存性安全(Existential Safety)、治理与问责(Governance & Accountability)以及信息共享(Information Sharing)。对安全从业者而言,值得关注的指标是具体的而非空泛的:面向系统漏洞的漏洞赏金计划、部署前的外部安全测试、对安全评估的独立复核、带诱导的危险能力评估、防止微调破坏防护措施、重大事件响应、用户隐私,以及向监管机构报告严重事件。这些正是一个成熟的供应商安全计划所要考察的控制项。
如果你想引用该指数,方法论很重要。评审组审阅了公开材料——模型卡、研究论文、基准测试结果——并辅以一份针对透明度盲区(如举报人保护与外部评估)的定向问卷。评审员依据绝对标准逐领域给出评级并附书面理由,随后对分数取平均;个人评级保持保密。这是专家判断,而非自动化基准,因此其价值在于推理与建议,而非某个单一数字。
Anthropic在六个领域中领先五个,主要凭借其透明度(同时公开模型规格与系统提示词)以及一个相对完善的安全框架;OpenAI则凭借更广泛的外部测试,在风险评估领域领先。整个行业最薄弱的领域是生存性安全,没有一家企业超过C-,多数停留在D或更低。
Why it matters
有两项发现应引起所有依赖这些系统者的警惕。其一,评审组认为安全框架缺乏约束力:即便是那些在欧美合规期限临近时发布或更新框架的实验室,往往也缺少量化阈值、真正独立的审计,以及一个有明确权力叫停部署的内部机构。其二,多家头部企业已在”逼近能力红线即暂停”的承诺上出现倒退,评审员称之为”移动球门”,认为它”在整个行业范围内削弱了安全框架”。
对防御方而言,该指数之所以有用,恰恰因为它对厂商保持中立且论证充分。它为安全与采购团队提供了一个外部参照,用以反驳营销话术,并点明了言辞与实际行为之间的落差:报告指出,多家实验室令人安心的公开表态,与其商业行为和立法立场存在分歧。正如评审组成员Stuart Russell所言,企业越来越倾向于”即便明显不安全也照样发布[系统]“。
Defenses
这类报告的实际用途,是作为供应商风险评估的输入。核心主线是:相信证据,而非承诺。
- 将各领域映射到你自己的控制项。 把风险评估与信息共享视为供应商红队成熟度与事件透明度的间接指标,并按你的用例赋予权重。
- 索取指数指出所缺失的内容。 要求量化的能力阈值、具名的独立审计方,以及有权叫停发布的内部机构——而不只是一份框架文件。
- 核查防护措施的持久性。 确认供应商如何保护其安全防护措施免受微调与API滥用的破坏,这是指数中明确列出的指标之一。
- 验证事件与披露渠道。 在将模型接入敏感工作流之前,要求其作出严重事件报告承诺,并具备可用的漏洞赏金或披露渠道。
- 每期重新核查。 评级会在各期之间变动(Meta上升,xAI下滑);使用趋势而非单一快照,并在续约时重新评估。
Status
| 方面 | 详情 |
|---|---|
| 发布方 | 生命未来研究所(FLI) |
| 发布时间 | 2026年7月7日(完整报告定稿于7月14日) |
| 范围 | 9家实验室,37项指标,6个领域 |
| 证据截止 | 2026年6月3日 |
| 最高评级 | Anthropic — C+(2.66 / 4.0) |
| 不及格评级 | xAI、DeepSeek、Mistral |
| 类型 | 独立安全评估,而非漏洞公告 |
要点并非一项新攻击,而是一个被明确摆上台面的度量问题:按评审组的解读,企业为自己设定的安全承诺,并不能可靠地反映其实际安全水平。该指数为采购方与防御方提供了一种结构化、有据可查的方式,让他们在依赖某个模型之前先审视这一落差。
Sources
- → https://futureoflife.org/ai-safety-index-summer-2026/
- → https://futureoflife.org/wp-content/uploads/2026/07/AI-Safety-Index-Summer-2026-Digital-14-Jul.pdf
- → https://time.com/article/2026/07/07/ai-safety-rankings-openai-anthropic-meta/
- → https://www.techtimes.com/articles/320959/20260719/ai-safety-grades-are-no-lab-tops-c-best-ones-are-retreating.htm