FLI发布AI安全指数,全球模型没有超过C+
nthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。Future of Life Institute未来生命研究所简称FLI发布了2026年夏季AI安全指数。而且拿到C的那家公司刚刚悄悄收回了自己曾经许下的安全承诺。与此同时OpenAI在7月15日发布了一款叫GPT-Red的自动红队测试工具攻击成功率84%远超人类红队测试员的13%。工具在进步治理在退步。成绩单FLI的AI安全指数到2026年夏季已经是第4期覆盖公司从2024年的6家扩展到了9家。评估维度有6个细分指标37项由7位独立专家组成的评审团打分采用美国GPA体系A对应4.0F对应0。9家公司的最终成绩如下AnthropicC2.66分连续3期排名第一在6个维度中的5个领跑。评审团认可了它在透明度、模型规格文档发布、危险能力评估方面的表现以及Responsible Scaling Officer负责任扩展官这一治理架构。OpenAIC2.28分比2025年冬季版的C有所下降。评审团肯定了它在风险评估领域的进步评估套件更全面外部安全测试的参与也更广泛。Google DeepMindC2.01分与上期持平。更新后的Frontier Safety Framework前沿安全框架新增了操控、失对齐和内部部署风险的覆盖水印保护也做得扎实。MetaD1.32分是本期唯一一条上升曲线。从D升到D排名从第6升到第4原因是发布了更详细的安全框架加入了威胁建模并把漏洞赏金计划扩展到了灾难性风险因素。Z.aiD-0.88分。Alibaba CloudD-0.87分。有点好笑的是两家中国公司的安全策略在评审团看来竟然是因为要遵守我国2025年10月修订的《网络安全法》、2021年的《数据安全法》、以及2023年的《生成式AI暂行办法》。评审团把这种策略称为完全被动。xAIF0.65分本期跌幅最大。从第4掉到第7从D直接降到F。评审团找不到有意义的安全团队找不到对存在性安全的任何投入危险能力评估存在巨大漏洞包括完全没有评估AI研发风险。报告还提到xAI的Grok曾生成儿童性虐待材料以及真实人物包括未成年人的非自愿性化图像。xAI在指数中没有列出任何进展亮点。DeepSeekF0.47分。MistralF0.33分。3个不及格美国、中国、欧洲各一家。评审团特意指出这个分布反驳了AI安全差是某个地区的问题这种说法。Mistral垫底被点名为一种讽刺评审团认为欧盟在AI安全监管上一直走在前面。截至证据窗口关闭DeepSeek和Mistral都没有发布过安全框架。7位评审专家分别来自UC Berkeley加州大学伯克利分校、University of Montreal蒙特利尔大学、HEC Montréal蒙特利尔高等商学院、University of Wisconsin-Madison威斯康星大学麦迪逊分校、Oxford University牛津大学、Renmin University of China中国人民大学和Encode。没有一家公司为评估付过费。承诺在缩水排名本身不是最要命的。最要命的是排名靠前的公司正在把以前说过的话收回去。Anthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。评审团给这个模式起了个名字叫moving the goalposts移动球门。结论是这种做法全面削弱了安全框架。UC Berkeley的Stuart Russell教授是7位评审之一他的原话是行业里确实有人在做AI安全方面的好工作但能力竞赛已经变得更加极端。企业已经放弃了早先的承诺不再坚持只在安全措施匹配能力水平时才发布新系统。现在即便能证明发布是不安全的他们也打算照发不误。具体到Anthropic评审团点名批评了Responsible Scaling Policy负责任扩展政策3.0版本认为它稀释了早期的暂停承诺。暂停条件一旦变成取决于竞争对手的选择就没有任何一方有动力先停下来政策的实际约束力就归零了。OpenAI的情况更复杂。在证据收集窗口截至2026年6月3日关闭之后OpenAI把安全团队并入了研究部门取消了独立汇报线。TechTimes把这报道为OpenAI两年内第6位高级安全人员离职。这件事没有被计入评分但方向很明确。评审团还建议OpenAI取消领导层对Safety Advisory Group安全咨询组的否决权并要求安全框架的阈值可量化、可外部执行。对Google DeepMind评审团的疑问是到底哪个内部机构有权在不经 executive leadership高管层批准的情况下独立叫停一次部署Meta那边评审团担心非贬损协议可能正在侵蚀其声称的吹哨人保护。看见悬崖没修护栏整个指数中得分最低的领域是Existential Safety存在性安全。没有一家公司超过C-大多数落在D或以下。评审团承认了一些零散的努力。Anthropic的constitutional classifiers宪法分类器OpenAI对全球AI治理机构的呼吁Google DeepMind的监控承诺Meta针对失控的预防措施。但总体评价是“完全不够”。评审团最具技术含量的一条批评直接指向了行业主流安全范式。Interpretability可解释性研究和Chain-of-Thought思维链可监控性是大多数AI公司最核心的安全投资方向。评审团从架构层面提出了质疑detection is not prevention检测不等于预防。思维链可监控性让模型的推理过程变得可见人类可以发现不对齐的思维。但检测是事后的。一条不对齐的推理链被捕捉到的时候模型已经输出了结果甚至已经执行了动作。一个在问题发生后才发出警报的监控系统提供的是问责不是安全。OpenAI在7月15日发布的GPT-Red恰好印证了这种张力。GPT-Red是一个自动化红队测试模型通过self-play reinforcement learning自博弈强化学习训练。红队模型和一组防御模型同时训练GPT-Red的奖励是成功发起攻击比如成功的prompt injection提示注入防御模型的奖励是抵抗住攻击。结果在GPT-5.1的新颖场景中GPT-Red的攻击成功率84%人类红队测试员只有13%。这些攻击随后被用来加固GPT-5.6 Sol把它的直接提示注入失败率压到了0.05%。这是用对抗性AI在部署前找到并封堵特定漏洞类别的安全工程。但它仍然是针对已知攻击面的检测加固系统不是面向大规模失对齐的预防架构。University of Montreal的David Krueger教授也是评审之一他写道AI公司在制定可信AI安全计划方面缺乏进展令人震惊。连他们自己都开始焦虑了一边冲向递归自我改进一边面对失控的可能性。军事AI集体转向指数中另一个突出发现涉及军事应用。2024年到2026年间Anthropic、OpenAI、Google DeepMind、Meta这4家此前限制或禁止军事应用的公司全部调转方向开始积极争取国防合同。它们加入了xAI和Mistral的行列后两家本来就在做这方面业务。这个转向产生了具体的评分后果。Anthropic在Current Harms当前危害领域下的Military Use of AIAI军事使用子指标上拿了不及格。评审团引用了它与Minab学校空袭事件的reported connection即被报道的关联。那次空袭造成了大规模平民死亡。FLI在报告中明确标注这是评审团关于一个被报道的关联的发现不是对法律责任的认定。最后说几句关于这份指数本身的局限。它评估的是实验室的政策、治理结构、信息披露和已发布的技术框架不是部署产品的实际表现或用户体验。一家公司可以因为文档写得全面而拿高分也可以因为什么都没发布而拿低分。Anthropic的C说的是它的文档化安全实践、治理结构和透明度在同行中相对较强而整个行业至今没有建立起可外部执行的最低标准。

相关新闻

作文自动批改系统:语法、逻辑、文采的分层评价体系

作文自动批改系统:语法、逻辑、文采的分层评价体系

作文自动批改系统:语法、逻辑、文采的分层评价体系 一、个性化深度引言 批改一篇 800 字的作文,人类老师大约需要 5-10 分钟。这对于同时教两个班共 100 名学生的语文老师来说,每次批改作业就是 8-16 个小时的工作量。而这还没算上给出有针对…

2026/7/21 23:49:15 阅读更多 →
知识追踪模型训练:学生行为序列的建模与评估

知识追踪模型训练:学生行为序列的建模与评估

知识追踪模型训练:学生行为序列的建模与评估 一、个性化深度引言 传统考试能告诉你"某个学生在某个时刻答对了几道题",但无法回答"这个学生掌握了哪些知识点,未来遇到类似题目有多大把握做对"。 知识追踪(Kno…

2026/7/21 23:49:15 阅读更多 →
零基础入门 UDS 诊断|一文吃透 0x11 ECU 复位服务(报文格式 + 核心测试点全解析)

零基础入门 UDS 诊断|一文吃透 0x11 ECU 复位服务(报文格式 + 核心测试点全解析)

很多刚接触 ISO 14229 UDS 协议的小伙伴,人生中第一条调试的诊断服务,大概率都是 0x11 ECU 复位。毕竟 “不行就重启” 是刻在所有工程师 DNA 里的万能操作。但如果你以为 0x11 服务就只是 “发个指令让 ECU 重启” 这么简单,那可就错过它的核…

2026/7/21 23:49:15 阅读更多 →

最新新闻

AI助手技能包开发实战:提升项目协作效率

AI助手技能包开发实战:提升项目协作效率

1. 项目概述:用Skill技能包武装你的AI助手最近在AI开发者圈里流行起一个概念:Skill技能包。简单来说,这就是给AI助手准备的"专业能力扩展包",相当于给AI安装了一个个功能模块。想象一下,你新招了个实习生&am…

2026/7/22 1:50:32 阅读更多 →
软考高项论文写作技巧与49个过程组实战应用

软考高项论文写作技巧与49个过程组实战应用

1. 软考高项论文写作痛点解析每次软考高项考试季,总有一批考生卡在论文这个"拦路虎"上。作为参加过三次高项评审的老兵,我见过太多考生在论文环节翻车——不是内容空洞就是结构混乱,甚至有人交白卷。最让人痛心的是,这些…

2026/7/22 1:50:32 阅读更多 →
HarmonyOS掌上记账APP开发实践第56篇:模块化路由设计:RouterMap 枚举驱动的导航解耦

HarmonyOS掌上记账APP开发实践第56篇:模块化路由设计:RouterMap 枚举驱动的导航解耦

056 — 模块化路由设计:RouterMap 枚举驱动的导航解耦简介 在多模块工程中,页面导航是一个易于被忽视但却影响深远的架构决策。如果每个页面直接引用目标页面的路径字符串,一旦路径变更(如模块重构、包名修改)&#xf…

2026/7/22 1:50:32 阅读更多 →
嵌入式C语言设计模式实现与优化实践

嵌入式C语言设计模式实现与优化实践

1. 嵌入式C语言设计模式实现的核心思路在嵌入式开发领域,设计模式的应用一直是个有趣的话题。很多人认为设计模式是面向对象语言的专利,其实通过结构体(struct)和函数指针的巧妙组合,我们完全可以在C语言中实现23种经典设计模式。这种实现方式…

2026/7/22 1:50:32 阅读更多 →
UE5 Niagara粒子系统:5分钟打造电影级爆炸特效实战指南

UE5 Niagara粒子系统:5分钟打造电影级爆炸特效实战指南

1. 项目概述:从新手到电影级的快速通道刚接触虚幻引擎5,看到那些大片里才有的爆炸、火焰、烟雾特效,是不是觉得既酷炫又遥不可及?总感觉那是资深TA(技术美术)或者特效师才能玩转的领域,自己光是…

2026/7/22 1:50:32 阅读更多 →
Elasticsearch+Kibana构建电商数据实时分析系统

Elasticsearch+Kibana构建电商数据实时分析系统

1. 项目背景与核心价值ElasticsearchKibana这套技术栈在数据处理和可视化领域已经成为了行业标配。我最近帮一个电商客户搭建了爬虫数据展示系统,他们需要实时监控竞品价格波动和用户评论情感倾向。传统数据库Excel的方案根本无法应对每天百万级的数据增量&#xff…

2026/7/22 1:49:32 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻