发生了什么
OpenAI 于 2026 年 9 月 1 日发布公告,确认其即将推出的模型 Astra 达到公司《准备框架》(Preparedness Framework)定义的「关键级」网络安全能力阈值,这是 OpenAI 首次将任何模型评定为这一最高级别。根据该框架,达到关键级意味着模型在获得相应工具与权限后,能够在无人逐步引导的情况下,于多个防护完善的关键系统中发现未知漏洞并开发利用方式;或仅凭一个高层级目标,即可设计并执行端到端的新型攻击策略。此前包括 GPT-5.6 Sol 在内的所有 OpenAI 模型均被评定为低一级的「高级」(High)水平。OpenAI 特别说明,Astra 未参与此前披露的 Hugging Face 测试环境事件。
评估结果与关键数据
- 在漏洞利用基准 ExploitBench 上取得 100% 满分;为排除数据污染,OpenAI 另建含 20 个近期披露的高危 V8 漏洞的内部基准,Astra 的任意代码执行率大幅高于 GPT-5.6 Sol,且消耗的输出 token 显著更少
- 评估过程中,Astra 发现并使用了两个此前未知的零日漏洞作为利用链的一部分,OpenAI 正在向相关维护方披露
- 在专家主导的对加固浏览器与操作系统的测试中,Astra 构建了可逃逸沙箱并在宿主机执行命令的完整浏览器攻破链,以及从非特权用户提权至 root 的本地权限提升链
- 上述结果反映的是 Astra 在 Daybreak Blue 权限下的能力,并非默认生产配置的表现
安全措施与发布安排
OpenAI 表示已针对这一能力等级强化开发与发布前的安全控制,包括隔离测试环境、限制网络与工具访问、加强模型权重保护与加密,以及对所有智能体应用实施思维链监控以发现并中断高风险活动。公司计划「很快」让 Astra 可用,但其最先进的网络安全能力将采取受限发布策略:初期仅向一组测试者开放,随后通过面向防御方的 Daybreak Blue 项目扩展防御性用途。据 WIRED 报道,思科、Cloudflare 与 Palo Alto Networks 等 Daybreak 项目合作伙伴将获得较早期访问权限,以便在同类模型广泛可用前加固自身防御;OpenAI 还称 Astra 在安全测试中对不当请求的拒答率显著高于前代模型。
意义与不确定性
这是前沿 AI 实验室首次依据自主制定的安全框架,将一款模型正式评定为最高风险等级并据此调整发布节奏,标志着「先评估能力、再决定准入」的治理模式进入实操阶段,也可能成为行业后续发布高风险模型的参照。对企业而言,该事件提示两个方向:一是 AI 驱动的自动化漏洞发现正从理论走向现实,未充分落实补丁与加固流程的组织面临更紧迫的暴露风险;二是企业在评估 AI 供应商时,需关注其对高风险能力的准入与监控机制。需要指出的是,相关能力评估目前主要基于 OpenAI 的内部测试,尚未经第三方独立复现;Astra 的最终发布形态、系统卡披露的安全细节以及监管机构的参与程度,仍有待观察。

