返回行业动态
研究前沿

OpenAI 确认 Astra 达到「关键级」网络安全能力:首个触发最高安全评级的模型,发布将受限

OpenAI 于 9 月 1 日宣布,其即将推出的模型 Astra 在其《准备框架》评估下达到「关键级」(Critical)网络安全能力阈值,成为该公司首个获此最高评级的模型。OpenAI 表示,Astra 在自主发现未知漏洞并构建利用链方面的表现显著超越此前最高评级为「高级」的 GPT-5.6 Sol:在 ExploitBench 上取得满分,在内部基准评估中还发现并使用了两个零日漏洞。OpenAI 计划很快发布 Astra,但最先进的网络安全能力将先向特定测试者开放,并通过面向防御方的 Daybreak Blue 项目逐步扩展,同时对模型实施更强的拒答训练与思维链监控。此举标志着前沿 AI 安全治理进入新阶段,对企业评估 AI 供应链安全与自身防御准备具有直接参考意义。

来源:OpenAI原标题:Path to Astra: critical capabilities and frontier safeguards查看原文
深蓝色科技背景插画:由发光代码线条构成的盾牌与神经网络图形,周围环绕数据流、锁形符号与网络节点,红蓝光效象征网络攻防与安全防护

图片来源:北京拓实科技原创(AI 生成)

发生了什么

OpenAI 于 2026 年 9 月 1 日发布公告,确认其即将推出的模型 Astra 达到公司《准备框架》(Preparedness Framework)定义的「关键级」网络安全能力阈值,这是 OpenAI 首次将任何模型评定为这一最高级别。根据该框架,达到关键级意味着模型在获得相应工具与权限后,能够在无人逐步引导的情况下,于多个防护完善的关键系统中发现未知漏洞并开发利用方式;或仅凭一个高层级目标,即可设计并执行端到端的新型攻击策略。此前包括 GPT-5.6 Sol 在内的所有 OpenAI 模型均被评定为低一级的「高级」(High)水平。OpenAI 特别说明,Astra 未参与此前披露的 Hugging Face 测试环境事件。

评估结果与关键数据

  • 在漏洞利用基准 ExploitBench 上取得 100% 满分;为排除数据污染,OpenAI 另建含 20 个近期披露的高危 V8 漏洞的内部基准,Astra 的任意代码执行率大幅高于 GPT-5.6 Sol,且消耗的输出 token 显著更少
  • 评估过程中,Astra 发现并使用了两个此前未知的零日漏洞作为利用链的一部分,OpenAI 正在向相关维护方披露
  • 在专家主导的对加固浏览器与操作系统的测试中,Astra 构建了可逃逸沙箱并在宿主机执行命令的完整浏览器攻破链,以及从非特权用户提权至 root 的本地权限提升链
  • 上述结果反映的是 Astra 在 Daybreak Blue 权限下的能力,并非默认生产配置的表现

安全措施与发布安排

OpenAI 表示已针对这一能力等级强化开发与发布前的安全控制,包括隔离测试环境、限制网络与工具访问、加强模型权重保护与加密,以及对所有智能体应用实施思维链监控以发现并中断高风险活动。公司计划「很快」让 Astra 可用,但其最先进的网络安全能力将采取受限发布策略:初期仅向一组测试者开放,随后通过面向防御方的 Daybreak Blue 项目扩展防御性用途。据 WIRED 报道,思科、Cloudflare 与 Palo Alto Networks 等 Daybreak 项目合作伙伴将获得较早期访问权限,以便在同类模型广泛可用前加固自身防御;OpenAI 还称 Astra 在安全测试中对不当请求的拒答率显著高于前代模型。

意义与不确定性

这是前沿 AI 实验室首次依据自主制定的安全框架,将一款模型正式评定为最高风险等级并据此调整发布节奏,标志着「先评估能力、再决定准入」的治理模式进入实操阶段,也可能成为行业后续发布高风险模型的参照。对企业而言,该事件提示两个方向:一是 AI 驱动的自动化漏洞发现正从理论走向现实,未充分落实补丁与加固流程的组织面临更紧迫的暴露风险;二是企业在评估 AI 供应商时,需关注其对高风险能力的准入与监控机制。需要指出的是,相关能力评估目前主要基于 OpenAI 的内部测试,尚未经第三方独立复现;Astra 的最终发布形态、系统卡披露的安全细节以及监管机构的参与程度,仍有待观察。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。