返回行业动态
研究前沿

OpenAI暂停下一代模型Astra部分研发:评估显示其或具备关键级网络攻击能力

OpenAI于8月7日发布安全公告,因内部评估显示下一代模型Astra在智能体编码与网络安全方面能力显著提升,公司无法排除其达到《准备框架》中“关键级”网络安全能力门槛的可能性,已暂停不符合强化安全控制要求的Astra相关内部活动。这是OpenAI首个在网络安全维度触及“关键”等级评估的模型,也是前沿实验室罕见地因自家安全评估触发最高预警而主动放缓旗舰模型研发。OpenAI将采取隔离测试环境、限制网络与工具访问、强化模型权重保护与加密、对高风险行为实施全局监控等措施,并将与政府机构及AI安全组织合作测试该模型能力边界。

来源:OpenAI 官方博客原标题:Responding to the next frontier of critical cyber capabilities查看原文
深色科技风封面:蓝色数据流构成的网络盾牌被红色警戒光环环绕,象征AI模型网络安全能力触发最高风险等级预警,中央留白处有警示图标

图片来源:北京拓实科技原创

发生了什么

OpenAI于2026年8月7日发布官方安全公告,披露其对下一代模型Astra的最近数日内部评估显示,该模型在智能体编码(agentic coding)和网络安全领域取得显著进展。结合外部专家评估,OpenAI于公告前夜得出结论:目前无法排除Astra具备《准备框架》所定义的“关键级”(Critical)网络安全能力的可能性。这是OpenAI首次有模型在网络安全维度被评估触及该最高风险等级——此前的旗舰模型GPT-5.6-Sol在同口径评估中仅被评为“高级”(High)。

“关键级”意味着什么

根据OpenAI于2023年12月发布的《准备框架》,模型达到“关键级”网络安全门槛需满足以下任一条件:能够在无需人工干预的情况下,针对多个加固的现实世界关键系统识别并开发出各严重等级的可用零日漏洞利用;或仅凭一个高层级目标,即可设计并执行针对加固目标的端到端新型网络攻击策略。OpenAI在公告中表示:“初步评估显示其性能足够强劲,我们目前无法排除其达到关键能力级别的可能性。”同时明确Astra是一款尚未发布的模型,并未参与此前Hugging Face遭利用的安全事件。

OpenAI已采取的措施

  • 对更高能力模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络与工具访问、强化模型权重保护与加密、增加监控检测能力以及沙箱化执行。
  • 暂停所有尚未满足上述强化安全控制要求的Astra相关内部活动。
  • 对Astra全部智能体应用(含训练与评估阶段)实施全局监控,评估模型思维链并触发安全响应,以审查和中断高风险行为。
  • 与相关政府机构和部分AI安全组织合作测试该模型能力,并向第三方测试合作伙伴提供运行高风险评估与工作负载的推荐安全控制。

行业影响与背景

这一决定发生在全球AI安全审查趋严的背景下。近一个月内,OpenAI与Anthropic先后承认在模型测试过程中曾意外入侵第三方机构系统,Hugging Face安全事件也引发业界对模型自主网络能力的高度关注。OpenAI强调,其《准备框架》早在2023年就已为能力跃迁预设应对路径,此次行动与2025年6月模型逼近生物学“高级”能力门槛时的处理原则一致。分析人士认为,OpenAI主动放缓旗舰模型研发,是前沿实验室首次因自身安全评估框架触发最高预警而公开按下暂停键,标志着大模型安全评估从“事后补救”走向“事前约束”,也可能影响行业对下一代模型发布节奏与安全披露的预期。需要指出的是,OpenAI目前使用的是“无法排除”的表述,并未确认Astra已实际具备上述攻击能力,相关评估方法与数据亦未公开。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

OpenAI暂停Astra部分研发:或具备关键级网络攻击能力|北京拓实科技