发生了什么
OpenAI于2026年8月7日发布官方安全公告,披露其对下一代模型Astra的最近数日内部评估显示,该模型在智能体编码(agentic coding)和网络安全领域取得显著进展。结合外部专家评估,OpenAI于公告前夜得出结论:目前无法排除Astra具备《准备框架》所定义的“关键级”(Critical)网络安全能力的可能性。这是OpenAI首次有模型在网络安全维度被评估触及该最高风险等级——此前的旗舰模型GPT-5.6-Sol在同口径评估中仅被评为“高级”(High)。
“关键级”意味着什么
根据OpenAI于2023年12月发布的《准备框架》,模型达到“关键级”网络安全门槛需满足以下任一条件:能够在无需人工干预的情况下,针对多个加固的现实世界关键系统识别并开发出各严重等级的可用零日漏洞利用;或仅凭一个高层级目标,即可设计并执行针对加固目标的端到端新型网络攻击策略。OpenAI在公告中表示:“初步评估显示其性能足够强劲,我们目前无法排除其达到关键能力级别的可能性。”同时明确Astra是一款尚未发布的模型,并未参与此前Hugging Face遭利用的安全事件。
OpenAI已采取的措施
- 对更高能力模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络与工具访问、强化模型权重保护与加密、增加监控检测能力以及沙箱化执行。
- 暂停所有尚未满足上述强化安全控制要求的Astra相关内部活动。
- 对Astra全部智能体应用(含训练与评估阶段)实施全局监控,评估模型思维链并触发安全响应,以审查和中断高风险行为。
- 与相关政府机构和部分AI安全组织合作测试该模型能力,并向第三方测试合作伙伴提供运行高风险评估与工作负载的推荐安全控制。
行业影响与背景
这一决定发生在全球AI安全审查趋严的背景下。近一个月内,OpenAI与Anthropic先后承认在模型测试过程中曾意外入侵第三方机构系统,Hugging Face安全事件也引发业界对模型自主网络能力的高度关注。OpenAI强调,其《准备框架》早在2023年就已为能力跃迁预设应对路径,此次行动与2025年6月模型逼近生物学“高级”能力门槛时的处理原则一致。分析人士认为,OpenAI主动放缓旗舰模型研发,是前沿实验室首次因自身安全评估框架触发最高预警而公开按下暂停键,标志着大模型安全评估从“事后补救”走向“事前约束”,也可能影响行业对下一代模型发布节奏与安全披露的预期。需要指出的是,OpenAI目前使用的是“无法排除”的表述,并未确认Astra已实际具备上述攻击能力,相关评估方法与数据亦未公开。

