返回行业动态
研究前沿

OpenAI Astra模型「不透明循环」推理技术引发安全警报:专家称或为AI安全最严重倒退

OpenAI即将发布的Astra模型采用「循环深度」推理技术,将推理过程隐藏在内部循环中,AI安全专家警告这可能彻底破坏思维链可监控性。

来源:TechCrunch原标题:OpenAI's new reasoning technique alarms AI safety experts查看原文
AI安全概念,黑盒带问号,神经网络可视化部分被遮挡,红黄警告信号

图片来源:AI生成(通义万相)

发生了什么

9月2日,The Information率先披露OpenAI即将发布的Astra模型采用了一种名为「循环深度」(Recurrent Depth)或「不透明循环」(Opaque Recurrence)的推理技术,引发AI安全界强烈震动。该技术允许模型在内部反复循环同一组Transformer层进行推理,而非以传统的思维链形式逐步输出推理过程。

技术原理

传统推理模型采用「边想边说」的方式:每一步推理都留下文字记录(思维链/Chain of Thought),安全研究员可以监控这条链条,检查模型是否偏离正轨。而Astra的循环深度技术将大部分推理过程隐藏在模型内部的隐状态中,不产生可读的中间文本,使安全审计和思维链监控面临失效风险。

安全专家反应

AI安全组织Redwood Research首席执行官巴克·施莱格里斯表示「极度担忧」:「如果OpenAI进一步推进这项技术,大幅增加循环次数,将彻底破坏思维链的可监测性。」首席科学家瑞安·格林布拉特更直言这可能是「AI安全领域迄今为止最糟糕的一次倒退」。

OpenAI回应

OpenAI首席科学家雅库布·帕乔基随后回应称,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,模型架构并未出现跳跃式的复杂度增长。他强调OpenAI从一开始就致力于维护和利用思维链监控,希望避免因信息失实引发一场冲向不可监控状态的军备竞赛。

行业影响

然而安全专家的担忧并未因此平息。长期关注AI安全的兹维·莫肖维茨批评这一技术是「玩火」,并建议可能需要立法来阻止AI公司之间的「逐底竞争」——各家为了性能竞相采用更不透明的架构,谁透明谁吃亏。

更令人不安的是,The Information报道称Anthropic和Google DeepMind也在讨论类似技术。如果循环深度被行业广泛采用,思维链监控这一AI安全领域最重要的实操工具之一将面临系统性瓦解。值得注意的是,Astra是首个达到OpenAI「严重」级网络安全能力阈值的模型,能自主发现并利用零日漏洞——一个如此强大的模型配上难以审计的推理过程,正是安全研究者最担心的组合。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

OpenAI Astra「不透明循环」推理技术引发安全警报|北京拓实科技