返回行业动态
研究前沿

Anthropic 推出自动化对齐研究员:AI 安全研究成本从每小时 150 美元降至 4 美元

Anthropic 公布了自动化对齐研究员系统:由研究员陈岳翰领导的系统可自主检索学术文献、提出解决方案并以 30 分钟为周期迭代微调模型,无需人工监督即可修复模型对齐失败。在 10 项基准测试中,该系统平均用 6 小时达到或超过人类对齐团队的水平,研究成本从每小时 150 美元降至 4 美元。

来源:Anthropic 官方原标题:Anthropic unveils Automated Alignment Researcher查看原文
机器手臂与人类大脑在安全盾牌下协作的科技插画

图片来源:Anthropic

发生了什么

Anthropic 于 8 月 29 日公布其自动化对齐研究员系统。该系统由 Anthropic 研究员陈岳翰(Chen Yueh-Han)主导,能够自动搜索学术文献、提出解决方案,并以 30 分钟为周期对模型进行迭代微调,全程无需人工监督即可修复模型的对齐失败问题。

在测试中,该系统在 10 项基准任务上的平均表现达到或超过了人类对齐研究团队,平均耗时约 6 小时。成本方面,人类专家进行对齐研究的费用约为每小时 150 美元,而自动化系统将这一成本压缩至每小时 4 美元。

  • 系统覆盖文献检索、方案生成、模型微调、结果验证的完整闭环
  • 30 分钟迭代周期支持多轮自主改进,无需人工介入
  • 10 项基准测试中表现与人类团队持平或更优

为什么重要

对齐研究是 AI 安全领域最昂贵、最依赖顶尖人才的方向之一。自动化对齐研究员的出现意味着:当 AI 能力快速演进时,安全验证不再受限于稀缺的人类专家资源,对齐工作本身开始被规模化。这对整个行业的安全治理节奏具有深远影响。

对企业而言,模型供应商安全能力的自动化程度,将直接影响采购决策中「安全可信」这一维度的评估权重。

仍待观察

自动化系统在基准测试中的优势能否在真实、复杂的对齐难题上复现,仍是未知数。Anthropic 尚未公布该系统在远超当前能力边界的新兴风险场景中的表现数据。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

Anthropic 自动化对齐研究员:安全研究成本降至每小时 4 美元|北京拓实科技