发生了什么
Anthropic 于 8 月 29 日公布其自动化对齐研究员系统。该系统由 Anthropic 研究员陈岳翰(Chen Yueh-Han)主导,能够自动搜索学术文献、提出解决方案,并以 30 分钟为周期对模型进行迭代微调,全程无需人工监督即可修复模型的对齐失败问题。
在测试中,该系统在 10 项基准任务上的平均表现达到或超过了人类对齐研究团队,平均耗时约 6 小时。成本方面,人类专家进行对齐研究的费用约为每小时 150 美元,而自动化系统将这一成本压缩至每小时 4 美元。
- 系统覆盖文献检索、方案生成、模型微调、结果验证的完整闭环
- 30 分钟迭代周期支持多轮自主改进,无需人工介入
- 10 项基准测试中表现与人类团队持平或更优
为什么重要
对齐研究是 AI 安全领域最昂贵、最依赖顶尖人才的方向之一。自动化对齐研究员的出现意味着:当 AI 能力快速演进时,安全验证不再受限于稀缺的人类专家资源,对齐工作本身开始被规模化。这对整个行业的安全治理节奏具有深远影响。
对企业而言,模型供应商安全能力的自动化程度,将直接影响采购决策中「安全可信」这一维度的评估权重。
仍待观察
自动化系统在基准测试中的优势能否在真实、复杂的对齐难题上复现,仍是未知数。Anthropic 尚未公布该系统在远超当前能力边界的新兴风险场景中的表现数据。

