Anthropic reports automated AI researchers mitigate alignment failures across all 10 benchmarks
Anthropic released a report on its Automated Alignment Researcher (AAR) project, where Claude agents autonomously search papers, propose methods, generate data, and train models to fix alignment failures. The system improved performance on all 10 misalignment benchmarks without degrading overall performance, and outperformed human researchers on some tasks at a fraction of the cost.
Coverage timeline
TechCrunch AIRussell Brandom
Given 10 benchmarks for specific misaligned behaviors, the automated systems were able to improve performance on every single one without degrading overall performance.
Anthropic Research
Aug 28, 2026AlignmentAutomated researchers can reliably mitigate alignment failures
机器之心机器之心
编辑|Panda 今年 6 月,Anthropic 发表了一篇叫《When AI builds itself》的文章,介绍了让「AI 参与造 AI」:从人类手写全部代码,到聊天机器人辅助编程,到自主编程智能体,到智能体调度智能体,最末端是「闭环」,即 由智能体来设计和训练它的后继模型 。 Anthropic 说自己已经走得相当靠前:截至 2026 年 5 月,合入其生产代码库的代码有 超过 80% 由 Claude 撰写。但那篇文章同时给出了一个明确的界限:系统在执行上走得很远,仍然卡在 研究方向的设定 上,也就是说,AI 还无法决定哪些问题值得做。 8 月 28 日,Anthropic 发布了一份新报告,探索了这个新方向。 Anthropic 请来 28 位人类 AI 安全研究者,全部有至少一年技术性安全研究经验、平均 2.5 年,且在对应课题上发表过论文,每人最多八小时构思一个方法。然后跑了 60 组实验:30 组把人类的点子作为初始研究方向喂给 Claude 智能体, 30 组让 Claude 自己选方向 。 结果, 「效果出乎意料地好」 。 「谁来定方向」的对照实验 这个 Anthropic Fellows 项目本来的目标是其实是让 Claude 以 「自动化对齐研究员」(Automated Alignment Researcher, AAR) 的身份,独立完成查文献、提方法、写论文、跑训练、测评的完整闭环,去修复十类已知的对齐失败。 结果:十类全部改善,且通用能力未见崩塌。 人类基线只是个参照系。 在人类参与的七类失败上,AAR 的最佳方法全部超过人类的最佳点子, 平均只需要 6.4 小时 。以「欺骗」为例,Claude 提交了超过 150 次尝试,平均缩减 85% 的安全差距,人类研究者的平均值是 20%。成本对比更惊人: AAR 每小时的 API 推理开销约 4 美元 ,人类研究者的报酬是每小时 150 美元。 不过需要指出:人类没有迭代机会,这不算一次非常公平比较。 AAR 追平最佳人类点子所需的小时数,七类失败均值 6.4 小时。 但该团队还试了给五个 AAR 分别塞五个不同的人类点子,指望撑开搜索空间:多样性只在开头二十来个方法内维持,随后迅速收敛到同一个方法家族。 有人类研究方向与无人类研究方向的两组曲线对比(各 30 组实验),两条曲线几乎重

量子位量子位
Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员 听雨 2026-08-29 20:50:31 来源: 量子位 AI「自进化」,越来越近了 听雨 发自 凹非寺 量子位 | 公众号 QbitAI Claude开始训练Claude了! 时薪4美元,干赢时薪150美元的人类研究员。 在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。 部分任务上,它交出的方案甚至比28名人类安全研究员更好。 更刺激的是, 较弱的Claude已经开始反向参与训练更强的Claude 。 AI「自己改进自己」的那一天,好像真的越来越近了… 4美元一小时,Claude跑赢人类研究员 在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。 具体而言,他们基于Claude Opus 4.8,搭建了一套名为 AAR 的自动化对齐研究员系统。 拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。 从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。 效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。 一轮训练通常只跑30分钟。这样,Claude就能像搜索算法一样,在大量方案中快速试错。 整个过程里,人类负责出题、提供模型和评测标准,Claude则包下了从查资料到跑实验的绝大部分工作。 10道安全难题,Claude全部找到改进方案 实验中,Anthropic一口气给Claude出了10道题。 这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。 比如「谄媚」,指的是模型为了顺着用户说话,给出用户爱听但未必正确的答案;「奖励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到一个更高分数。 Claude每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。 最后,10类问题全部得到改善。 按照Anthropic定义的「安全差距」指标,Claude弥合了其中26%-96%的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了一大截。 更重要的是,这些方法不只对Claude看过
