人工智能

Anthropic 展示“AI 训练 AI”对齐方法:10 项失调行为测试均获改善

2026年8月30日 · admin
openmagic ad

据 IT之家 8 月 29 日消息,Anthropic 近日发布论文《自动化研究员能够可靠缓解对齐失效》,展示了一种用 AI 系统参与训练和改进其他 AI 模型的新方法。来源显示,该研究由 Anthropic 研究员计划成员陈岳翰(音译)领导开发,重点不是让 AI 直接“替代一切研发”,而是让自动化系统围绕模型对齐问题开展类似科研流程的实验:查阅文献、提出训练方案、执行短时训练、评估结果,并在多轮尝试中保留有效方法、淘汰无效方法。

这项研究的核心结果是,团队围绕 10 种具体的失调行为设置测试,自动化系统最终让全部 10 项指标都有所改善,同时没有牺牲模型的整体能力。对中文读者而言,这一进展值得关注,因为它指向的不只是一个新的安全训练技巧,而是 AI 实验室正在探索的更大趋势:用模型加速模型研发本身

自动化研究员如何工作:把科研流程拆成可循环任务

从论文介绍看,Anthropic 的自动化对齐研究员并不是简单运行一次提示词或脚本,而是模拟传统研究中的若干关键环节。系统会先参考已有研究文献,生成候选训练方法;随后按方案对模型进行 30 分钟训练;训练完成后,再依据对齐基准测试表现评估方案是否有效。表现好的方案会被保留,表现差的方案则被淘汰,系统继续迭代。

这种流程的意义在于,它把原本依赖研究人员手工试错的一部分工作,转化为可并行、可重复、可扩展的自动化流程。尤其是在对齐后训练这类需要大量实验比较的场景中,自动化系统能够以较低边际成本探索更多方案。来源称,论文认为这些结果初步证明,自动化对齐后训练有望在近期成为一种真正可行的方法

  • 研究对象:围绕模型对齐失效与失调行为展开测试。
  • 实验结果:10 项具体失调行为指标均得到改善。
  • 能力影响:改善对齐表现的同时,没有牺牲模型整体能力。
  • 工作方式:查阅文献、提出方案、训练模型、评估结果、多轮迭代。
  • 训练节奏:每个方案按流程训练 30 分钟,再进入筛选和优化。

成本与速度优势明显,但不等于人类研究员马上“下岗”

论文还直接比较了自动化对齐研究员与人类研究人员的表现。来源显示,最优秀的自动化对齐研究员方法平均只需 6 小时,就能超过经验丰富的人类研究人员提出的方案;同时,人类引导的研究方向并不会带来更强表现。在成本方面,自动化系统每小时约需 4 美元 API 推理成本,而研究中支付给人类研究人员的费用为每小时 150 美元。

这组对比很容易引发“AI 研究员取代人类”的讨论,但更准确的理解是:在边界清晰、评价标准明确、可快速反馈的任务上,AI 自动化系统已经显现出很强的实验搜索能力。对于 AI 实验室来说,这意味着未来研发流程可能更像“人类提出方向与约束,AI 大规模生成和筛选方案”。在这种模式下,人类研究员的角色会从执行大量重复实验,逐渐转向定义问题、构建基准、审查结果和判断风险。

影响与解读:递归自我改进的一小步

这项研究也被视为通向递归自我改进的一步。所谓递归自我改进,通常指 AI 系统能够帮助改进自身或同类系统的训练与运行方式。Anthropic 当前展示的是在对齐训练环节的自动化改进:模型并非完全自主重写自身,但已经能在特定约束下寻找更好的对齐训练方法。若这一路径继续扩展,未来不排除被用于更广泛的训练流程优化,例如数据筛选、奖励建模、评测设计或微调策略搜索。

不过,论文也指出这套方法仍有明显限制。首先,自动化系统的效果取决于基准测试是否真的反映对齐目标。如果基准本身存在偏差,系统可能只是学会“刷分”,而不是真正提升安全性。其次,即便基准可靠,建立和长期维护这些评测体系仍需要大量投入。第三,自动化研究员依赖的研究文献也需要持续维护和扩充,否则系统提出的方案可能受限于过时或不完整的信息。

因此,这项成果更像是 AI 研发自动化的一个重要信号:模型正在从“被训练对象”变成“训练流程参与者”。对产业而言,它可能降低部分实验成本、提高模型迭代速度;对安全治理而言,它也提出了新的要求——当 AI 能够帮助改进 AI,人类更需要确保评测、目标和边界足够可靠。速度提升并不自动等于安全提升,但它确实会改变未来 AI 实验室的研发组织方式。