Anthropic发布自我改进AI报告:自动化研究员可可靠缓解对齐失败
thinkindev • 2026-08-31
2461 views
Anthropic近日公布了关于自我改进AI的最新研究,首次在实践层面展示了AI自动化研究员如何在较少人类参与的情况下提升其他AI模型的安全性。研究团队让Claude自主训练模型,并针对衡量10类对齐失败的多个公开基准进行优化。结果显示,Claude找到的修复方案在所有10个类别上都改善了目标基准,同时没有削弱模型的基础能力。这一成果表明,AI有望在自身研发和对齐研究中承担更大比例的工作,为解决复杂的安全隐患提供可扩展路径。不过,该研究仍处于早期阶段,其意义在于为AI自我改进的安全性和可控性提供初步证据,也为后续探索自动化对齐研究奠定了基础。
核心要点
- Anthropic让Claude自主训练模型,以极少人类参与改善其他AI模型的安全性
- 在10类对齐失败基准上均找到修复方案,且未牺牲模型能力
- 研究暗示AI未来可能承担更多自身研发与对齐工作