漫话开发者 - UWL.ME Mobile

Anthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研究。这种一边控制风险、一边继续探索高风险能力的做法,反映出前沿 AI 企业在商业竞争与安全对齐之间的现实张力。尽管放慢脚步可能影响商业利益,Anthropic 似乎仍将在短期至中期内更加严肃地对待常规对齐任务,并投入大量资源。对行业而言,这意味着 AI 安全治理正从原则性承诺转向第三方审查、风险分级与工程化对齐研究相结合的新阶段。

核心要点

  • Anthropic 计划引入 METR 对近期 AI 智能体相关安全事件进行独立审查
  • 公司已暂停最高风险强化学习研究,同时公开了刻意训练奖励追求型 Claude 的实验
  • 此举显示 Anthropic 将在短期至中期更严肃地投入资源处理常规对齐任务

Read more >