开源|从RLVR到RLSVR:通过任务转换让大语言模型实现自我可验证奖励的开放式自我进化
thinkindev • 2026-08-04
4617 views
大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通过任务转换将开放式问题映射到带有规则和结果的代理环境中,使模型能够自动生成自我可验证的奖励信号,无需人工标注即可持续提升能力。该工作的代表性实现SpyRL采用多智能体自我博弈机制,通过预设角色和投票规则将评估过程完全自动化,为大语言模型在创意写作、复杂推理等开放领域的自我进化开辟了新路径。这一范式转变有望大幅降低大模型对齐和优化过程中对人类反馈的依赖,推动AI向更通用、更自主的方向发展。
核心要点
- RLSVR将RLVR从固有可验证任务扩展到开放式任务,通过构建代理环境自动生成奖励信号
- SpyRL展示基于多智能体自我博弈与投票机制的自动评估方法
- 该研究为减少大模型微调对人类反馈的依赖提供了全新框架