Claude 新功能:自动化评估设计与爬山优化,告别模型迭代中的自我欺骗
thinkindev • 2026-09-29
2399 views
在人工智能系统开发中,评估设计与模型迭代是决定模型能否稳定落地的关键环节。Anthropic 旗下 Claude 团队近日发布了 /claude-api build-eval 与 /claude-api hillclimb 两个新命令,旨在将评估设计及爬山优化过程自动化。高质量评估需要尽可能贴近生产环境、为更强模型保留性能余量、奖励更充分的推理过程,并具备较低的运行间方差。新命令能够自动构建经过审查的测试集和评分器,随后以每次仅改动提示、技能、模型设置或测试框架代码中的一个变量的方式开展爬山式优化,并利用留出样本和噪声检查来识别和防止过拟合。这一方法为开发者提供了更可靠、可复现的模型迭代路径,减少人工设计评估时的主观偏差,提升模型在真实生产场景中的表现与可信度。
核心要点
- 良好评估应镜像生产环境,保留性能余量并保持低运行间方差
- build-eval 自动生成审查过的测试集与评分器,hillclimb 以单变量变更进行爬山优化
- 通过留出案例与噪声检查有效防止过拟合,确保优化结果真实可信