漫话开发者 - UWL.ME Mobile

OpenAI 最新披露,尽管其前沿模型 GPT-5.6 在数学领域解决了多个长期悬而未决的问题,并成功打通《宝可梦 火红》等复杂游戏,但在 ARC-AGI-3 基准测试中原始得分仅有 7.8%。这一巨大反差揭示了一个关键问题:基准测试从来不仅仅衡量模型孤立的能力,更深刻反映了 API 设置、测试框架设计以及提示词策略等隐形选择的影响。研究人员发现,在 ChatGPT 和 Codex 中同时启用“保留推理”(retained reasoning)与“压缩”(compaction)两项功能后,模型在 ARC-AGI-3 上的分数直接提升至原来的三倍,同时输出 token 数量锐减至六分之一。这意味着正确的技术配置不仅能激发模型未被充分利用的潜力,还能在大幅降低计算成本的同时提升智能表现,为未来通用人工智能评测的标准化方法和实际部署中的推理效率优化提供了全新思路。

核心要点

  • GPT-5.6 原始 ARC-AGI-3 得分仅 7.8%,与其解决数学难题和通关游戏的能力形成强烈对比
  • 开启保留推理与压缩两项设置后,ARC-AGI-3 测试得分提升至原来的三倍
  • 输出 token 量同步减少 6 倍,显著优化推理效率和成本

Read more >