Hyper-τ-bench开源:评估能构建智能体的智能体,Claude Opus 5独立通过率仅23.9%
thinkindev • 2026-09-09
1866 views
Sierra 近日开源了 Hyper-τ-bench,这是一个面向长周期智能体构建能力的新评估基准。与常见只考察模型作为智能体执行任务的测试不同,Hyper-τ-bench 将开发者智能体置于沙盒工作区中,提供模拟业务的记录和可随时消息沟通的模拟客户。该开发者智能体需要从碎片化证据中还原需求规格,设计系统架构,并将业务行为封装为工具,最终交付一个可运行的客户服务智能体;产物还需在固定模型菜单和每次对话成本预算内提供服务。结果显示,Claude Opus 5(max reasoning)在 Claude Code 中单独运行时,仅通过 23.9% 的留出评估任务;而与具备深度背景知识的工程师协作时,同类模型在相同任务上的通过率提升至 82.2%。这一差距说明,当前模型在无人工辅助条件下构建可靠智能体仍面临明显挑战,也凸显了人类专家在需求澄清、架构决策和工具设计中的价值。该基准为 AI 工程、智能体自动化和企业级客服系统部署提供了更贴近真实环境的评估视角。
核心要点
- Hyper-τ-bench 开源,用于评估模型构建智能体而不仅是执行任务的能力。
- 测试环境中开发者智能体需从模拟业务记录中还原需求、设计架构并封装工具,交付受成本约束的客服智能体。
- Claude Opus 5 独立通过率仅 23.9%,与人类工程师协作后提升至 82.2%,显示人机协作仍很关键。