报告了在工程师上下文下的成功率
作者报告称,其最佳独立配置(在 Claude Code 中启用最大推理的 Claude Opus 5)在预留任务上的成功率为 23.9%。当与具备深度上下文的工程师配合时,同类模型在这些任务上的成功率达到 82.2%。
支持这项说法
超-𝜏-基准(Hyper-𝜏-bench):评估能构建智能体的智能体
独立运行时,我们最佳配置(Claude Opus 5 模型,启用最大推理能力,在 Claude Code 环境中运行)仅在预留评估任务中达成 23.9% 的通过率。当与具备深度上下文知识的工程师协同工作时,同一类模型在相同任务上的通过率达到 82.2%。
原始摘录
Working alone, our best configuration — Claude Opus 5 (max reasoning) running in Claude Code — passes just 23.9% of the held-out evaluation tasks. Paired with an engineer with deep context, the same class of model reaches 82.2% on the same tasks.