话题与观点

人机协作性能

本来源中关于人机协作性能的判断。 阅读 1 条观点,核对 1 个来源中的证据。

0 位人物 · 1 个来源 · 1 条观点

内容更新于:

探索知识关联 ↗

话题观点地图

0 位人物 · 1 个来源 · 1 条观点

报告了在工程师上下文下的成功率

作者报告称,其最佳独立配置(在 Claude Code 中启用最大推理的 Claude Opus 5)在预留任务上的成功率为 23.9%。当与具备深度上下文的工程师配合时,同类模型在这些任务上的成功率达到 82.2%。

支持这项说法

超-𝜏-基准(Hyper-𝜏-bench):评估能构建智能体的智能体

独立运行时,我们最佳配置(Claude Opus 5 模型,启用最大推理能力,在 Claude Code 环境中运行)仅在预留评估任务中达成 23.9% 的通过率。当与具备深度上下文知识的工程师协同工作时,同一类模型在相同任务上的通过率达到 82.2%。

原始摘录
Working alone, our best configuration — Claude Opus 5 (max reasoning) running in Claude Code — passes just 23.9% of the held-out evaluation tasks. Paired with an engineer with deep context, the same class of model reaches 82.2% on the same tasks.

这些结论只反映当前可用来源,不代表全面或最新的观点。