让知识彼此相连

知识图谱

沿着人物与判断,回到原始证据。

1 位人物 · 1 个来源 · 1 条观点

放回语境

RE-Bench 中人类与 AI 的性能权衡

选择一条判断,追溯到它所在的原始对话。

AI 智能体短时优于人类,长时则不及人类

放回语境RE-Bench 中人类与 AI 的性能权衡1 条观点
2026-07-04

等分区块用于阅读定位,不表示排名或权重。

当前 1–1 / 共 1 条判断 · 按来源日期由新到旧

1 / 1

当前判断

AI 智能体短时优于人类,长时则不及人类

在 RE-Bench 中,表现最优的 AI 智能体在 2 小时时间预算下得分是人类专家的 4 倍;但人类延长工作时间后边际收益更高,在 8 小时和 32 小时预算下均反超智能体。

这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。

支持这项说法

用于自我改进的 Harness 工程

表现最优的AI智能体在2小时预算下得分比人类高4倍;但人类在更长预算下收益更高,并在8小时和32小时设置下反超AI智能体。

原始摘录
Best AI agents scored 4× higher than humans at a 2-hour budget, but humans had better returns to longer budgets and exceeded agents at 8-hour and 32-hour settings.
上下文

RE-Bench:在真实ML研究-工程环境中,以前沿AI智能体为对象、以人类专家为基准开展评测。共设7个具挑战性、开放式的ML研究-工程环境。每个环境 =(评分函数,初始解,参考解);每个环境均可在8块或更少H100 GPU上运行。示例任务包括:优化一个核函数、运行缩放律实验、修复嵌入向量、对GPT-2进行问答任务微调等。数据涵盖61位不同人类专家所完成的71次八小时尝试。人类专家在82%的八小时尝试中取得了非零得分;其中24%的尝试达到或超过了强参考解水平。

原始上下文

RE-Bench : evaluate frontier AI agents on realistic ML research-engineering envs against human experts. 7 challenging, open-ended ML research-engineering environments. Each environment = (scoring function, starting solution, reference solution); each can be run with 8 or fewer H100 GPUs. Examples: optimize a kernel, run a scaling-law experiment, fix an embedding, fine-tune GPT-2 for QA, etc. Includes data from 71 eight-hour attempts by 61 distinct human experts. Human experts achieved non-zero score in 82% of 8-hour attempts; 24% matched or exceeded strong reference solutions.

日期表示来源发表时间,不代表观点发生变化。 缺少审核合格译文的内容保留原文。