工具与产品

RE-Bench

1 个来源 · 1 次提及

立场属于具体说话者在这段内容中的表达。数量仅描述本站已审核的集合,不代表产品评分或市场共识。

仅提及

Lilian Weng 将 RE-Bench 介绍为一个评估前沿 AI 智能体的基准,覆盖 7 个开放式的机器学习研究工程环境,并纳入人类专家表现数据用于对比。

Lilian Weng ·

支持这项说法

用于自我改进的 Harness 工程

RE-Bench:在贴近现实的机器学习研究与工程环境中,对比评测前沿 AI 智能体与人类专家的表现。共包含 7 个富有挑战性、开放式的机器学习研究与工程环境。

原始摘录
RE-Bench : evaluate frontier AI agents on realistic ML research-engineering envs against human experts. 7 challenging, open-ended ML research-engineering environments.
上下文

每个环境 =(评分函数,初始解,参考解);每个环境均可在最多 8 块 H100 GPU 上运行。示例包括:优化 GPU 内核、开展缩放律(scaling-law)实验、修复嵌入表示、微调 GPT-2 以完成问答任务等。数据涵盖 61 位不同人类专家共计 71 次 8 小时尝试。人类专家在 82% 的 8 小时尝试中取得非零分数;其中 24% 达到或超越强参考解水平。表现最优的 AI 智能体在 2 小时时间预算下的得分是人类的 4 倍,但人类在更长预算下展现出更优的边际收益,并在 8 小时与 32 小时设置下反超智能体。

原始上下文

Each environment = (scoring function, starting solution, reference solution); each can be run with 8 or fewer H100 GPUs. Examples: optimize a kernel, run a scaling-law experiment, fix an embedding, fine-tune GPT-2 for QA, etc. Includes data from 71 eight-hour attempts by 61 distinct human experts. Human experts achieved non-zero score in 82% of 8-hour attempts; 24% matched or exceeded strong reference solutions. Best AI agents scored 4× higher than humans at a 2-hour budget, but humans had better returns to longer budgets and exceeded agents at 8-hour and 32-hour settings.

关于这条解读

对象相关的解读与中文说明已对照原始证据独立审核。这是 AI 语义审核,不代表回听验证。 Reviewed 2026年10月5日 · qwen3.8-max-0902

报告问题
← 全部提及对象