话题与观点

AI评估与泛化

本资料中关于AI评估与泛化的判断。 阅读 1 条观点,核对 1 个来源中的证据。

1 位人物 · 1 个来源 · 1 条观点

内容更新于:

探索知识关联 ↗

话题观点地图

按人物探索:选择两到三位进行对比。

1 位人物 · 1 个来源 · 1 条观点

Lilian Weng

演化得到的 harness 可泛化至其原始基准之外

在 Terminal-Bench-2 上演化得到的 harness 未经进一步演化即迁移至 SWE-bench-verified,表明其在 harness 组件中编码了通用工程经验,而非针对特定基准的优化。

支持这项说法

用于自我改进的 Harness 工程

在 Terminal-Bench-2 上,AHE 的表现优于人类设计的运行框架(OpenCode、Terminus-2、Codex),仅在 Hard 难度层级及少数几个自演化基线(ACE、TF-GRPO)上例外。同一套冻结的运行框架无需进一步演化即可迁移到 SWE-bench-verified,说明所演化的运行框架将工程经验编码到了运行框架组件中,而非针对特定基准进行优化。

原始摘录
On Terminal-Bench-2, AHE achieved better than human-designed harness (OpenCode, Terminus-2, Codex) except for Hard tier and a few other self-evolve baselines (ACE, TF-GRPO). The same frozen harness, without further evolving, transfers to SWE-bench-verified, indicating that the evolved harness is able to encode engineering experience into harness components rather than doing benchmark-specific optimization.
分享观点验证此主张

这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。