让知识彼此相连
知识图谱
沿着人物与判断,回到原始证据。
1 位人物 · 1 个来源 · 1 条观点
放回语境
AI评估与泛化
选择一条判断,追溯到它所在的原始对话。
演化得到的 harness 可泛化至其原始基准之外
等分区块用于阅读定位,不表示排名或权重。
当前 1–1 / 共 1 条判断 · 按来源日期由新到旧
1 / 1
当前判断
演化得到的 harness 可泛化至其原始基准之外
在 Terminal-Bench-2 上演化得到的 harness 未经进一步演化即迁移至 SWE-bench-verified,表明其在 harness 组件中编码了通用工程经验,而非针对特定基准的优化。
这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。
支持这项说法
用于自我改进的 Harness 工程
在 Terminal-Bench-2 上,AHE 的表现优于人类设计的运行框架(OpenCode、Terminus-2、Codex),仅在 Hard 难度层级及少数几个自演化基线(ACE、TF-GRPO)上例外。同一套冻结的运行框架无需进一步演化即可迁移到 SWE-bench-verified,说明所演化的运行框架将工程经验编码到了运行框架组件中,而非针对特定基准进行优化。
原始摘录
On Terminal-Bench-2, AHE achieved better than human-designed harness (OpenCode, Terminus-2, Codex) except for Hard tier and a few other self-evolve baselines (ACE, TF-GRPO). The same frozen harness, without further evolving, transfers to SWE-bench-verified, indicating that the evolved harness is able to encode engineering experience into harness components rather than doing benchmark-specific optimization.
日期表示来源发表时间,不代表观点发生变化。 缺少审核合格译文的内容保留原文。