让知识彼此相连

知识图谱

沿着人物与判断,回到原始证据。

1 位人物 · 1 个来源 · 1 条观点

放回语境

AI评估与泛化

选择一条判断,追溯到它所在的原始对话。

演化得到的 harness 可泛化至其原始基准之外

放回语境AI评估与泛化1 条观点
2026-07-04

等分区块用于阅读定位,不表示排名或权重。

当前 1–1 / 共 1 条判断 · 按来源日期由新到旧

1 / 1

当前判断

演化得到的 harness 可泛化至其原始基准之外

在 Terminal-Bench-2 上演化得到的 harness 未经进一步演化即迁移至 SWE-bench-verified,表明其在 harness 组件中编码了通用工程经验,而非针对特定基准的优化。

这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。

支持这项说法

用于自我改进的 Harness 工程

在 Terminal-Bench-2 上,AHE 的表现优于人类设计的运行框架(OpenCode、Terminus-2、Codex),仅在 Hard 难度层级及少数几个自演化基线(ACE、TF-GRPO)上例外。同一套冻结的运行框架无需进一步演化即可迁移到 SWE-bench-verified,说明所演化的运行框架将工程经验编码到了运行框架组件中,而非针对特定基准进行优化。

原始摘录
On Terminal-Bench-2, AHE achieved better than human-designed harness (OpenCode, Terminus-2, Codex) except for Hard tier and a few other self-evolve baselines (ACE, TF-GRPO). The same frozen harness, without further evolving, transfers to SWE-bench-verified, indicating that the evolved harness is able to encode engineering experience into harness components rather than doing benchmark-specific optimization.

日期表示来源发表时间,不代表观点发生变化。 缺少审核合格译文的内容保留原文。