工具与产品

KernelBench

1 个来源 · 1 次提及

立场属于具体说话者在这段内容中的表达。数量仅描述本站已审核的集合,不代表产品评分或市场共识。

仅提及

Lilian Weng 将 KernelBench 呈现为一个包含 250 个 PyTorch 任务的基准,用于评估大语言模型生成正确且快速 GPU 内核的能力,其核心指标为 fast_p。

Lilian Weng ·

支持这项说法

用于自我改进的 Harness 工程

KernelBench:评估所生成核函数的正确性与执行速度。包含250个PyTorch任务,用于评测大语言模型(LLM)能否编写出既快速又正确的核函数。

原始摘录
KernelBench : evaluate correctness and speed for generated GPU kernels. 250 PyTorch tasks to evaluate whether LLM can write fast and correct kernels.
上下文

评估指标 fast_p = 生成核函数中既正确、又快于基线版本的比例。

原始上下文

The evaluation metric fast_p = the percentage of generated kernels that are correct and faster than baseline.

关于这条解读

对象相关的解读与中文说明已对照原始证据独立审核。这是 AI 语义审核,不代表回听验证。 Reviewed 2026年10月5日 · qwen3.8-max-0902

报告问题
← 全部提及对象