让知识彼此相连
知识图谱
沿着人物与判断,回到原始证据。
1 位人物 · 1 个来源 · 1 条观点
放回语境
MLE-bench离线Kaggle基准测试
选择一条判断,追溯到它所在的原始对话。
MLE-bench 采用 75 场 Kaggle 竞赛作为离线机器学习工程评测基准
等分区块用于阅读定位,不表示排名或权重。
当前 1–1 / 共 1 条判断 · 按来源日期由新到旧
当前判断
MLE-bench 采用 75 场 Kaggle 竞赛作为离线机器学习工程评测基准
MLE-bench 在 75 个精选的离线 Kaggle 竞赛上评估机器学习工程智能体,测试内容涵盖模型训练、数据集准备、实验执行及向评分脚本提交结果等环节。Kaggle 公开排行榜作为人类表现基线。表现最优的配置——o1-preview 模型配合 AIDE 支架框架——在 16.9% 的竞赛中达到了 Kaggle 铜牌及以上水平。
这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。
支持这项说法
MLE-bench:在离线 Kaggle 竞赛上评测机器学习工程智能体。该基准包含从 Kaggle 平台精选的 75 场机器学习工程类竞赛。
原始摘录
MLE-bench : evaluate ML engineering agents on offline Kaggle competitions. Contains 75 ML-engineering competitions curated from Kaggle.
上下文
评测内容涵盖模型训练、数据集准备、实验运行及向评分脚本提交预测结果等环节。采用 Kaggle 公开排行榜作为人类基线。论文中表现最佳的配置(o1-preview 模型搭配 AIDE 框架)在 16.9% 的竞赛中达到 Kaggle 铜牌水平。该基准同时包含资源扩展性分析与污染分析。
原始上下文
Tests training models, preparing datasets, running experiments, and submitting predictions to grading scripts. Uses Kaggle public leaderboards as human baselines. Best setup in the paper, o1-preview with AIDE scaffolding, reached at least Kaggle bronze-medal level in 16.9% of competitions. Includes resource-scaling and contamination analyses.
日期表示来源发表时间,不代表观点发生变化。 缺少审核合格译文的内容保留原文。