IDEAS CONECTADAS
Atlas de conocimiento
Explora personas, perspectivas y sus fuentes originales.
1 personas · 1 fuentes · 1 opiniones expresadas
EN CONTEXTO
MLE-bench offline Kaggle benchmark
Elige una perspectiva y vuelve a la conversación original.
MLE-bench uses 75 Kaggle competitions as offline ML engineering benchmarks
Los sectores iguales orientan la lectura, no indican una clasificación.
Perspectivas 1–1 de 1 · Fuentes más recientes primero
Perspectiva seleccionada
MLE-bench uses 75 Kaggle competitions as offline ML engineering benchmarks
MLE-bench evaluates ML engineering agents on 75 curated offline Kaggle competitions, testing model training, dataset preparation, experiment execution, and submission to grading scripts. Kaggle public leaderboards serve as human baselines. The best-performing setup—o1-preview with AIDE scaffolding—reached at least Kaggle bronze-medal level in 16.9% of competitions.
Estas son perspectivas individuales, no una medida de consenso. El material fuente permanece en su idioma original.
Evidencia a favor
Extracto original
MLE-bench : evaluate ML engineering agents on offline Kaggle competitions. Contains 75 ML-engineering competitions curated from Kaggle.
Contexto
Tests training models, preparing datasets, running experiments, and submitting predictions to grading scripts. Uses Kaggle public leaderboards as human baselines. Best setup in the paper, o1-preview with AIDE scaffolding, reached at least Kaggle bronze-medal level in 16.9% of competitions. Includes resource-scaling and contamination analyses.
Las fechas corresponden a las fuentes, no a cambios de opinión. Los textos sin traducción revisada se mantienen en su idioma original.