UN TEMA, EN CONTEXTO

MLE-bench offline Kaggle benchmark

Judgments in this source concerning MLE-bench offline Kaggle benchmark. Explora 1 punto de vista con evidencias de 1 fuente.

1 personas · 1 fuentes · 1 opiniones expresadas

Contenido actualizado:

Explorar conexiones ↗

Mapa de perspectivas

Explore por persona. Seleccione dos o tres para compararlas.

1 personas · 1 fuentes · 1 opiniones expresadas

Lilian Weng

MLE-bench uses 75 Kaggle competitions as offline ML engineering benchmarks

MLE-bench evaluates ML engineering agents on 75 curated offline Kaggle competitions, testing model training, dataset preparation, experiment execution, and submission to grading scripts. Kaggle public leaderboards serve as human baselines. The best-performing setup—o1-preview with AIDE scaffolding—reached at least Kaggle bronze-medal level in 16.9% of competitions.

Evidencia a favor

Harness Engineering for Self-Improvement

Extracto original

MLE-bench : evaluate ML engineering agents on offline Kaggle competitions. Contains 75 ML-engineering competitions curated from Kaggle.
Contexto

Tests training models, preparing datasets, running experiments, and submitting predictions to grading scripts. Uses Kaggle public leaderboards as human baselines. Best setup in the paper, o1-preview with AIDE scaffolding, reached at least Kaggle bronze-medal level in 16.9% of competitions. Includes resource-scaling and contamination analyses.

Compartir informaciónVerificar esta afirmación

Estas son perspectivas individuales, no una medida de consenso. El material fuente permanece en su idioma original.