VERNETZTES DENKEN
Wissensatlas
Personen, Standpunkte und ihre Originalbelege erkunden.
1 Personen · 1 Quellen · 1 geäußerte Meinungen
IM KONTEXT
Human–AI performance tradeoffs in RE-Bench
Einen Standpunkt auswählen und das Originalgespräch nachverfolgen.
AI agents outperform humans at short time budgets but not longer ones
Gleich große Sektoren dienen der Orientierung, nicht der Rangfolge.
Standpunkte 1–1 von 1 · Neueste Quellen zuerst
Ausgewählter Standpunkt
AI agents outperform humans at short time budgets but not longer ones
In RE-Bench, the best AI agents scored 4× higher than human experts at a 2-hour budget, yet humans demonstrated better returns to extended effort and surpassed agents at both 8-hour and 32-hour time budgets.
Dies sind individuelle Standpunkte, keine Messung einer Übereinstimmung. Das Quellenmaterial bleibt in der Originalsprache.
Stützende Belege
Originalauszug
Best AI agents scored 4× higher than humans at a 2-hour budget, but humans had better returns to longer budgets and exceeded agents at 8-hour and 32-hour settings.
Kontext
RE-Bench : evaluate frontier AI agents on realistic ML research-engineering envs against human experts. 7 challenging, open-ended ML research-engineering environments. Each environment = (scoring function, starting solution, reference solution); each can be run with 8 or fewer H100 GPUs. Examples: optimize a kernel, run a scaling-law experiment, fix an embedding, fine-tune GPT-2 for QA, etc. Includes data from 71 eight-hour attempts by 61 distinct human experts. Human experts achieved non-zero score in 82% of 8-hour attempts; 24% matched or exceeded strong reference solutions.
Die Daten beziehen sich auf Quellen, nicht auf Änderungen der Überzeugung. Texte ohne geprüfte Übersetzung bleiben in ihrer Originalsprache.