Бенчмарк для ИИ-агентов, которые самостоятельно проводят ML-исследования: изучают данные, строят модели и сдают прогнозы.
Simreal-MLBench проверяет агентов на 60 задачах — от табличных данных до прогнозирования, изображений, звука и научных данных. Оценку выполняет сторонняя соревновательная платформа, а не сами создатели теста, поэтому правильные ответы агенту недоступны заранее. Агент получает две попытки сдачи с обратной связью между ними, что позволяет измерить не только качество модели, но и способность исправляться по фактическим результатам.
Описание автора:Innovative externally-scored agentic ML benchmark for next evolution of AI — real competition ground truth, two-submission feedback, attacked rewards
Python★ 34создан 21 сентября 2026форков 4Apache-2.0