Тестовый набор задач, который проверяет, можно ли обмануть систему оценки прогресса ИИ-агента ложными «откатами».
PartHackBench создан для проверки систем частичного начисления баллов ИИ-агентам, выполняющим многошаговые задачи с состоянием (например, бронирование поездки из нескольких этапов). Бенчмарк проверяет, может ли агент получить более высокую оценку, временно достигнув полного выполнения задачи и затем откатив часть шагов, при том что итоговый результат идентичен агенту, который просто остановился на середине. Инструмент нужен разработчикам систем оценки агентов для выявления таких уязвимостей.
Описание автора:A stress-testing benchmark for partial-completion evaluators in stateful multi-turn agents, focusing on temporary progress, rollback, and attribution failures.