Бенчмарк от mem0ai, проверяющий, использует ли ИИ-агент долгосрочную память для правильных действий пользователя.
DolphinBench тестирует, помнит ли ИИ-агент информацию из прошлых разговоров и правильно ли применяет её в новых задачах — например, выбирает нужного получателя письма или верную дату. Тест включает трёх смоделированных пользователей с историей примерно по 500 000 токенов и 600 заданий с реальными приложениями. Оценивается не то, что агент говорит, а то, что он реально делает через симулированные сервисы.
Описание автора:DolphinBench - Mapping the Pareto frontier of Agent Memory
Python★ 27создан 22 сентября 2026форков 1Apache-2.0