Бенчмарк для проверки памяти ИИ-агентов в длинных диалогах: насколько точно они помнят время, события и факты.
LoCoMo-Refined — переработанная версия датасета LoCoMo для оценки памяти ИИ-агентов после очень долгих диалогов: агент должен точно вспомнить время, события, отношения и предпочтения. Авторы почистили набор из 1382 вопросов, заменив 337 неточных примеров, и ужесточили ИИ-судью (модель Qwen3-14B), которая теперь совпадает с оценками людей в 86% случаев вместо 44% у старой версии. Инструмент предназначен для разработчиков, которые тестируют качество памяти своих ИИ-агентов.
Описание автора:LoCoMo Refined: Recalibrating LoCoMo with stricter LLM judging and a cleaned dataset.