Долгосрочный бенчмарк, который проверяет, не деградируют ли ответы моделей Claude после релиза.
livenerf — набор фиксированных промптов и точных критериев оценки, который регулярно прогоняет одну и ту же модель Claude (сейчас Opus 5.5), чтобы статистически проверить слухи о том, что модели становятся «хуже» через недели после выхода. Проект стартовал в день релиза Opus 5.5 22 сентября 2026 года и использует открытый фреймворк оценки Inspect от британского AI Security Institute, а методику подсчёта погрешностей взял из статьи Anthropic. Пока это версия первого дня работы.
Описание автора:Benchmark for tracking model capability after release.