Библиотека на Python для оценки калибровки вероятностей и точности моделей классификации текста без дообучения.
jev-benchmarks сравнивает модели классификации текста не только по точности, но и по тому, насколько надёжны их вероятностные оценки для автоматизации решений. Тестирует модели на стандартных наборах данных вроде AG News и Banking77, измеряя точность, калибровку и скорость работы. Результаты приводятся с доверительными интервалами для воспроизводимости.
Описание автора:Probability-aware evaluation for typed decision models: calibration, selective risk, latency, and reproducible benchmarks.
Python★ 4создан 17 сентября 2026форков 0Apache-2.0