Независимый тест точности ИИ-модели Jev от TypeSafe: проверяет, насколько честно она оценивает уверенность в своих ответах.
Проект проверяет, отражают ли вероятности модели Jev реальные шансы на правильный ответ — это важно, если бизнес хочет автоматически доверять решениям модели выше заданного порога уверенности. Тест проводится на данных, которые модель точно не видела при обучении, а также на трёх открытых бенчмарках, при этом публикуются все сырые ответы для проверки. Полное воспроизведение теста стоит около 6 центов.
Описание автора:Independent calibration test of TypeSafe's Jev on a task it cannot have seen: 900 rule-generated support tickets (choice / score / boolean) plus 3 public benchmarks via Vercel AI Gateway. Raw responses, ECE with noise floor, temperature refit, per-type sign of miscalibration. Reproducible for ~$0.06.