Инструмент для быстрой и дешёвой проверки качества ответов ИИ-агентов — все метрики за один запрос вместо множества обращений к модели.
Jevals заменяет классический подход, где для оценки ответа ИИ-агента нужно несколько запросов к дорогой языковой модели (LLM-судье), на компактные решающие модели семейства Jev. Все проверки для одной цепочки действий агента отправляются одним запросом, который стоит доли цента и возвращается за доли секунды, что позволяет запускать оценку на каждом шаге, а не на выборке трафика. Работает через облачные API TypeSafe и Vercel, а также локально на Mac, либо может использовать обычную чат-модель.
Описание автора:Agent evals and guardrails as Jev decisions: one request per trace, a fraction of a cent, fast enough for the agent loop. Runs locally with Kev or Laya.