Открытый фреймворк на Python для модульного тестирования и оценки качества приложений на больших языковых моделях, похожий на Pytest.
DeepEval даёт готовые метрики оценки LLM-приложений — чат-ботов, RAG-систем и ИИ-агентов, включая обнаружение галлюцинаций, релевантность ответов и завершённость задач. Оценка использует подход «LLM как судья» и NLP-модели, которые можно запускать локально. Помогает подбирать модели, промпты и архитектуру, а также отслеживать деградацию качества при обновлении системы.
Описание автора:The LLM Evaluation Framework
Python★ 0создан 14 сентября 2026форков 0Apache-2.0