Библиотека для быстрого и экономного по памяти запуска больших языковых моделей на своих серверах.
vLLM — open-source библиотека для инференса и обслуживания больших языковых моделей (LLM), созданная в UC Berkeley и развиваемая тысячами участников. Она ускоряет генерацию текста за счёт эффективного управления памятью, пакетной обработки запросов и сжатия моделей, снижая требования к видеокарте. Совместима с моделями Hugging Face и используется как основа множества ИИ-сервисов.
Описание автора:A high-throughput and memory-efficient inference and serving engine for LLMs
Python★ 91 858создан 9 февраля 2023форков 22 241Apache-2.0