Надстройка над движком llama.cpp, позволяющая запускать большие языковые модели с очень длинным контекстом на недорогой видеокарте.
KVMem — расширение для llama.cpp, которое добавляет многоуровневую систему хранения памяти модели: часть данных держится на видеокарте, часть — в оперативной памяти компьютера, и система сама подгружает нужное по запросу. Это позволяет запускать модель Qwen3.8-27B с рабочим окном контекста до 256 тысяч токенов на видеокарте всего с 16 ГБ памяти, почти не теряя в качестве ответов. Предназначено для разработчиков, которым нужны AI-агенты с длинной памятью на доступном железе.