Библиотека, которая позволяет запускать языковые модели на 70 и более миллиардов параметров на одной видеокарте с 4 ГБ памяти.
AirLLM резко снижает потребление видеопамяти при инференсе больших языковых моделей без квантования, дистилляции и обрезки весов — модель на 70 млрд параметров запускается на GPU с 4 ГБ памяти. Последние версии добавили поддержку моделей вроде Kimi K3 (2.8T) и Qwen3.8-Flash-Next (125B), а также обучение крупных моделей на слабых видеокартах за счёт потоковой подгрузки замороженных весов по одному слою.
Описание автора:AirLLM 70B inference with single 4GB GPU
Jupyter Notebook★ 34 366создан 12 июня 2023форков 3 610Apache-2.0