Инструкция для запуска больших языковых моделей Qwen3 (35–80 млрд параметров) на обычной видеокарте с 16 ГБ памяти.
Проект описывает настройку форка llama.cpp, который кэширует в видеопамяти только часть «экспертов» модели Qwen3, а остальное подгружает из оперативной памяти по мере надобности. Это позволяет запускать модели, для которых обычно нужно от 80 ГБ видеопамяти, на видеокарте с 16 ГБ и 32–64 ГБ ОЗУ со скоростью 47–111 токенов в секунду по данным автора. Подходит энтузиастам, которые хотят гонять крупные модели ИИ дома без облака.
Описание автора:An experimental configuration for running 35B-80B Qwen3 MoE models on consumer GPUs with only 16GB VRAM and 32GB system RAM, using the GenerelSchwerz llama.cpp fork with CUDA MoE expert caching.