Готовый рецепт запуска большой ИИ-модели Qwen3.8-Flash-Next на одном сервере DGX Spark без второго узла.
Репозиторий описывает, как запустить модель Qwen3.8-Flash-Next (для текста, изображений и видео) весом около 99 ГБ на единственном сервере NVIDIA DGX Spark с 121 ГБ общей памяти, используя движок vLLM. Скрипты автоматически подбирают настройки памяти, работают с уже скачанной моделью и не обращаются в интернет сами. Подходит инженерам, которым нужно развернуть тяжёлую мультимодальную модель на одном компактном сервере вместо кластера.
Описание автора:Qwen3.8-Flash-Next on ONE DGX Spark (TP=1)
Python★ 375создан 4 сентября 2026форков 53AGPL-3.0