Техническая инструкция по запуску квантованной модели GLM-5.3 Flash на кластере из 2-4 устройств NVIDIA DGX Spark.
Проект описывает рецепт развёртывания квантованной версии модели GLM-5.3 Flash (формат EXL3, 4 бита на вес, около 164 ГБ) как OpenAI-совместимого сервиса через vLLM на двух или трёх устройствах NVIDIA DGX Spark с распределением вычислений между ними. В README подробно расписаны настройки KV-кэша, спекулятивного декодирования и загрузки весов MoE-экспертов. Материал рассчитан на инженеров, разворачивающих крупные модели на специализированном железе.
Описание автора:GLM-5.3 Flash EXL3 for 2-4x DGX Sparks
Python★ 508создан 27 августа 2026форков 79AGPL-3.0