Инструкция и конфигурация для запуска большой языковой модели GLM-5.3-Flash на одном сервере NVIDIA DGX Spark с замерами скорости.
Репозиторий описывает, как развернуть языковую модель GLM-5.3-Flash (320 миллиардов параметров) в сжатом виде на одном устройстве NVIDIA DGX Spark с полным контекстным окном в 262 тысячи токенов. Приводит измеренную скорость генерации текста — около 19 токенов в секунду — с подробными данными замеров. Это доработка чужого проекта под меньшее количество оборудования.
Описание автора:GLM-5.3-Flash EXL3 K2 2.0bpw on ONE DGX Spark: native MTP (layer 45, 288 experts), CUDA graphs on, full 262,144 ctx. Measured ~19 tok/s sampled decode, receipts included. Fork of the 2x kit.