Сжатая версия ИИ-модели GLM-5.3-Flash и рецепт запуска на двух серверах NVIDIA DGX Spark с замерами скорости.
Репозиторий содержит квантованную (уменьшенную по размеру памяти) версию языковой модели GLM-5.3-Flash в формате NVFP4, скрипт для такого сжатия и подробную инструкцию по развёртыванию на двух узлах NVIDIA DGX Spark. Автор публикует собственные замеры скорости генерации текста — около 35 токенов в секунду на японских текстах — вместе с условиями теста, чтобы результаты можно было проверить.
Описание автора:W4A16 NVFP4 repack of GLM-5.3-Flash with a two-node DGX Spark serving recipe, the requant script, and the full measurement tables.
Python★ 2создан 17 сентября 2026форков 0Apache-2.0