Экспериментальный проект для запуска крупной AI-модели DeepSeek-V4.1-Flash на одном компьютере NVIDIA DGX Spark вместо кластера серверов.
Проект показывает, как запустить большую языковую модель DeepSeek-V4.1-Flash (510 ГБ на диске) на одном устройстве DGX Spark, не уменьшая качество модели: часть "экспертов" модели держится в памяти, а остальные подгружаются с диска по мере надобности. Работа находится на ранней стадии (v0.5.0), автор честно указывает измеренные ограничения по языкам и длине генерации.
Описание автора:DeepSeek-V4.1-Flash on a single DGX Spark (GB10): resident hot experts + NVMe streaming, DSpark, OpenAI API. Work in progress.