Оптимизированный инференс модели Qwen3.8-27B на GPU B200 с ускоренной генерацией текста и бенчмарками.
Проект содержит оптимизированные CUDA/Triton-ядра для запуска модели Qwen3.8-27B на одной видеокарте NVIDIA B200, а также исходную эталонную реализацию для сравнения. По приведённым замерам оптимизированная версия ускоряет этап начальной обработки текста в 1,06 раза и генерацию токенов — в 2 раза при полном совпадении результатов с эталоном. Веса модели нужно подгружать отдельно, они в репозиторий не входят.
Описание автора:Qwen3.8-27B inference, CUDA/Triton kernels, reference baseline, and benchmark results.
Python★ 8создан 16 сентября 2026форков 0Apache-2.0