adrienbrault /qwen3.8-flash-next-2x-rtx5090
Техническая документация по запуску языковой нейросети Qwen3.8 на двух видеокартах RTX 5090 с замерами скорости работы.
Проект содержит конфигурацию, инструкции и результаты тестов по запуску большой языковой модели Qwen3.8-Flash-Next на двух видеокартах RTX 5090 через программы ExLlamaV3 и TabbyAPI. Автор публикует конкретные измерения скорости генерации текста и обработки запросов, полученные на реальном оборудовании, без прогнозов — все цифры подтверждены и датированы. Материал предназначен для тех, кто настраивает мощные видеокарты под работу с ИИ-моделями.
Описание автора: Qwen3.8-Flash-Next (2.50bpw EXL3) served on 2× RTX 5090 with ExLlamaV3 + TabbyAPI: launcher, image recipe, kernel overlays (MoE decode, shared-expert overlap, grouped prefill, MTP drafting), probes and dated measurements. 262k context, 786k-token 8-bit KV pool, 218 t/s code decode at 1 stream, 510 t/s at 4, 10k t/s prefill.
Сколько звёзд прибавилось
- Сутки ≈ +113 486-е место
- Неделя ≈ +113 2541-е место
- Месяц ≈ +78 вне рейтинга
- 3 месяца ≈ +78 вне рейтинга
Без значка — точная разница ежедневных снимков счётчика GitHub, со значком ≈ — оценка по архиву событий.
Точный счётчик GitHub: +0 звёзд с 19:20 19 сентября по 20:21 19 сентября.
Прирост по дням за 3 месяца
Оценка по выборке GH Archive. Бледные столбцы — дни, история за которые ещё загружается.