syv-ai /HyperQwen
Настройки и патчи для быстрого запуска больших языковых моделей Qwen на одной домашней GPU-карте (24 ГБ) через vLLM.
HyperQwen — набор патчей к vLLM, конвейер сжатия модели (реквантование) и готовые бенчмарки для запуска крупной модели Qwen3.8-27B на одной потребительской видеокарте с 24 ГБ памяти. По заявленным на RTX 3090 измерениям, скорость доходит до 127 токенов в секунду для одного пользователя и около 1035 токенов в секунду суммарно при 64 одновременных запросах, с контекстом до 262 тысяч токенов. Сервис поднимается в Docker и отдаёт API, совместимый с OpenAI.
Описание автора: Serve large Qwen models fast on the GPUs you actually own. Qwen3.8-27B on a single 24 GB card with vLLM: 127 tok/s single-user (381 when the answer quotes the prompt), ~1,035 tok/s at 64 concurrent, 150k-262k context. vLLM patches, requant pipeline, benchmarks.
Сколько звёзд прибавилось
- Сутки ≈ +58 1684-е место
- Неделя ≈ +221 980-е место
- Месяц ≈ +1 224 660-е место
- 3 месяца ≈ +1 224 2434-е место
Без значка — точная разница ежедневных снимков счётчика GitHub, со значком ≈ — оценка по архиву событий.
Точный счётчик GitHub: +95 звёзд с 00:33 16 сентября по 03:21 19 сентября.
Прирост по дням за 3 месяца
Оценка по выборке GH Archive. Бледные столбцы — дни, история за которые ещё загружается.