Готовый рецепт для запуска крупной языковой модели Qwen3.8-Flash-Next на одной GPU в Google Colab с API как у OpenAI.
Collabosm настраивает окружение Google Colab (видеокарта A100-80GB) для загрузки большой модели Qwen3.8-Flash-Next и запускает на ней сервер с интерфейсом, совместимым с OpenAI API, чтобы подключить к ней любой обычный клиент. В репозитории приведены измеренные показатели скорости генерации текста и объёма памяти под разные размеры контекста. Подходит разработчикам и энтузиастам, которые хотят опробовать крупную модель без своего сервера.
Описание автора:Run Qwen3.8-Flash-Next (125B-A6B MoE) on ONE Colab A100-80GB High-RAM: pinned runtime, weights from HF, OpenAI-compatible endpoint, measured 2.8k-3.9k t/s prefill / 90-97 t/s decode, plus a verified pinned-RAM KV tier.