Движок для запуска больших языковых моделей Qwen3.5 на одной видеокарте RTX 5090 с максимальной скоростью инференса.
NInfer — написанный с нуля на C++ и CUDA движок для запуска моделей Qwen3.5 (обычных и MoE) на одной видеокарте NVIDIA RTX 5090. Принимает текст, изображения и видео через локальный интерфейс командной строки или HTTP API, совместимый с OpenAI и Anthropic. Поставляется в виде готовых файлов с уже упакованными весами моделей в разных форматах сжатия.
Описание автора:High-performance single-GPU inference for selected model checkpoints and GPUs.