Движок для быстрого запуска больших языковых моделей семейства Qwen на устаревших видеокартах Tesla V100.
NInfer — написанный с нуля на C++/CUDA движок для запуска ИИ-моделей на видеокартах NVIDIA Tesla V100; поддерживает текст, изображения и видео через командную строку или API, совместимые с OpenAI и Anthropic. Этот форк добавляет готовый сценарий развёртывания модели Qwen3.8-27B на конкретной карте и сравнение скорости работы с движком llama.cpp.
Описание автора:NInfer on Tesla V100 (sm_70): Qwen3.8-27B deployment, build/convert scripts, systemd service, and cross-engine benchmark (vs llama.cpp). Fork of Neroued/ninfer with sm70 vision-encoding speedup.