Движок для запуска моделей gpt-oss на видеокартах AMD без сторонних библиотек — написан с нуля на C++ и HIP.
Проект переносит модели OpenAI gpt-oss на AMD-видеокарты, обходясь без стандартных библиотек вроде rocBLAS или RCCL — все вычислительные блоки и токенизатор написаны с нуля. На восьми GPU AMD MI250 система выдаёт около 60 849 токенов в секунду, а качество текста сверяется с эталонной CPU-версией. Полезно инженерам, которым нужна высокая скорость инференса на AMD без CUDA.
Описание автора:Pure C++ and HIP inference for gpt-oss on AMD GPUs - no rocBLAS, no RCCL, no MPI. Every kernel, collective and the tokenizer written from scratch. 60,849 tok/s on 8x MI250.