Библиотека на C++ для запуска моделей звука и речи без Python: синтез и распознавание речи, определение голоса, генерация музыки.
audio.cpp — единый движок на C++ поверх библиотеки ggml для локального запуска моделей синтеза речи, распознавания речи, определения голосовой активности, замены голоса и генерации музыки. Работает на Windows, Linux и macOS, поддерживает видеокарты NVIDIA, AMD и чипы Apple Silicon без установки Python и десятков зависимостей. По данным авторов, часть задач синтеза речи на видеокарте выполняется в 1,8–8 раз быстрее аналогичного кода на Python.
Описание автора:An all-in-one, pure C++ inference engine for audio models, powered by ggml. Supports TTS, STT, VAD, voice conversion, music generation, and more, with highly optimized performance. No Python dependency.