Открытый конструктор голосовых ИИ-ассистентов: распознавание речи, языковая модель и синтез речи в одном пайплайне.
Speech To Speech — модульный пайплайн для голосовых агентов на открытых моделях: распознавание речи, языковая модель и синтез голоса, работающий через WebSocket и WebRTC по протоколу OpenAI Realtime. Каждый блок можно заменить, а языковую модель — запускать локально или через облачный сервис. Уже используется как рабочий backend для тысяч роботов Reachy Mini.
Описание автора:Build voice agents with open-source models
Python★ 13 202создан 7 августа 2024форков 1 666Apache-2.0