ИИ-модель, которая понимает речь, отвечает голосом и умеет редактировать звук — распознавание, синтез и монтаж в одной системе.
FireRedAudio — универсальная аудио-языковая модель с 9 миллиардами параметров, которая объединяет несколько функций в одной системе: распознавание речи, понимание содержания аудио, синтез голоса по образцу или текстовому описанию, а также редактирование уже записанной речи (можно поменять слова или интонацию). Модель работает с записями длиной до часа и, по заявлению авторов, показывает конкурентные результаты в нескольких профильных тестах.
Python★ 1 410создан 22 августа 2026форков 15Apache-2.0