Открытая модель от Tencent Hunyuan для генерации и редактирования речи: синтез голоса, замена интонации, шумоподавление.
AuK — модель на 1,5 миллиарда параметров, обученная на миллионах часов аудио, которая создаёт речь по тексту, редактирует уже записанную речь по содержанию или интонации, убирает шум и разделяет голоса на записи. Поддерживает работу без обучения на конкретном голосе (zero-shot) и управление через текстовые инструкции. Есть демо на Hugging Face и ModelScope, готовые веса модели и код для дообучения.
Описание автора:AuK: An Open-Source Foundational Model for Speech Generation and Editing