Модель распознавания речи в реальном времени с низкой задержкой — для живых субтитров и голосовых ассистентов.
Confucius4-R2T2 превращает речь в текст на лету, выдавая слова блоками от 80 миллисекунд до 2 секунд и не переписывая уже показанный текст задним числом. Это удобно для живых субтитров, синхронного перевода речи и голосовых ИИ-агентов, где важно мгновенно показывать стабильный текст без «мигания» и исправлений. Построена на базе модели Qwen3-ASR с обучением на распознавание устойчивых частей фразы.
Описание автора:Confucius4-R2T2: A Low Latency and High Accuracy Real-Time Speech Recognition Model