Сжатая версия речевой нейросети Qwen3-ASR от XPeng — распознаёт речь почти так же точно, но заметно легче.
X-AuT — метод сжатия аудиочасти речевых нейросетей: авторы уменьшили аудиомодуль модели Qwen3-ASR примерно на 20% по числу параметров, удалив часть слоёв и до-обучив оставшиеся через дистилляцию знаний от исходной модели. Это снижает затраты вычислений на распознавание речи, сохраняя точность транскрипции.
Описание автора:code repo for X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation