千问语音识别模型Qwen3-ASR开源！饶舌RAP歌曲也能轻松识别

2026-01-30 11:21:16

阿达旻

发布在

快讯

阅读：1157

1月29日，阿里开源千问语音识别模型Qwen3-ASR系列，性能达开源最佳（SOTA），直逼顶级闭源模型。该模型支持52种语言与方言，可精准识别语速快的饶舌RAP歌曲，并在10秒内处理5小时音频。此次开源包括1.7B和0.6B两个版本，前者准确率极高，后者效率与性能平衡，适合端侧部署。Qwen3-ASR在中文、英文及方言识别上领先GPT-4o等闭源API，方言错误率比Doubao-ASR低20%。此外，阿里还开源了语音强制对齐模型Qwen3-ForcedAligner-0.6B及推理框架，加速产业落地。截至目前，阿里已开源400余个模型，千问家族全球下载超10亿，衍生模型超20万，采用率达53%，位居全球第一。

原文链接

本文链接：https://kx.umi6.com/article/32352.html

转载请注明文章出处

Qwen3-ASR