2026-06-29 · 🧠 模型← 本期
Qwen3-ASR 开源:1.7B 参数、WER 1.63%、52 语言、支持歌声识别
语音识别模型的技术竞争轴有三个:词错率(WER)、语言覆盖范围、模型大小。Qwen3-ASR 在这三个维度上同时给出了有竞争力的数字:WER 1.63%(自报)、52 种语言、1.7B 参数。
WER 1.63% 是什么水平?作为参照,OpenAI Whisper large-v3 的英文 WER 约在 2-4% 区间(视测试集而定),MMS 系列在多语言场景下 WER 通常更高。1.63% 如果在多语言平均层面成立,是一个相当激进的数字。但这里需要注意两点:一是 WER 对语言和领域高度敏感,多语言"平均"WER 会掩盖语言间的巨大差异;二是测试集的选择直接影响数字,自报基准应视为上界而非实际部署预期。
52 种语言的覆盖是另一个亮点。Qwen 系列一贯在多语言覆盖上有意识地投入,3-ASR 延续了这一策略。但语言覆盖范围并不等于各语言质量均等——高资源语言(英中法日韩)通常表现好于低资源语言,使用前建议对目标语言单独测试。
歌声识别支持是一个差异化特性。传统 ASR 模型在音乐内容上普遍表现差,因为歌唱的发音模式与对话语音有显著差异。这项能力说明训练数据中包含了音乐和歌唱场景,但具体歌声识别的准确率数据尚未公开。
1.7B 的参数量使 Qwen3-ASR 可以在消费级 GPU 甚至高端端侧设备上部署。结合开源授权(假设沿用 Qwen 系列惯例),它在本地化语音应用和隐私敏感场景中有实用价值。GitHub 2991 stars 的短期热度也反映了社区对这类小型高效语音模型的需求。