HF 联合 Hume AI 在 8 月 21 日发的博客 Measuring benchmark optimization in speech recognition
他们对 11 个常用开源 ASR 模型(Whisper-Large-v3、Qwen3-ASR-0.6B、Kimi-Audio-7B-Instruct、Moonshine-Streaming-Medium、Voxtral-Mini-3B-2507、Parakeet-TDT-0.6B-v2、Canary-Qwen-2.5B、Higgs-Audio-v3-8B-STT-v2、Granite-Speech-4.1-2B、Phi-4-Multimodal-instruct、Cohere-Transcribe-03-2026)做了三组
反刷榜测试,验证“分数变好”是否真的等于“实战变强”。
第一组是参考不一致。他们用音素错误率(PER)低的模型组成 ensemble,把和官方参考听写不一致的片段标出来、人工复核。在分析的 VoxPopuli 测试集里,40% 的片段含潜在参考错误,覆盖约 3% 的所有参考词。
第二组是掩码数字恢复。把音频里的数字消掉,再让模型听写。LibriSpeech 上,跑分最强的几个模型里约 30%–40% 的样本会按参考文本把数字补回去。
第三组是拼写切换。同一发音、不同拼写,看模型会不会按基准习惯走。
博客给出的结论有三条:
第一,分数最低的几个模型恰好是错误参考复现率最高的那一批,分数低但刷题准是一组同时出现的现象;
第二,这些模型本身具备忠实转写能力,但会用周围声学上下文判断该按哪一套规矩走;
第三,对选型的人最值得看的是 held-out 评测Open ASR Leaderboard 已经加了 Benchmark fitting 标签(VoxPopuli 参考错误率 + 跨基准拼写切换),GitHub 上的脚本和未归一化模型输出都已经公开,看单一公开 WER 已经不够。给基准开发方的建议是用时间、说话人或元数据切分替代 i.i.d. 切分、训练数据透明、模型选择过程可复现。
公共基准依旧有价值,但前提是能分清真进步和针对某一套题的刷分。



