量语音助手的三十多把尺子:Qwen-Audio-3.1-Realtime 报告里的每个测试集,测什么、题长什么样、分怎么算
一份技术报告的分数表,真正读得懂的人不多:OpenAudioBench 的 Overall 是怎么平均出来的、Full-Duplex-Bench 的接管率在什么窗口里数、τ-Voice 的任务成功为什么要看数据库、VoiceChat 的 Spoken 和 Rubric 为什么一升一降。这篇把 Qwen-Audio-3.1-Realtime 报告用到的三十多个测试集逐个拆开:每个是什么、一道题长什么样、分数怎么算、报告里的数字该怎么读。