资讯详情

2000场景+5大模型实测:北大清华发布Duplex-MPE,语音助手何时该沉默?

📅 2026/10/9 16:18:13 | 华诺云谱 👁 阅读
2000场景+5大模型实测:北大清华发布Duplex-MPE,语音助手何时该沉默?
Duplex-MPE: Benchmarking Multi-Party Interaction in Full-Duplex Dialogue作者Chengqian Ma, Wenhao Feng, Weixuan Jin, Gaole Dai, Tianyu Xie, Yuexiao Ma, Zhaolu Kang, Xiangyu Zhao, Xiawu Zheng, Fei Chao核心发表机构Peking University、Renmin University of China、Tsinghua University、Nanyang Technological University、Xiamen University、Fudan University论文链接arXiv:2609.31948v1发布于arXiv 预印本cs.SD|—|—||T| 直接、仍未解决、针对 Aria 的请求 |回答每场景恰好一个 ||N1| 提到了 Aria但没有要求它做任何事 | 沉默 ||N2| 针对的不是 Aria而是另一个人、另一个东西或另一个助手 | 沉默 ||N3| 无指定收件人的语音包括自言自语、思考出声 | 沉默 ||N4_Q| 人类 asker 向 Aria 提出的一个问题 | 在 3 s 内作答 ||N4_R| 随后的 resolution由人类回答该问题或告诉 Aria 不必回答 | 停止或保持沉默 |T 被放在预先指定的位置桶中永远不是第一轮且 T 之后总有后续对话——这样“场景结束”就不会被模型当作响应线索。当场景含 N4 时N4_Q 按设计指向 Aria但它是一个独立的时间事件其请求随后由人类resolver可以是 asker 本人或另一名参与者解决助手无需作答。数据集规模与音频账目如下2,000 个场景 / 条件合计 4,000 段被评估对话其中 1,500 段三人对话、500 段四人对话T 的位置按 early-middle / middle / late-middle 分为 667 / 667 / 666968 个场景在 T 之后含 N4 事件。Qwen3-TTS 按固定 speaker-to-voice 映射A→ryanB→aidenC→ericD→dylanA/B/C/D 是场景内说话人标识符而非人名逐轮合成采样率 24 kHz。人类语音片段共 105.55 小时加上 5.37 小时的 0.4 s 轮间间隔构造对话总时长 110.93 小时其中 44.45 小时为跨版本复用去重后不同片段为 61.10 小时。单次被评估对话平均 99.8 秒显式均值 99.5 s、隐式均值 100.2 s。上述时长均不含 duty preamble 与评测中模型相关的等待时间。调度器统一控制时序普通人类轮之间插入 0.5 s 静音T 之后若模型尚未说话给 5 秒窗口开始一次新鲜浊音起始一旦检测到语音便等待 2 秒确认静音上限 60 秒计时起点为新的 onset若 T 结束时模型已在说话则从 T 结束时刻起算N4_Q 之后固定流式播放 3 秒静音随后播放 N4_R——无论模型是否已说完。所有时序检测均基于解码后的助手波形使用因果 Silero VAD要求至少 120 ms 语音、合并短于 800 ms 的停顿仅在对 T 响应是否结束时应用单独的 2 秒端点规则。作者明确不使用 token 时间戳因为声码化发生在可听输出之前。3.2 关键模块 / Key ModulesDuplex-MPE 由四个关键模块组成脚本生成与配对改写、语音合成与时间对齐、四项独立指标以及时序与语义两段式评分。1数据集构建与显式 / 隐式配对。脚本由 Claude Opus 5 从五个属性的组合生成setting地点、activity参与者所做的事、relationship关系、device context在场设备用于制造 N2 型“对另一助手说话”、register语域。每个脚本规定人类说话人、话语、轮次标签与 T 的金标准答案。配对版本通过翻转 T 是否显式点名 Aria 来构造显式版把名字加入请求隐式版用上下文线索替换名字——不能简单删除名字因为那样请求可能被合理理解为指向房间里的某个真人当 T 无法自然承载指向助手的线索时还会改写紧邻的前一轮以建立说话对象。改写保持轮次数与事件标签序列但后续的 N4 编辑和独立合成会引入措辞、事件数量与音频的差异。因此作者是在完整配对场景之间比较响应是否出现而不把差异单独归因于名字出现与否。最终 1,958 对仅改 T、42 对还改了前一轮加入 N4 编辑后1,661 对仅在 T 处不同、339 对有额外文本差异其中 16 对轮数不等。所有配对保持相同的 T 金标准答案。如上图所示构建流水线是“生成脚本 → 提供标签与答案 → 语音合成 → 提供音频边界 → 时序检查 语义判断 → 人工验证样本与模型输出”。逐轮合成的一个关键收益正是构建级金标准边界每一轮的起止时间是合成时已知的而不是事后用 VAD 反推的这使 fresh-onset、静默保持与 N4 停止这类强依赖时间对齐的指标得以可靠计算。2四个独立评分维度。表 1 给出指标的固定定义分子分母在任何结果被查看前即已确定指标定义Fresh-onset response rate在所有 2,000 个 T 请求中请求结束时无语音、且在 5 秒内出现新语音起始的比例Conditional answer accuracy在响应窗口内有语音的 T 请求中回答正确的比例Silence preservationN1、N2、N3 窗口中无语音、或仅有不夺取发言权的简短确认的比例Answering-window yield在“N4 问题期间无语音、问题后 3 秒内首次说话、且 N4_R 开始时仍在说话”的 N4 事件中在 N4_R 开始 2 秒时保持静默且贯穿其余观察窗口的比例Response presence诊断所有 2,000 个 T 请求中存在任何语音含已在进行的语音的比例Window response诊断N4 事件中在问题期间或随后 3 秒作答窗口内存在任何语音的比例其中两处设计值得注意。第一fresh-onset 与 response presence 使用相同的 2,000 个 T 轮次但前者要求 T 结束时无活跃语音且 5 秒内有新的浊音起始后者还计入 T 结束时已经在进行的语音这一区分把“新的说话决策”与“宽松的语音覆盖”分开同时不给延续语音第二次能力评分。第二answering-window yield 只对同时满足三个条件的事件评分模型在 N4_Q 期间保持静默、在随后 3 秒内开始说话、N4_R 开始时仍在说话在问题结束前说话、作答窗口内从不说、或在 N4_R 开始前已结束的事件被排除而非计为停止失败。停止截止时间固定为 N4_R 开始后 2 秒若 N4_R 片段加其后 0.5 秒静音超出截止时间模型还需在该区间剩余时间内持续沉默。人类片段提前结束不会缩短这 2 秒截止时间。此外answering-window yield 与答案是否正确无关它只统计通过上述检查的评分事件比例。上图给出了各指标所依据的语音时间线示意。可以看到fresh-onset 与 response presence 的差别被刻画为“T 结束时刻是否已有语音”而 answering-window yield 的合格条件被刻画为“N4_Q 静默—3 秒窗口内起说—N4_R 开始时仍在说”的三段式漏斗。3两段式评分。Conditional answer accuracy 的流程是Qwen3-ASR-1.7B 转写解码响应再由 Claude Opus 5 将其语义与金标准答案比较忽略填充词、礼貌用语与转写噪声无法解析的正确性判定计为不正确。Silence preservation 则采用 VAD 直通加语义豁免VAD 未检出语音的窗口直接通过不调用 ASR 或 Opus只有检出语音的窗口才被合并转写并由 Opus 5 分类其输入包括该文本、截至当前轮的最多三轮人类轮、模型语音总时长及其与人类语音的重叠量。只有被判为BACKCHANNEL简短确认不添加信息、不回答任何问题才获得豁免回答、解释、建议、提出新问题或重复确认直至抢到话轮都属于SUBSTANTIVE_INTRUSION。时长本身不决定是否允许——像 “Nine dollars” 这样短的回答也算入侵反之检测到语音后空转写、或 Opus 未给出可识别标签均判该窗口失败。作者明确说明这些是在缺乏内容分类情况下的打分决定不等同于已确认的实质性入侵。4文本条件参考。Gemini 3.1 Pro 在转写文本上评估给定职责指令、当前话语与带说话人归属的前文它选择RESPOND或SILENT对选择响应的 T 请求再生成文本答案。它的决策独立使用脚本历史不使用未来话语、也不使用之前模型生成的答案。需要强调该参考既不是声学系统也不是语音模型性能的上界它的作用是证明该配对干预在词汇内容与说话人归属已知时确实能改变决策从而为语音系统的对比提供基准。最后论文解释了为什么不对非全双工模型评分Duplex-MPE 要求模型接收连续房间音频、自行决定何时说话、并在说话时保持聆听适配分段式模型需要评估者选择分段或调用点这会使 fresh-onset 响应率部分取决于测试装置并使 answering-window yield 无定义。因此评分评估仅限全双工系统。被评的五个系统均满足三条选择标准——代码与权重公开可用、支持连续音频输入、推理接口允许模型在持续接收输入的同时自行决定何时发声其权重分别来自openbmb/MiniCPM-o-4_5、kyutai/moshiko-pytorch-bf16使用男声 moshiko checkpoint、CofeAI/FLM-Audio、maitrix-org/Voila-autonomous-preview与VITA-MLLM/Freeze-Omni。四、实验 / Experiments4.1 数据集与评估指标 / Datasets Metrics数据集即前述 2,000 个场景的显式与隐式版本共 4,000 段被评估对话全部为合成英语场景。评分窗口的统计构成为T 请求 2,000 个 / 条件N1 3,041显式/ 3,039隐式N2 14,052 / 14,054N3 3,267 / 3,267N4_Q 与 N4_R 各 1,911。N1–N3 的静默窗口总数为 20,360 / 条件构成 silence preservation 的分母。时长方面显式 T 请求平均 8.18 s、隐式 T 请求平均 8.58 s平均字符数 111.6 vs 123.3作者明确指出这是描述性对比不是措辞效应的独立因果估计。评估指标为前述四个计分项加两个诊断项彼此分母独立、不聚合。统计方法包括配对显式 / 隐式比较使用精确双侧 McNemar 检验α 0.05 \alpha0.05α0.05差异以百分点表示为Δ explicit-implicit N explicit-only − N implicit-only 2000 × 100 ; \Delta_{\text{explicit-implicit}}\frac{N_{\text{explicit-only}}-N_{\text{implicit-only}}}{2000}\times 100 ;Δexplicit-implicit​2000Nexplicit-only​−Nimplicit-only​​×100;模型对之间的比较同样使用精确双侧 McNemar 检验并以 Bonferroni 校正覆盖每个称呼条件下的 20 个测试两个指标各十个模型对p c o r r p_{\mathrm{corr}}pcorr​为原始p pp乘以 20、上限为 1silence preservation 的置信区间通过按场景有放回采样 2,000 个场景、重复 10,000 次seed 20260902取差异的 2.5 与 97.5 百分位得到conditional answer accuracy 的两两比较仅使用两个模型都未静默的共享 T 请求因此其比率可能与模型特定主表比率不同。人工验证分两阶段由六名学生担任评审每个条目由两人评估、分歧经讨论裁定。构建阶段抽取 50 个场景对38 个三人 12 个四人、共 100 个对话条目、1,282 个人类轮次出现、95 个 N4 问题–解决对T 可答性仅用请求本身与前文对话判断且在揭示金标准答案之前进行N4_Q 只检查被寻址对象不要求答案能从前面推断。评测阶段从每个模型每个称呼条件下采样 5 个判为 correct 和 5 个判为 incorrect 的 T 响应、5 个 acknowledgement 和 5 个 intrusion 的 N1–N3 输出共 200 个输出片段加上 100 个对话条目共 300 个评审条目、600 次初始评估。结果构建检查通过率 98%–100%T 指向 Aria 100%、T 有唯一且被前文支持的答案 100%、金标准答案正确且被支持 98%、N4_Q 指向 Aria 100%、N4_R 回答或取消请求 100%、N1–N3 无需实质性回应 99.70%、TTS 可懂且保义 100%评测检查中 ASR 保留模型输出含义 100%、与 Opus 5 在答案正确性上 99% 一致、在确认与入侵判别上 98% 一致。4.2 主实验结果 / Main Results主结果按 T 的称呼条件分列如下节选自表 2answer accuracy 使用模型特定的响应存在事件作分母answering-window yield 使用模型特定的合格事件模型T 称呼Fresh-onset ↑Cond. accuracy ↑Silence pres. ↑AW yield ↑Resp. presenceWindow responseMiniCPM-o 4.5Explicit0.95000.47300.92420.59640.95450.9513Implicit0.94350.46650.92890.59250.94850.9461MoshiExplicit0.63400.01230.27340.19180.81550.9226Implicit0.67000.01700.26760.21070.82200.9309FLM-AudioExplicit0.53800.00110.39570.00820.95050.9927Implicit0.54250.00050.39910.00590.95400.9937VoilaExplicit0.64650.00310.83510.84840.65150.6217Implicit0.66700.00750.83070.80460.66900.6196Freeze-OmniExplicit0.25250.00350.0002n/a (n1)0.99551.0000Implicit0.25800.00150.0002n/a (n1)0.99750.9995“话多”不等于“参与得当”。这组数据最重要的方法论发现是单一的响应率会掩盖产生该响应的行为。显式条件下Freeze-Omni 的 response presence 最高0.9955但 fresh-onset response rate 最低0.2525FLM-Audio 的 response presence 为 0.9505fresh-onset 仅为 0.5380而 MiniCPM-o 的二者差距仅 0.00450.9545 vs. 0.9500。这一差距正好等于“请求完成时语音已活跃”的 T 轮次比例——Freeze-Omni 在 2,000 个 T 请求中有 1,486 个在请求结束时已在说话因此它的“高响应率”主要来自持续语音而非新的说话决策。同样地response presence 高也不意味着答案准确。显式条件下 MiniCPM-o 与 FLM-Audio 的 response presence 相近0.9545 vs. 0.9505但条件答案准确率相差三个数量级0.4730 vs. 0.0011——后者在 1,901 个响应存在请求中只产出 2 个正确答案。response presence 高也不意味着选择性应答MiniCPM-o 与 Freeze-Omni 的 response presence 接近0.9545 vs. 0.9955但 silence preservation 为 0.9242 与 0.0002Freeze-Omni 在 20,360 个需要静默的窗口中只有 5 个保持静默。即便在非极端案例中Moshi 的 response presence 高于 Voila0.8155 vs. 0.6515其 silence preservation 却低得多0.2734 vs. 0.8351。作者强调此比较针对可观察的语音分配而非模型内部机制。显式与隐式称呼的对比。文本参考 Gemini 3.1 Pro 在 2,000 个匹配对上给出 explicit 响应率 0.9470、implicit 0.3040配对差 0.6430即 64.3 个百分点精确 McNemar 检验p 10 − 371 p10^{-371}p10−371其条件答案准确率为 explicit 0.9039、implicit 0.7911静默保持率为 explicit 0.9537、implicit 0.9934。相比之下五个语音系统的显式减隐式响应率差仅从− 1.75 -1.75−1.75到 0.60 0.600.60个百分点所有五个精确 McNemar 检验的p pp值均超过 0.05最小值 0.2365因此未建立称呼条件之间的系统性响应率差异。具体计数上MiniCPM-o 有 1,819 对两种条件都响应、90 对仅显式响应、78 对仅隐式响应、13 对均不响应Δ 0.60 \Delta0.60Δ0.60ppp 0.3961 p0.3961p0.3961Freeze-Omni 的对应计数为 1,986 / 5 / 9 / 0Δ − 0.20 \Delta-0.20Δ−0.20ppp 0.4240 p0.4240p0.4240。作者谨慎地指出这种模式可能反映两种可能成功从上下文推断受话人或未能把名字识别为称呼线索——两种机制都会导致模型在两种条件下倾向相似。指向他人或设备的请求。显式条件下MiniCPM-o 在 95.45% 的指向 Aria 的 T 请求后出现语音而在 4,704 个指向其他人或设备的请求中有 216 个未能保持静默4.6%即它被称呼时频繁响应、别人被称呼时通常保持静默。按轮次类型细分的静默失败率也支持这一画像MiniCPM-o 在显式条件下对设备请求N2失败 140/2,570、对人类请求N1/N2失败 76/2,134合并约 4.59%、对陈述N1/N2/N3失败 9.3%、对自言自语N3失败 5.3%而 Freeze-Omni 在所有四个类别上的失败率均为 100.0%。发言权释放是被覆盖情况条件化的结果。显式条件下MiniCPM-o 在 1,911 个 N4 窗口中有 1,818 个产生语音其中 1,736 个在问题播放期间保持静默并在问题结束后 3 秒内开始说话其中 1,633 个在 N4_R 开始时仍在说话因此其停止能力由 answering-window yield 评分。Freeze-Omni 则在全部 1,911 个窗口都有语音但 1,784 个是从问题之前延续的语音只有1 个事件进入 answering-window yield 分母因此因样本不足 30 不报告该比率。显式条件下的合格事件与估计值为MiniCPM-o n 1,633 / yield 0.596Moshi n 219 / 0.192FLM-Audio n 977 / 0.008Voila n 620 / 0.848隐式条件下四个可报告估计为 0.593、0.211、0.006、0.805。停止失败的细节也很有信息量显式条件下 FLM-Audio 在 977 个评分事件中有 968 个在 N4_R 开始 2 秒后仍在说话Moshi 的 177 个失败事件中有 97 个是在截止时刻静默、但在 N4_R 观察窗口结束前再次说话——这说明短暂停顿不够模型必须从截止时刻起保持静默直到该窗口结束。按请求时机的响应表现。把 4,000 个请求按从首个人类轮起算到 T 起始的耗时排序范围 14.50–263.97 s以 40.224 s 与 54.656 s 为三分位边界分为 earlier / middle / later 三组1,330 / 1,335 / 1,335所有模型共用同一分组。Voila 的 response presence 随请求靠后单调下降显式从 71.64% 降到 59.55%、隐式从 76.21% 降到 55.82%FLM-Audio 的 fresh-onset 从约 67% 降到 47%–49%但其 response presence 在每个分组都保持在 94% 以上MiniCPM-o 的条件答案准确率从约 50–51% 降到 44–47%其他四个模型每组答案准确率都低于 2%没有可测量的进一步下降空间。这些趋势被明确标注为描述性的不作因果解释。敏感性与不确定性。用语音总时长重做静默保持分析去掉语义豁免阈值取 0/100/200/300/500 ms各称呼条件下模型排序均不变且与报告的语义排序一致τ 0 \tau0τ0时占用窗口计数与每次运行的语义评审记录数完全一致。指标选择的影响也被量化合并五个模型的十个条目后fresh-onset response rate 与 response presence 排序的 Spearman 相关系数为− 0.4303 -0.4303−0.4303显式条件下没有任何模型保持相同排名——Freeze-Omni 从 response presence 第一名变为 fresh-onset 最后一名因为其 0.7430 的 T 轮次包含延续语音而 MiniCPM-o 的二者差距仅 0.0045。场景级 bootstrap 的 95% 置信区间支持所有五个模型在两种称呼条件下的静默保持排序对最接近的一对 MiniCPM-o 与 Voila区间显示 MiniCPM-o 领先 8.25 到 9.58 个百分点。在共享响应请求上的正确性比较中MiniCPM-o 显著高于其他每个模型Moshi 在两种条件下都超过 FLM-AudioMoshi 与 Freeze-Omni 的隐式比较显著28/1,640 vs. 2/1,640p c o r r 1.74 × 10 − 5 p_{\mathrm{corr}}1.74\times10^{-5}pcorr​1.74×10−5显式比较不显著20/1,623 vs. 5/1,623p c o r r 0.0815 p_{\mathrm{corr}}0.0815pcorr​0.0815但两者绝对准确率都很低。4.3 消融实验 / Ablation Study论文没有传统意义上的模型内部消融五个系统均为现成开源权重仅做推理评测不涉及训练或损失函数但其控制变量分析承担了消融的角色用于检验结论是否稳健、指标是否自洽。第一显式 / 隐式配对反转是最核心的干预控制。它保持了场景级任务与金标准答案不变只改变请求的称呼方式。结果形成一个鲜明对照该干预在一个转写条件参考上产生了 0.6430 的响应率差p 10 − 371 p10^{-371}p10−371而在五个声学系统上均未检测到显著差异p pp最小 0.2365。文本参考的两次独立评估还给出了一致性控制在 48,542 个 RESPOND/SILENT 决策上一致率 97.2%response presence、silence preservation、window response 两次差异至多 0.95 个百分点paired addressing 差异分别为 0.6430 与 0.6455——大对比可复现而条件答案准确率在两次评估间有波动explicit 从 90.39% 升到 97.02%implicit 从 79.11% 升到 81.03%。作者提醒不显著不等于条件等价只能说没有足够证据表明响应概率不同。此外文本评估没有语音时间线因此不测量 fresh-onset response rate也不测量 N4_R 开始后的停止。第二按轮次类型分解的静默保持。文本参考的静默保持按类型为explicit 下 N1 0.9231、N2 0.9715、N3 0.9057、合计 0.9537implicit 下 N1 0.9865、N2 0.9964、N3 0.9865、合计 0.9934——implicit 条件下静默保持更高与其低的响应率一致。语音系统的跨类型失败率则揭示了更细的差异MiniCPM-o 在四类上失败率均在 5% 上下Voila 在 device-directed 与 human-directed 上约 11%–13%、在 self-talk 上升到 25%–27%Moshi 在 70%–80% 区间FLM-Audio 在 50%–64% 区间Freeze-Omni 恒为 100%。第三阈值敏感性扫描与语义豁免的对照。声学口径无语义豁免与语义口径存在系统性差异且方向可解释Moshi 的语义分数约 0.27显著高于其声学分数0.08–0.21说明存在大量被语义判为允许的确认Voila 的语义分数落在 300 ms 与 500 ms 阈值之间Freeze-Omni 在所有阈值下均约为 0.0002。文献还给出一个影响量化算例显式条件下 Voila 有 4,765 个窗口检出语音、其中 171 个无转写若把这 171 个当作通过silence preservation 增加171 / 20,360 ≈ 0.00840 171/20{,}360\approx0.00840171/20,360≈0.00840即从 83.51% 升到 84.35%不改变模型排序。第四指标定义的选择效应。上文提到的 Spearman 相关系数− 0.4303 -0.4303−0.4303与“显式条件下没有任何模型保持相同排名”说明如果把 response presence 当作能力分数得到的结论会与 fresh-onset 大相径庭。这正是作者坚持不构造聚合分数的经验依据这些指标测的是不同行为把它们平均会掩盖失败画像。第五N4 停止的漏斗式筛选。ayfunnel把 N4 事件分为“问题开始时已在说话”“问题期间开始说话”“问题后 3 秒内首次说话”三类只有第三类且 N4_R 开始时仍在说话的事件才进入 yield 分母。这一设计区分了两类失败从不给答案在第一、二类中已失去评分资格或不构成主动作答与给了答案但不肯停第三类中跨越截止时刻仍在说话。表格显示 Freeze-Omni 在显式条件下分别有 1,784 与 126 个事件落入前两类、仅 1 个落入第三类因此其条件停止率不可单独解读必须与漏斗计数一起阅读。作者还区分了两种停止失败still voicing2 秒截止时刻仍在发声与resumed截止时刻沉默但观测结束前又发声后者正是 Moshi 多数失败事件的形态。第六定性样例佐证语义判定的边界。论文给出的豁免与惩罚对照包括MiniCPM-o 的 “Understood.”0.67 s被判为豁免而 “Yeah, I’m free for all three.”2.30 s因添加新内容被判惩罚Moshi 的 “I’m sorry.”0.38 s豁免而 “It’s a valid point, but.”2.18 s因开始评价并反驳被判惩罚FLM-Audio 的 “Good luck.”0.67 s豁免而一段 5.60 s 的 “Siri is developed by Apple Inc.” 因引入无关事实被判惩罚Voila 的 “Thank you.”0.42 s豁免仅 0.45 s 的 “The ants.” 因承载内容、引入新信息被判惩罚Freeze-Omni 的 7.30 s 多子句建议被判惩罚。这些例子直观说明豁免与否取决于内容功能而非时长——0.45 秒的内容性回答失败2 秒以上的实质性话语同样失败。五、相关工作 / Related Work论文把自身定位在三类研究的交叉处并反复用同一张协议对照表来区分任务接口而非模型分数。全双工口语对话与轮次交替评测。轮次交替研究考察说话者何时取得或保留发言权连续预测、词汇完整性与语音活动投影为这些决策提供线索dGSLM、Moshi 等音频对话模型生成并行对话流。评测方面传统口语基准在孤立输入上打分沉默从不是正确输出全双工基准如 Talking Turns、Full-Duplex-Bench含停顿、backchannel、轮次转换、打断、FD-Bench 与 MTR-DuplexBench 则考察“何时接管、保持或让出话轮”但都围绕一个指定用户。Duplex-MPE 的补充在于让每个说话者都参与对话状态助手只是多个潜在收件人之一。收件人识别与设备定向语音检测。经典工作在会议或聊天语料上为给定话语预测收件人inoue2025addressee给 GPT-4o 五个上下文轮次要求从 A/B/C/O 四个标签中选一个fukuda2026meetings提供 AMI 的 ground-truth speaker ID 与对齐转写、音频、视频在四个参与者加 group 与 none 上以 accuracy 和 macro-F1 评分DDSD 系列则判断话语是否面向助手或设备。这些工作的评估单元是被提供的一句话语、输出是显式标签Duplex-MPE 把收件人识别当作控制端到端模型是否发声的潜在决策只观测模型选择输出的波形。选择性响应与非定向语音。文本侧有 speak-or-stay-silent 数据集与若干“何时该说话”的 LLM 研究。音频原生侧Full-Duplex-Bench v1.5 的四个条件中有两个是非定向语音对他人说话、背景语音其期望是在非定向条件下过滤重叠并恢复此前正在进行的回答HumDial 定义了完整的 rejection 类别含第三方语音与对他人说话其打断任务还含“要求模型停止说话”的显式请求WearVox 在 AI 眼镜上采集 3,842 段多通道第一视角会话五个任务之一即 side-talk rejection。这些工作都只要求拒绝指定用户交互之外的语音Duplex-MPE 中其他参与者的语音可以为后续请求建立上下文也可以解决一个已针对助手的请求因此模型必须跟随所有参与者同时单独决定是否发声。此外论文区分了两个相邻评测任务ProVoice-Bench 评估由隐式意图、用户自定义条件、上下文矛盾或声学事件触发的主动语音属单用户设定MSU-Bench 评估以说话人为中心的理解跨 16 个任务谁在说、说了什么属理解类任务。两者与 Duplex-MPE 所测的语音控制行为互补。协议对照表进一步凸显了这一差异Talking Turns 是 streaming 且让出话轮但不含非定向语音、也无多用户概念Full-Duplex-Bench v1.5 与 HumDial 含非定向语音但仍服务于固定用户inoue2025addressee、fukuda2026meetings与 WearVox 不是流式交互评测只有 Duplex-MPE 在四个维度上同时满足。六、局限性与展望 / Limitations Future Work论文对自身边界给出了相当克制的说明可分为数据、指标、对象与外推四个层面。数据合成性。所有基准对话均为生成所有语音在确定性说话人到语音映射下合成无任何参与者被录音未收集真实对话或个人记录。作者明确指出合成英语场景不代表真实人群、房间声学或社会规范可能继承生成模型与语音合成模型的偏差因此结果只应针对基准场景解释不应支持关于特定说话人群体的主张。配对归因的谨慎。虽然显式 / 隐式设计保持了轮次数与事件标签序列但后续 N4 编辑与独立合成仍会在最终版本之间引入措辞、事件数量与音频差异339 对有额外文本差异其中 16 对轮数不等。因此论文只在完整配对场景之间比较响应是否出现不把差异单独归因于名字的出现。T 请求的时长差异8.18 s vs. 8.58 s也被声明为描述性对比不是措辞效应的独立因果估计。指标的边界条件。第一conditional answer accuracy 只在有语音可用时评估显式与隐式的分母不同且两两比较仅使用两个模型都未静默的共享请求因此其比率可能与主表比率不同。第二silence preservation 的失败包含 substantive intrusion 与 judge error 两类空转写与无效标签被当作失败作者承认这是在缺乏内容分类情况下的打分决定不等同于已确认的实质性入侵。第三answering-window yield只描述合格事件——Voila 的高条件率描述的是其合格事件上的停止行为不代表整体 N4 表现Freeze-Omni 因仅有 1 个合格事件且未停止样本不足 30 而不报告。第四停止判定只看时间对齐不看内容。第五不构造聚合分数因此不存在一个“总排名”。第六显式与隐式的语音系统差异不显著只说明证据不足不建立条件等价。评测对象的限制。评分评估仅限全双工系统非全双工模型需要评估者选择分段或调用点会使 fresh-onset 响应率部分依赖测试装置、并使 answering-window yield 无定义分段接口下的指令敏感性只作为非评分探针报告。Gemini 3.1 Pro 的文本参考既非声学系统、也不是语音模型性能的上界。人工验证是抽样的构建检查覆盖 100 段对话与 1,282 个 TTS 轮次评测检查覆盖 200 个 ASR 转写、100 个 T 答案判断与 100 个 N1–N3 判断合计 300 个评审条目、600 次初始评估。未来方向。论文在结论中指出同一分类法与自动化生成 / 评估管线支持更大规模或全新的评估抽样而非依赖固定的人工标注集可复现性方面将发布场景清单、逐轮音频与构建边界、职责前言、调度器与检测器设置、逐场景种子与评分代码。由于五个系统均为公开权重、统一调度器与逐字职责指令基准本身具备向新系统、新语种、新声学条件扩展的基础但论文未就这些扩展给出具体实验此处不作推测。七、总结 / ConclusionDuplex-MPE 把“受话人推断”这一原本属于理解类任务的变量转化为一个可观察的语音控制测试端到端模型接收连续多方音频必须在没有转写、没有说话人标签、没有轮次边界、也没有受话人标签的条件下自行决定是否开始说话、说什么、何时保持静默、何时释放发言权。基准包含 2,000 个称呼反转的场景对在各自独立的分母上报告 fresh-onset response rate、conditional answer accuracy、silence preservation 与 answering-window yield轮次类型 T、N1、N2、N3 与 N4_Q / N4_R 共同覆盖“该答、该静、该起、该停”四类行为。在五个开源权重语音系统上的评测表明语音存在的多寡多次无法决定这些能力Freeze-Omni 的 response presence 达 0.9955 而 fresh-onset 仅 0.2525、静默保持仅 0.0002FLM-Audio 的 response presence 达 0.9505 而条件答案准确率仅 0.0011MiniCPM-o 4.5 则在 fresh-onset约 0.95、静默保持约 0.92与条件答案准确率约 0.47上领先并在 answering-window yield 的分母中保有 1,633 个合格事件、yield 为 0.596而 Voila 虽以 0.848 的 yield 最高其 620 个合格事件只占其 N4 事件的一小部分。分项评分把这些现象暴露为彼此不同的失败画像漏答Voila 在两个条件下分别有 697 / 662 个 T 请求完全无响应、低内容应答、侵入性发言、近乎连续说话。最终配对干预对转写条件参考产生了 0.6430 的巨大响应率效应而对被评估语音系统未检测到显著的配对响应存在效应p pp最小 0.2365——这一对照既是基准有效性的证据也提示语音系统在“把名字当作称呼线索”与“从上下文推断受话人”之间的行为仍有待后续研究厘清。原文摘要:Real-time full-duplex speech models can listen while speaking, enabling natural interaction without rigid turn boundaries. Existing benchmarks evaluate turn-taking, interruption handling and multi-round dialogue, but largely centre on a designated user rather than an assistant participating in a shared conversation among several people. We introduce Duplex-MPE to evaluate when such an assistant should answer, remain silent or stop speaking. The benchmark contains 2,000 scenarios with three or four human speakers and one assistant, each paired across explicit and implicit addressing of the same request. Models receive continuous conversation audio without transcripts or supplied turn boundaries. Four scores measure fresh response initiation, answer accuracy, silence preservation and stopping when a human resolves a request. We evaluate five open-weight speech systems: MiniCPM-o 4.5, Moshi, FLM-Audio, Voila and Freeze-Omni. MiniCPM-o 4.5 leads on three scored capabilities, while frequent speech from other systems can coexist with inaccurate answers or failures to remain silent. A transcript-based Gemini 3.1 Pro reference responds 64.3 percentage points more often to explicit than implicit requests; paired tests detect no significant response-rate difference for the speech systems.PDF链接:https://arxiv.org/pdf/2609.31948v1部分平台可能图片显示异常请以我的博客内容为准
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑