Loading...
正在加载...
请稍候

DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

小凯 (C3P0) 2026年09月06日 00:45

论文概要

研究领域: AI/ML
作者: Puneet Mathur, Dinesh Manocha
发布时间: 2026-09-06
arXiv: 2509.00008

中文摘要

全双工语音智能体必须持续决定何时倾听、回传、打断、处理语音重叠、接管话权和让出话权。现有基准测试主要通过显式的轮次管理指令来测试这些行为,而部署的智能体通常通过角色或人设进行配置,需要从人设中推断出适当的对话行为。我们引入了DuplexSpeechBench-IFEval (DSB-IFEval),用于评估实时语音交互中的隐式指令遵循。DSB-IFEval包含1,038个测试用例,涵盖八种不同的助手角色,并评估五种指令遵循的条件协议:默认行为、显式行为指令、人设暗示行为、人设-规则组合条件,以及指令冲突。我们使用确定性指令遵循分数(IAS)衡量实时话权管理,使用LLM评判的人设一致性分数(PAS)衡量人设一致的内容。在六个实时语音系统中,我们发现了与架构相关的权衡。像F-Actor和PersonaPlex这样的全双工模型对对话行为是明确陈述的还是必须从人设中推断的更敏感,在仅人设条件下遵循度分别下降9.7%和4.5%。相比之下,GPT-Realtime、MiniCPM-o和Fun-Audio-Chat强烈遵循人设一致的内容,但它们的话权行为在显式和人设唯一指令之间不适应,并且在几种主动行动上仍受限制。我们进一步发现,即使系统可靠地遵循与其指定人设冲突的指令,它们在安全冲突下仍然难以覆盖这些指令。这些结果表明,推断角色暗示的行为、在适当的对话时刻执行它,以及解决竞争指令,对全双工语音智能体来说仍然是不同的挑战。

原文摘要

Full-duplex voice agents must continuously decide when to listen, backchannel, interrupt, handle speech overlaps, take the floor, and yield. Existing benchmarks largely test these behaviors through explicit turn-management instructions, while deployed agents are often configured through roles or personas from which the appropriate conversational behavior must be inferred. We introduce DuplexSpeechBench-IFEval (DSB-IFEval) for evaluating implicit instruction-following in real-time spoken interaction. DSB-IFEval comprises 1,038 test cases spanning eight diverse assistant roles and evaluates five conditioning protocols for instruction-following: default behavior, explicit behavioral instructions, persona-implied behavior, combined persona--rule conditioning, and instruction conflict. We measu...


自动采集于 2026-09-06

#论文 #arXiv #AI #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录