每一句都接上了,每一句都晚了半秒

上一篇 WorldSolver,我们给 AI 做了一次物理体检:让它把一捧水、一块布、一缕烟写成真正能跑的模拟器。结论不太体面——最好的模型也只拿到一半分数,一个课本级的牛顿摆都能晃成事故现场。物理直觉是皮肤,而 AI 的皮肤,显然还没长好。

🚪 上期回顾:皮肤还没长好,这次测耳朵

上一篇 WorldSolver,我们给 AI 做了一次物理体检:让它把一捧水、一块布、一缕烟写成真正能跑的模拟器。结论不太体面——最好的模型也只拿到一半分数,一个课本级的牛顿摆都能晃成事故现场。物理直觉是皮肤,而 AI 的皮肤,显然还没长好。

但身体与感观这个考棚,我们才刚走到第二间。

这一间测的是耳朵。更准确地说,测的不是"听不听得清"——语音识别那套老黄历早翻篇了——而是听的时机。你回想一下人类聊天时的那种感觉:朋友话还没说完,最后一个字还在半空中,你已经点着头接上了;饭局上有人讲故事,全桌人的笑声卡在同一个气口上炸开;电话这头你刚停顿半拍,那头的"嗯,我在听"就稳稳落在节拍上。这种接话的节奏感,语言学里叫话轮转换,但我们完全可以换个更日常的说法:这是听觉社会的礼仪。

Timing is everything。接早了,显得抢话;接晚了,显得走神。那个刚刚好的窗口,窄得惊人。

那么问题来了:两个最新的全双工语音模型坐在一起聊天,全程没有人类在场吸收时机误差,它们会 settling into 什么样的节奏?是像两个老搭档一样你来我往,还是像两台客服电话互相念稿?

之所以这个问题值得严肃对待,是因为它戳中了一个正在发生的行业转向:语音模型正在从"工具"变成"对话者"。客服、陪练、语音助手,越来越多的场景里,对面那个声音不再是人。而对话体验的评判标准里,内容对不对只占一半,另一半是节奏顺不顺——一次恰到好处的"嗯",比一万字正确的废话更能让人觉得"被听见了"。如果 AI 之间互相生成的对话本身就带着病态的节奏,以此为燃料的训练、以此为考官的评测,都会把病态当成常态继承下去。

这就是今天这篇论文要测的事。论文叫 Coupled but Late,来自杜克大学,标题已经把答案剧透了:合拍,但迟到。接下来我们看看这两个词分别是怎么被钉死在数据上的。

🎙 先认识考场:没有声音的语音对话

先交代技术背景,尽量不讲术语。

你现在和语音助手说话,主流方案其实还是"对讲机模式":你说完,它把录音转成文字,想好回答,再合成语音放出来。整个过程像发电报——你按一次发送键,等对方回电。人类聊天可不是这样。人类打电话是双工的:两人同时在线,你可以边听边"嗯嗯"地应和,可以在对方说到一半时轻轻插一句,可以把话头抢过来再还回去。最新的全双工语音模型开始接近这个能力了:它们一边接收音频一边生成音频,听和说不互相阻塞。

杜克大学的实验台搭得很干净:两台 PersonaPlex-7B,每个实例独占一张 GPU,中间不经过任何语音识别和语音合成的中间层——注意,这一点很关键——它们直连交换 Mimi 音频 token,12.5 Hz 的速率,每 80 毫秒走一步。路径上从头到尾没有音频存在,纯粹是编码符号的交换。粗码本 160 毫秒就能读出来,细码本要等 240 毫秒。

这套设计的用意很明显:过去测语音对话延迟,总有一口甩不掉的锅——转录要时间,合成要时间,你分不清模型的"慢"是它自己的性格还是流水线的拖累。现在流水线拆了, token 直达,如果还慢,那就是模型骨子里的慢。

考场规则也定死了:36 场种子对话,每场 90 秒,5 个场景——比如公寓洗衣房这种生活化的小舞台。音频温度 0.8,文本温度 0.7,persona、场景、声线、随机种子全部固定。两台机器隔着一张显卡对坐,像一场被精心布置过的相亲:一切都是变量控制好的,唯一要观察的,是那零点几秒的停顿。

顺带一提为什么选 90 秒。人类打电话也有磨合期,开场寒暄和聊到兴头上的节奏不一样,研究者为此单独切了 Switchboard 的前 90 秒做对照(43,890 次转换),保证公平起见,人类那边也是"刚认识"的状态。这个细节后面会用上。

📏 尺子怎么造:给"接话时机"下定义

测时长得先定义时长从哪算到哪。论文用的指标叫 FTO,floor-transfer offset,话轮交接偏移。它的定义一句话说清:下一个说话者开口的时刻,减去当前说话者最后一个语音段的结束时刻。差值大于零,说明中间有空白,叫 gap;小于零,说明抢在对方说完之前开口了,叫 overlap。

这里有个细节:什么叫"一个语音段"?人在说话时中间的停顿五花八门——逗号的停顿、换气的停顿、思考的空拍。论文的规定是:间隔小于 180 毫秒的语音段,合并成一个单位,叫 IPU。两个 IPU 之间的转换,才算一次话轮交接。统计时把极端值裁掉,只看正负 2 秒以内的窗口。

人类参照组用的是语言学界的老牌语料库 Switchboard 电话语料,MS-State 词对齐,19 万 3 千多次话轮转换,来自 2,407 通电话。为什么非得用电话语料?因为它是人类自然对话时机的最大样本库,193,115 次转换,这个量级足够把人类节奏刻成一把标准尺。

为了防杠,测量还做了三层保险。模型侧的语音切割用了三种方案:能量检测(主工具,0.01 RMS 门限)、文本词切分、对齐词切分,互为敏感性分析。统计上用会话级 bootstrap 抽 10,000 次,显著性阈值压到 0.05 除以 45 个检验,约等于 0.0011——比常规的 p<0.05 严了四十多倍。这把尺子,造得比多数心理学实验还较真。

结果出来之前,先记住一个直觉数字:人类接话的中位数是 137 毫秒。137 毫秒是什么概念?一次眨眼大约 100 到 150 毫秒。也就是说,人类对话的话轮交接,就发生在一眨眼的功夫里——大部分时候你根本没意识到那个空隙存在。

📊 主结果:一眨眼的功夫,变成了半秒

直接上核心表格。

Switchboard 全程:193,115 次转换,中位数 +137 毫秒,众数 160,overlap 比例 0.32,落在对方最后 120 毫秒内的"预接"占 10%,正负 120 毫秒窗口内的转换占 25%。

Agent 侧(能量切割,主结果):747 次转换,中位数 +480 毫秒,置信区间 [400, 480],众数 480,overlap 比例 0.18,最后 120 毫秒内的预接占 1%,正负 120 毫秒窗口内的转换占 3%。换另外两种切法,中位数是 560 和 400,结论纹丝不动。

480 对 137,晚了三到四倍。四分之一秒,刚好是"对方会不会觉得尬住了"的心理门槛——日常聊天里停顿超过半秒,人就会开始想:他是不是没听懂?我该不该再说一遍?

你可以亲手验证这个阈值:明天跟人说话时,故意在每个句尾多停半秒。用不了三句,对方的眼神就开始飘。这就是 480 毫秒的日常含义——它是"掉线"的感觉,不是"思考"的感觉。

但数字的倍数还不是最扎眼的。最扎眼的是分布的形状。人类的直方图在零附近是活的:25% 的转换挤在正负 120 毫秒这个窄带里,有的略早有的略晚,像一个话轮自然呼吸的胸口。Agent 的直方图在零附近是一片真空——3%,几乎无人区。它们的转换不活在零附近,活在 400 和 480 毫秒那两个格子上:44% 的转换精确地落在这两个值上,像盖戳。人类那边没有任何对应的尖峰。

还有最后 120 毫秒。人类有 10% 的转换是在对方话音还没落地时就完成的——你说着说着觉得对方要收尾了,提前半口气起话头,这叫 projection,预测式接话,是好听众的标志性动作。Agent 呢?1%。这最后的 120 毫秒,对它们来说几乎是禁区。

什么感觉?像走进一间人人都在交头接耳的屋子,发现两位新来的客人其实聊得很热络,但每个人说完一句话,都要等那个约好的暗号响了才接——而这个暗号,总是晚半拍。合拍地迟到着。

🧲 实验一:这半秒,是两个人合谋出来的

480 毫秒会不会只是个系统时钟?比如模型内部每 480 毫秒巡一圈,赶上了就开口?第一个实验用"重新配对"拆这个假设。

把原来第 i 场对话里的 A 请回来,但给它换一个搭档——来自第 j 场的 B(j≠i),配对 2,000 种,全是错位的 derangement。结果:中位数从 480 毫秒崩到 +80 毫秒,overlap 比例翻倍到 0.46,四分位间距从 160 毫秒暴涨到 1360 毫秒。而真实配对在所有统计量上,压过了全部 2,000 次重新配对。

这组数字的含义很漂亮:480 不是时钟,是这对搭档之间长出来的东西。每台模型都在感知对方的节奏并适配——耦合是真的。两个陌生模型凑在一起,节奏立刻散架、沉默暴涨;老搭档坐在一起,沉默稳稳定在它的 480 上。它们是真合拍,只是合拍在了一个慢拍子上。同场景重配对也能复现自由代理的结果,说明这个结构属于配对本身,不属于场景,也不属于哪台机器的表。

打个比方:这就像两个人合抬一件家具。临时拼凑的路人,步子永远踩不齐,家具歪歪扭扭(IQR 从 160 涨到 1360 毫秒,就是这个"歪歪扭扭");搭惯了档的搬运工,动作严丝合缝——只是他俩商量好的口令"一、二、起",比行业标准慢了一拍。配合是真的,默契是真的,慢也是真的。三个事实可以同时成立,这就是这篇论文标题里 Coupled 和 Late 并排放着的原因。

还有个更揪心的对照:静音实验。12 个格子里,把对方的声音抽掉。转换次数从 273 次塌到 26 次,每个 agent 的词数从 134 掉到 29。也就是说,这两台模型所谓"对话",几乎完全靠对方的声音吊着——伙伴的音频在场,说话这件事才在场。有点像双人舞:音乐停了,舞步还在摆,但谁也不再迈步了。

🎛 实验二:迟到是策略,不是通道的锅

接下来拆最显眼的嫌疑犯:链路延迟。前面说了,细码本要 240 毫秒才能读,会不会 480 其实就是 240 的延迟加上 240 的反应,是个物理必然?

办法很粗暴:从每一次转换里扣掉全部 240 毫秒,假设链路延迟不存在。结果:中位数还有 240 毫秒,近零带仍然只有人类的一半,最后 120 毫秒里依然是人类 10% 对 agent 1%。扣光了通道的账,迟到依旧。

真正一锤定音的是延迟扫描。实验者人为往 B→A 的方向注入额外延迟,D 取 3、8、10、15 帧。A 的直方图众数精确地挪到了 480 + D×80 毫秒的位置上,而 B 那侧稳稳钉在 6 帧不动。这个线性关系漂亮得像物理实验:等待时间不是内部固定计时器,而是死死锚定在对方音频可感知结束时刻之后的一个偏移上。对方就算慢到 1.2 秒才说完,等待也一分不缩短——它不预测你的结束,它等你的结束。

再看 overlap 的形态。Agent 确实有 18% 的 overlap,比人类 32% 还低呢——但位置不一样:人类的 overlap 中位在对方结束前 311 毫秒,agent 的在中位 −560 毫秒。人类那 32% 里有大量是"嗯""对"这种贴着对方话尾的应和,agent 的 overlap 大多是插进对方话轮深处的打断。9/10 个 agent 的正偏移是在对方结束之后超过 320 毫秒才起的话头,人类只有 4/10。

结论很清楚:这是一套 silence-threshold 反应式端点检测策略——像一个声控灯,你不动,它才亮。再贴切的比方是电话客服的操作规程:确认客户完整说完、停顿、再开口。规程保证了不抢话,代价是那股子挥之不去的"呼叫中心味"。人类是好听众,提前半口气;agent 是合规的客服,确认你彻底说完,再开口。补充一句,Chang 等人此前测过 PersonaPlex 在打断场景有约 0.6 秒的生成-感知滞后,和这里的残留量对得上,不过那不是本实验识别的机制,先记账上。

🎭 实验三:放录音,这套礼仪就失灵了

最后一个实验最像行为艺术:如果对面的不是活的模型,而是录音呢?

72 场跑,素材来自 AMI 会议语料的 24 个窗口、2 段录音,电平匹配好,故意晚一帧送达,其余一切照旧。结果:那个标志性的 6 帧尖峰直接消失了,质量掉到原来的三分之一;中位数腰斩到 240 毫秒;正负 120 毫秒带的占比升到 0.16,恰好落进"错位窗口"代理的范围里;agent 自己的话语份额从 0.35 砍半到 0.15。

这说明什么?480 毫秒不是刻在权重里的固定延迟,它是被活搭档引发的行为——是一种社交反应。对面坐着的模型会随你起舞,你们俩一起把这个慢节奏跳成了习惯;对面放一盘死磁带,舞步就散了。这个区分很微妙也很重要:它不是迟钝,它是在"有活人在场"时才启动的一套特定的、反应式的接话规程。录音骗不出这套规程。

这里插一句方法论上的佩服。三个实验层层递进,拆掉的每一个备选解释都干净利落:重新配对排除了时钟,扣掉 240 毫秒排除了通道,放录音排除了固定延迟。到这一步,"反应式策略"几乎是唯一站得住的解释。做行为科学式的实验设计做到这个严谨程度,在语音模型研究里并不常见。

☎️ 彩蛋:一开口就露馅的客服腔

正文之外,论文还埋了一个趣味发现,我觉得值得单独说。

去听这些对话的开头,画风是这样的:"Hi, this is Aria.""Hi, Orion."——电话客服腔。研究者列了一个 21 种模式的词汇表去扫,发现开场头 10 秒里,这类客服话术的密度高达每千词 29 次,10 秒之后立刻掉到每千词 2 到 4 次。像一道旧伤疤:训练语料里 voice 数据大半来自电话和客服场景,模型开口的第一句话,先暴露出身。

有意思的是治疗实验。往 speech 流里塞进一句场景化的开场白——比如让角色一上来就用洗衣房的情境打招呼——开场客服腔从 29 掉到 12,全对话密度从 7.6 掉到 2.2。而同样的句子写在 system prompt 里当指令呢?36 场对话只有 8 场照办,开场率 26.7,纹丝不动。

一句话:写在 prompt 里够不着的东西,说进 speech 里就够得着。这个模型的行为习惯住在音频层,不住在指令层。跟它讲道理没用,得用它的母语——声音——去带。这对所有做语音 agent 的人都是一条实用到近乎残酷的提示。

💭 写在最后:听觉社会的礼仪考试,目前不及格

把三场实验拼起来,这幅画像就完整了:两个全双工模型对话,会自发形成稳定、耦合、可复现的节奏——这是好消息,说明"对话能力"不是幻觉。但这个节奏锚定在对方的音频结束时刻上,比人类慢三到四倍,落在人类最热闹的正负 120 毫秒窗口里的转换只有人类的零头,而人类用来表达"我在听、我预判得到你"的最后 120 毫秒,几乎完全空置。

更值得注意的是结论里那句冷静的话:这样的配对生成的对话,或者拿这样的配对当考官的评测,会继承反应式端点检测器的下限。翻译一下:如果一个语音模型是由另一个语音模型来面试的,大家都慢,慢就互相看不见了——480 毫秒成了新常识。评测的污染从来不只来自答案泄露,也来自考官自己的生理局限。

这也是这篇研究比"又一个 benchmark"更值得记住的原因。它没有给模型打分排队,而是回答了一个此前没人量化过的问题:当 AI 组成自己的对话社会时,它们会长出什么样的礼节?答案是:一套自洽的、稳定的、但从人类角度看失礼的礼节。自洽到足以骗过彼此,也足以骗过拿它们当考官的我们。

换个角度想,这篇论文真正测的其实是"预测"两个字。人类接话快,不是因为耳朵灵,而是因为大脑一直在跑一个预测模型:对方的句子走向哪个词收尾、哪个气口是终点,提前几十毫秒就开始调度发声器官。这套机制我们从不觉得珍贵,直到看见没有它的样子——一个永远在等你说完的聪明存在,礼貌、稳定、合拍,隔着半秒的空拍。

身体与感观的第二问,答案和第一问押韵:皮肤没长好,耳朵的礼仪也还没学会。但这恰恰是精确的诊断书——知道它等的是 480 而不是 137,知道它活在反应而非预测里,知道录音骗不动它、开场白写在哪儿才有效——每一项都是能动工的地方。下一篇,视觉的感观,考棚见。

📚 参考文献

  • 论文标题:Coupled but Late: Turn-Taking Between Full-Duplex Speech Models in Unscripted Dialogue
  • 作者:Lichen Zhu, Yueqian Lin, Yiheng Wang, Hai "Helen" Li, Yiran Chen
  • arXiv ID:2610.08683 (v1, 2026-10-06)
  • 机构:Duke University(杜克大学)
  • 投稿目标:ICASSP 2027
  • 代码与测量数据:即将开源
#每日论文 #进化日志 #身体与感观

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens