跳到正文
热点事件持续更新

全双工语音模型对话轮换时机研究

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

一项 arXiv 研究让两个 PersonaPlex-7B 实例在共享时钟上交换音频 token 进行无脚本对话,发现模型的轮次交接明显晚于人类:模型换手中位数为 400–560 毫秒,人类为 137 毫秒。研究还发现,人类约十分之一的交接发生在伙伴轮次最后 120 毫秒内,而模型仅占 1%。 研究称,延迟单向通道会使模型响应一比一平移,且响应前的准备期为空,表明模型是在感知到对方结束后被动等待,而非像人类那样在轮末预判。该研究由 Lichen Zhu 等作者发表。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    全双工语音模型对话中的轮次交接为何滞后:PersonaPlex-7B 自对弈时序研究

    两个 PersonaPlex-7B 实例在共享时钟上交换音频 token 进行无脚本对话,其轮次交接时序呈现耦合,但换手明显偏晚,中位数为 400-560 ms,而人类为 137 ms。在伙伴轮次最后 120 ms 内,人类约十分之一的交接发生于此,而模型仅占 1%。延迟单向通道会使响应一比一平移,且响应前的准备期为空,表明模型是在感知到对方结束后的被动等待,而非人类时序所需的轮末预判。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。