跳到正文
今天10月7日周三37 条
  1. arXiv cs.CL24

    语音语言模型能否像人类一样听音辨形?SLM 声音象征感知对齐研究

    研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。

  2. arXiv cs.CL22

    用跨语言迁移矩阵量化副语言语音任务中的语言依赖

    研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。

  3. arXiv cs.CL23

    基于可控风格嵌入的零样本 Lombard 语音合成

    研究团队扩展 F5-TTS,提出一种无需 Lombard 专用训练数据的可控 TTS 系统,可零样本合成 Lombard 风格语音。该方法通过可学习的风格嵌入并用 PCA 分析其隐空间,找到与 Lombard 属性相关的方向,从而对发声力度和清晰度实现可解释控制。实验显示该方法在保持说话人身份与自然度的同时提升了噪声环境下的可懂度,并可泛化到未见过的说话人。

  4. arXiv cs.CL12

    约鲁巴语轮廓声调标注:一项排版与计算方案

    针对约鲁巴语轮廓声调在正字法中长期难以标注、部分人名拼写甚至因此反转含义的问题,该论文提出采用 caron 和 circumflex 符号在单元音上编码升调和降调。这一做法可追溯至 Olmsted(1951)的约鲁巴语音学研究,并首次使这些声调可通过标准键盘输入和计算文本处理实现。方案已在 WriteYoruba 键盘和 TTSYoruba 语音合成器中落地实现。

  5. arXiv cs.CL22

    语音-文本语言模型的生成模态差距如何量化?SLT 2026 研究给出统一评测

    一项被 SLT 2026 接收的研究构建了统一生成式评测套件,在匹配数据分布与生成设置下对比纯语音、纯文本和语音-文本语言模型。结果显示联合语音-文本建模显著提升语义连贯性,但音素级指标变化有限,说话人相似度与预测质量反而更低,情感分布指标则有所改善。相比更大规模的纯语音模型,该语音-文本模型在基于转写的语义连贯性上缩小了大部分规模差距。

  6. arXiv cs.CL24

    DyaFDB:全双工对话模型的二元评估框架

    研究者提出 DyaFDB,一个在二元设定下评估全双工语音对话模型的框架:两个模型按指定角色直接对话,目标可合作或冲突,双方均由外部裁判离线打分。该框架实例化 4 项任务、140 个场景,记录 7,560 段对话,覆盖 6 种自博弈与交叉配对。实验显示模型行为会持续重塑其对话伙伴,因此每个模型必须同时充当对方的考官与被试,固定 interlocutor 无法胜任。

  7. arXiv cs.CL17

    HINTT 提交第二届 MLC-SLM 挑战赛:级联与统一方案在说话人分离与 ASR 上的对比

    HINTT 团队提交第二届 MLC-SLM 挑战赛的系统,比较了级联与统一两种多语言说话人属性 ASR 方案。最终提交采用级联流水线,由微调后的 DiariZen 说话人分离模型、微调后的 Qwen3-ASR 模型和基于 LLM 的生成式纠错组成;同时用相同官方数据微调 VibeVoice-ASR 作为统一模型对比。

  8. arXiv cs.CL22

    Loud and Clear:用动态激活引导提升 TTS 模型在噪声环境下的语音清晰度

    研究者提出一种提示词相对激活引导机制,无需重新训练即可让预训练 TTS 模型生成更清晰的语音,模拟 Lombard 效应中的发声力度增强与超清晰发音。该方法在已见和未见说话人及多种语言上系统改变 Lombard 相关声学特征,说话人相似度保持 89-95%,在 1 dB SNR 背景噪声下将 WER 降低 7-22%。

  9. arXiv cs.CL24

    GIVE-KWS:用门控视觉证据注入实现噪声鲁棒的示例查询关键词识别

    GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 较基准系统降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式。在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0-9.3 dB 的有效 SNR 增益。

  10. arXiv cs.CL22

    基于音素后验图的芬兰语语音发音编辑:PPG2Speech 模型

    研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。

  11. arXiv cs.LG17

    VoxReason:在语音合成前审计基于来源的语音计划

    VoxReason 提出一个 100 案例的验证器基准,固定每句话、只改动一个指定来源标签线索,并评估引用证据、八个计划字段和允许的响应。在 24 案例的来源键不相交测试中,来源情绪先验的计划槽准确率达 0.958,但 24 个编辑后的中性目标均未出现在其训练标签中,必需变更准确率为 0.000。在 32 案例的情绪不相交测试中,该先验的计划槽准确率为 0.219,必需变更准确率为 1.000。

  12. arXiv cs.LG24

    自监督语音模型发现音系向量算术:[b] = [d] - [t] + [p]

    一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。

  13. arXiv cs.CL13

    ARIA:面向粤语歌词创作的声音驱动旋律-声调关系建模

    针对粤语歌词创作中旋律与声调需紧密对齐的问题,研究者提出 ARIA 框架,可直接从带字符级时间戳的演唱录音生成粤语歌词。该框架先用 TRATE 从演唱音频预测 0243 声调序列,再用 DRA-TCLG 结合检索增强的词汇引导生成流畅歌词,并构建了大规模对齐的音频-粤拼-0243 数据集。

  14. arXiv cs.CL24

    EMODE:面向情感感知语音语言建模的动态副语义专家

    EMODE 是一个情感感知语音语言模型,核心是动态副语义专家(DPSE),将连续语音特征拆分为语义与副语言两条路径并动态路由、融合后再接入语言模型。它采用语义预热、副语言激活、联合精调三阶段课程训练,配合 OEG、SAA 与 GDR 引导。在 SER 测试、共情回复评测及新建双语 MEPA 基准上,EMODE 改善了词汇保真与情感敏感度的平衡。

  15. arXiv cs.LG24

    SkillFormer:面向音频语言模型的技能分解适配方法

    SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。

  16. arXiv cs.LG18

    ImpactMat:面向逆向撞击声渲染的连续材质估计数据集与基准

    ImpactMat 是面向逆向撞击声渲染的数据集与基准,提供单一及混合材质的撞击声样本并配对真实材质参数,同时提出一个前馈模型,可从一段或多段录音中预测材质参数,并利用混合材质学习材质类型间的平滑过渡。实验显示该方法优于竞争基线,无需人工调参即可从真实录音重新渲染撞击声。

  17. arXiv cs.AI42

    研究揭示语音“克隆”实为风格迁移:NeurIPS 2026 论文发现克隆语音更权威、更值得信任

    NeurIPS 2026 论文《Voice "Cloning" is Style Transfer》发现,广泛使用的语音克隆模型并非忠实复制个人声音,而是对源声音系统性施加风格迁移。人类标注者认为克隆语音比原声更权威、温暖、像客服且更像真人,对其信任度更高,也更愿意向其透露敏感个人信息。研究还显示,克隆导致口音、语速和音频嵌入空间方差缩小,造成说话人特征同质化。

  18. arXiv cs.AI22

    针对多语言语音匿名化的声学与内容导向说话人验证攻击研究

    研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。

  19. arXiv cs.AI40

    Jarvis:面向多方对话的主动式语音智能体

    Jarvis 是一款能实时参与多人对话的主动式语音智能体,基于事先共享的文档跟进讨论,仅在群体遗漏或说错事实且数轮内未自我纠正时出声干预。它由小型开源权重模型驱动,结合确定性检查,并将每条论断锚定到原文句子。在 CHI-180-proactive 数据集上,Jarvis 对多数干预事件判断正确,且在群体自行解决问题时 97% 的情况下保持沉默;23 人实时研究验证了这一趋势。

  20. arXiv cs.AI27

    Logbook:面向小时级长音频事件理解的基准

    研究者推出 Logbook,一个面向小时级音频理解的基准,录音时长从 10 分钟到 6 天,要求系统在给定连续音频和事件标签词表下输出无间隙的分段、标签与描述。团队对比了 52 个端到端与级联系统,并消融微调、上下文长度和推理预算,发现任务可解但最佳系统仍低于人类参考水平,过度分段普遍存在,微调可部分缓解,端到端系统通常优于级联系统但随上下文变长而退化。

  21. arXiv cs.AI23

    全双工语音模型对话中的轮次交接为何滞后:PersonaPlex-7B 自对弈时序研究

    两个 PersonaPlex-7B 实例在共享时钟上交换音频 token 进行无脚本对话,其轮次交接时序呈现耦合,但换手明显偏晚,中位数为 400-560 ms,而人类为 137 ms。在伙伴轮次最后 120 ms 内,人类约十分之一的交接发生于此,而模型仅占 1%。延迟单向通道会使响应一比一平移,且响应前的准备期为空,表明模型是在感知到对方结束后的被动等待,而非人类时序所需的轮末预判。

  22. arXiv cs.AI26

    神经解码中上下文先验下的置信度排序反转

    研究发现,上下文先验在提升神经到语言解码候选分数的同时,会让残留错误变得更自信。在 MEG-MASC 上,区分修复与残留错误的 AUROC 从初始排名 2-3 时的 0.70 降至排名 21-50 时的 0.39,而排名 20 之后的错误占融合后全部错误的 46.6%。分别读取局部与先验分数可改善选择性解码,解码器在 74.5% 的窗口作答(原为 56.7%),92% 的输出集仍包含正确候选。

10月5日周一
  1. arXiv cs.CL22

    用部分语音学习何时提交:面向端到端同声传译的 prefix 监督

    研究者用语音语言模型自身完整与部分波形的翻译结果构造 prefix 监督,无需转录文本或人工翻译,即可适配端到端同声传译。在 FLEURS 和 CoVoST2 三个翻译方向上,prefix 训练改善了质量—延迟前沿,置信度阈值提供了最稳定的操作区间;多轮 append-only 解码在低延迟下更强,其提交校准误差整体下降 63–68%,早期 prefix 下降 68–80%。

9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,生成带唇形同步和自然表情的动态视觉形象。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。