跳到正文
今天10月7日周三1232 条
  1. arXiv cs.CL17

    HINTT 提交第二届 MLC-SLM 挑战赛:级联与统一方案在说话人分离与 ASR 上的对比

    HINTT 团队提交第二届 MLC-SLM 挑战赛的系统,比较了级联与统一两种多语言说话人属性 ASR 方案。最终提交采用级联流水线,由微调后的 DiariZen 说话人分离模型、微调后的 Qwen3-ASR 模型和基于 LLM 的生成式纠错组成;同时用相同官方数据微调 VibeVoice-ASR 作为统一模型对比。

  2. arXiv cs.CL29

    旧事实回归时:重读、回滚与时间记忆的边界

    一项基于 130 个软件修复原子状态转换的研究发现,基于身份的时间记忆在普通转换条件下模型判定准确率达 98.5%,但追加对旧陈述的逐字重读后准确率降至 10.8%,陈旧值比率升至 88.5%。一个拒绝重新激活已退役值的防护机制可将准确率恢复到 97.7%、陈旧值比率降至 0.8%,但无法在没有额外变更溯源的情况下识别合法的回滚。

  3. arXiv cs.CL22

    Loud and Clear:用动态激活引导提升 TTS 模型在噪声环境下的语音清晰度

    研究者提出一种提示词相对激活引导机制,无需重新训练即可让预训练 TTS 模型生成更清晰的语音,模拟 Lombard 效应中的发声力度增强与超清晰发音。该方法在已见和未见说话人及多种语言上系统改变 Lombard 相关声学特征,说话人相似度保持 89-95%,在 1 dB SNR 背景噪声下将 WER 降低 7-22%。

  4. arXiv cs.CL27

    SharedKV-BT:面向行为树智能体的节点本地类型化决策

    SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。

  5. arXiv cs.CL22

    预测社交媒体信息级联增长:面向人机协同的虚假信息分诊

    研究将虚假信息早期分诊建模为"延续预测"问题:仅凭前30分钟活动预测传播树后续增长。在FibVID数据集352棵测试树上,结合节点数与结构深度熵、时间到达熵的模型将log变换后未来增长的R²从0.307提升至0.323,log-MAE降低2.4%;在97棵高活跃度树上R²从0.248升至0.395,Spearman's ρ从0.394升至0.529。

  6. arXiv cs.LG22

    量子数据加载器利用真实信号共享结构,单电路复用加载多信号

    一种量子原生加载器只需学习数据集的低维描述,即可用一组固定电路加载每个信号。在五个公开数据集的七种视图上,它以相同门成本达到最强结构化加载器的精度,且每个信号所需参数少数倍。预注册盲复现显示,信号规模扩大十六倍时,达到全信号精度十个百分点以内所需的随机子集大小保持稳定,而结构化加载器所需子集持续增长。

  7. arXiv cs.LG17

    AID:一个 AI 推理基础设施动力学框架

    研究者提出 AID(AI Infrastructure Dynamics)框架,用于描述物理、计算、网络与服务耦合过程中的 AI 推理基础设施学习问题,支持结构化可变状态、异步观测、多物理时间尺度和随服务变化的需求。该框架区分了现有策略下的预测表示与动作变化下保持服务结果的表示,并给出观测无法区分模型时预测误差下界及精确受控状态约简的充分条件两项分析结果。

  8. arXiv cs.CL24

    GIVE-KWS:用门控视觉证据注入实现噪声鲁棒的示例查询关键词识别

    GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 较基准系统降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式。在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0-9.3 dB 的有效 SNR 增益。

  9. arXiv cs.LG22

    CLAD:面向神经网络验证的约束抽象域

    研究者提出约束拉格朗日抽象域(CLAD),可在由凸约束组合定义的输入区域上对神经网络计算可靠的过近似,并通过投影原始-对偶方法求解拉格朗日乘子下的 max-min 问题。在 4 个卷积网络、1,944 个实例的评测中,CLAD 在标准无约束 Linf 属性上与 GCPCROWN 验证数量相当且运行时间相近,在 L2-ball 约束属性上比 GCPCROWN 多验证 60% 的实例,整体多 22%。

  10. arXiv cs.CL22

    基于音素后验图的芬兰语语音发音编辑:PPG2Speech 模型

    研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。

  11. arXiv cs.LG17

    VoxReason:在语音合成前审计基于来源的语音计划

    VoxReason 提出一个 100 案例的验证器基准,固定每句话、只改动一个指定来源标签线索,并评估引用证据、八个计划字段和允许的响应。在 24 案例的来源键不相交测试中,来源情绪先验的计划槽准确率达 0.958,但 24 个编辑后的中性目标均未出现在其训练标签中,必需变更准确率为 0.000。在 32 案例的情绪不相交测试中,该先验的计划槽准确率为 0.219,必需变更准确率为 1.000。

  12. arXiv cs.CL24

    缺失的最小对:LLM 中的刻板印象评估

    针对大语言模型偏见评估中单对对比句不可靠的问题,研究者提出双最小对(dual minimal pair)评估框架,通过改写与替换属性生成英文、俄语、西班牙语和中文的刻板印象数据,并设计两项评估指标,其中一项基于社会群体与刻板属性间互信息(MI)的新指标更适合跨语言、跨模型聚合比较。代码已开源。

  13. arXiv cs.LG22

    量子生成模型研究:收敛的矩匹配损失无法可靠衡量泛化能力

    研究基准测试了13个量子与经典生成模型,在最高30 qubits的基数约束数据集和基因组单核苷酸变异数据集上直接采样。结果显示,将MMD²等矩匹配损失收敛到相同值的模型,对未见有效集的覆盖差异巨大,说明收敛的损失不能可靠衡量泛化能力。"经典训练、量子部署"流程必须通过采样来测量泛化,而这在目标规模下被认为需要量子设备。

  14. arXiv cs.CL21

    Holdout Best-of-N:无偏评估及其代价

    研究指出,复用挑选 Best-of-N 获胜者的分数会高估其期望奖励。基于每个候选 K 个独立分数的固定矩阵,仅当 J<K 时,单一估计量才能对期望评判奖励完全无偏;在 J=K-1 时,无偏 minimax 风险为 σ²/√K 量级,允许偏差则可提升至 σ²/K。对两个候选者,Holdout 无需已知方差即可达到 1/(π√2) 的渐近无偏 minimax 常数。

  15. arXiv cs.LG22

    基于自回归扩散的3D场景图高层概念生成

    研究提出一种统一的自回归扩散图生成模型,联合学习结构与特征,从观测到的垂直平面自底向上构建任意层级深度的完整3D场景图(3DSG)。该方法在合成场景、真实建筑平面图和机器人传感器数据等3DSG数据集上持续超越所有基于学习和随机的基线,并在最大层级和真实单层数据上超越可获取目标图尺寸的one-shot模型。

  16. arXiv cs.CL26

    跨模型 LLM 共识不等于有效:K-12 数学辅导对话中学生失败模式诊断研究

    一项针对 K-12 数学辅导对话的探索性研究发现,LLM 对五种学生失败模式(不确定性、错误归因、算子选择、概念缺口、程序失误)的分类中,人机一致性仅为中等(kappa = .524-.597),而跨模型一致性显著更高(kappa = .755-.781;alpha = .769)。这表明跨模型共识可能制造正确性的假象,模型间的一致不能替代对推断构念有效性的独立证据。

  17. arXiv cs.LG12

    超越 Procrustes 距离:一种捕捉手性的多线性 Gromov-Wasserstein 距离

    研究者提出 Gromov-Wasserstein 目标的多线性推广,在温和假设下可得到以对称群 G 取商的概率分布间形状距离。针对 G = SO(d),他们提出对手性敏感的手性 Gromov-Wasserstein(CGW)距离,并证明其鲁棒性、给出高效算法,通过将耦合投影到低维空间重写优化问题,得到局部解与近似全局解算法及完全多项式时间近似方案。

  18. arXiv cs.CL23

    同数字引用替换:压力测试 Jev 作为金融证据评判器

    研究用同数字引用替换法压力测试 Jev 作为金融证据评判器的表现,评估其对 GPT-4.1-mini 计算轨迹的来源支撑验证能力。在固定操作数与运算、仅在同数字单元格间移动引用的条件下,带符号数字指针基线解释了大部分恢复效果,显式列标签能改善部分错误角色判定,但也会降低对等价证据的支持。在 36 个新来源页上的后续评测复现了检测角色错误与保留有效引用之间的同一权衡。

  19. arXiv cs.LG22

    RIPE++:仅用正样本对的强化关键点学习

    RIPE++ 提出一种仅从正样本对中同时导出奖励与惩罚的强化学习奖励机制,无需构造负样本对即可学习判别性关键点检测器与描述子。该方法将同一 RL 目标扩展至匹配阶段,通过适配 LightGlue 将 MegaDepth1500 上的 AUC@5 从 56.58 提升至 59.65,并支持部分视觉重叠图像对的弱监督全流程训练。在低纹理医学视频序列等相机位姿缺失场景下同样可训练,结果与全监督方法相当。

  20. arXiv cs.CL22

    高风险应急信息中的生成式 AI 翻译

    一项针对地震指令文本英译中、英译西的实验显示,使用话语特定提示词可显著提升生成式 AI 译文的可理解性与可操作性,但译者仍可能不信任这些译文。研究指出人工修订依然必要,既为发现错误,也因这类信息需有人对错误或延误承担责任。

  21. arXiv cs.LG31

    Online Neural Space Time Memory:解耦记忆更新频率的实时动态新视角合成

    针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。

  22. arXiv cs.CL39

    LLM 会把闲聊和背景语音写进病历,干扰临床推理

    研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。

  23. arXiv cs.LG22

    粒子喷流生成的神经缩放定律研究

    研究首次探索粒子喷流生成任务中是否存在缩放定律,成功复现了模型规模缩放的对数缩放行为。研究发现切片 Wasserstein 距离与下一 token 预测验证损失单调相关,表明该损失是物理性能的良好代理指标。数据集规模和计算量的缩放行为明显较弱,作者通过引入可学习窗口概念分析这一现象,认为喷流成分的自回归预测相比语言模型更快饱和。

  24. arXiv cs.CL24

    语言不可对齐性:为何部分概念无法进行跨文化基准评测

    一篇立场论文提出"翻译同构假设"(TIA)在原则上就不成立,即部分概念(如语用标记、敬语、历时分层词汇)的语义结构无法跨语言无损映射。作者用 usage-cloud 框架将概念表示为上下文化嵌入的点集,定义 α-unalignability 为无法同时保持词汇忠实(质心对应)与结构忠实(局部邻域拓扑)。