HINTT 提交第二届 MLC-SLM 挑战赛:级联与统一方案在说话人分离与 ASR 上的对比
HINTT 团队提交第二届 MLC-SLM 挑战赛的系统,比较了级联与统一两种多语言说话人属性 ASR 方案。最终提交采用级联流水线,由微调后的 DiariZen 说话人分离模型、微调后的 Qwen3-ASR 模型和基于 LLM 的生成式纠错组成;同时用相同官方数据微调 VibeVoice-ASR 作为统一模型对比。
HINTT 团队提交第二届 MLC-SLM 挑战赛的系统,比较了级联与统一两种多语言说话人属性 ASR 方案。最终提交采用级联流水线,由微调后的 DiariZen 说话人分离模型、微调后的 Qwen3-ASR 模型和基于 LLM 的生成式纠错组成;同时用相同官方数据微调 VibeVoice-ASR 作为统一模型对比。
一项基于 130 个软件修复原子状态转换的研究发现,基于身份的时间记忆在普通转换条件下模型判定准确率达 98.5%,但追加对旧陈述的逐字重读后准确率降至 10.8%,陈旧值比率升至 88.5%。一个拒绝重新激活已退役值的防护机制可将准确率恢复到 97.7%、陈旧值比率降至 0.8%,但无法在没有额外变更溯源的情况下识别合法的回滚。
研究者提出一种提示词相对激活引导机制,无需重新训练即可让预训练 TTS 模型生成更清晰的语音,模拟 Lombard 效应中的发声力度增强与超清晰发音。该方法在已见和未见说话人及多种语言上系统改变 Lombard 相关声学特征,说话人相似度保持 89-95%,在 1 dB SNR 背景噪声下将 WER 降低 7-22%。
研究者提出一种将句子重音检测(SSD)与辅助词重音检测(WSD)结合的新型建模范式,并引入词跨度重音正则化器(WSR),将 token 级 SSD 概率集中于重音词跨度内。在 TinyStress-15K 基准上,该方法优于强基线,完整配置取得最佳 SSD 结果。
研究将物体从冻结的 V-JEPA 2 预测器中隐藏,发现其预测对静止物体仅部分保留、对容器内物体完全丢失,运动物体在 0.3 秒内即消失(V-JEPA 自带 tube mask 下为 0.5 秒,ViT-H 在 90% 掩码率下可保留至 1.1 秒)。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究者提出一种基于 Koopmanism Response 框架的校准式、按模式分解的测试方法,用于检验学习型随机模拟器能否正确响应外部强迫。
研究将虚假信息早期分诊建模为"延续预测"问题:仅凭前30分钟活动预测传播树后续增长。在FibVID数据集352棵测试树上,结合节点数与结构深度熵、时间到达熵的模型将log变换后未来增长的R²从0.307提升至0.323,log-MAE降低2.4%;在97棵高活跃度树上R²从0.248升至0.395,Spearman's ρ从0.394升至0.529。
一种量子原生加载器只需学习数据集的低维描述,即可用一组固定电路加载每个信号。在五个公开数据集的七种视图上,它以相同门成本达到最强结构化加载器的精度,且每个信号所需参数少数倍。预注册盲复现显示,信号规模扩大十六倍时,达到全信号精度十个百分点以内所需的随机子集大小保持稳定,而结构化加载器所需子集持续增长。
研究者提出 AID(AI Infrastructure Dynamics)框架,用于描述物理、计算、网络与服务耦合过程中的 AI 推理基础设施学习问题,支持结构化可变状态、异步观测、多物理时间尺度和随服务变化的需求。该框架区分了现有策略下的预测表示与动作变化下保持服务结果的表示,并给出观测无法区分模型时预测误差下界及精确受控状态约简的充分条件两项分析结果。
SEAL 通过零和加性残差重建与稀疏专家路由,解决紧凑时频分离器的掩码缩放受限和共享单元计算冗余问题。在 EchoSet 上,SEAL (small) 以少 28% 参数和 2.9 倍 MACs 超越 TIGER (small) 0.31 dB SI-SDRi,SEAL (large) 以 3.1 倍更少 MACs 达到 TIGER (large) 0.07 dB 以内。
GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 较基准系统降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式。在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0-9.3 dB 的有效 SNR 增益。
研究者提出约束拉格朗日抽象域(CLAD),可在由凸约束组合定义的输入区域上对神经网络计算可靠的过近似,并通过投影原始-对偶方法求解拉格朗日乘子下的 max-min 问题。在 4 个卷积网络、1,944 个实例的评测中,CLAD 在标准无约束 Linf 属性上与 GCPCROWN 验证数量相当且运行时间相近,在 L2-ball 约束属性上比 GCPCROWN 多验证 60% 的实例,整体多 22%。
Nord-Parl-TTS 是一个面向芬兰语和瑞典语的开放 TTS 数据集,从北欧议会演讲录音中提取了 900 小时芬兰语和 5090 小时瑞典语语音,采用改编版 Emilia 数据处理流程构建,并包含统一评测集。该数据集旨在缩小高资源与低资源语言之间的 TTS 资源差距,已被 ICASSP 2026 接收。
研究者将 Embedded Language Flows(ELF)扩展至数学推理与代码生成,提出 ELF-REG,用冻结的 AR 教师模型监督中间去噪特征并提供与响应联合去噪的全局表示。
研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。
VoxReason 提出一个 100 案例的验证器基准,固定每句话、只改动一个指定来源标签线索,并评估引用证据、八个计划字段和允许的响应。在 24 案例的来源键不相交测试中,来源情绪先验的计划槽准确率达 0.958,但 24 个编辑后的中性目标均未出现在其训练标签中,必需变更准确率为 0.000。在 32 案例的情绪不相交测试中,该先验的计划槽准确率为 0.219,必需变更准确率为 1.000。
针对大语言模型偏见评估中单对对比句不可靠的问题,研究者提出双最小对(dual minimal pair)评估框架,通过改写与替换属性生成英文、俄语、西班牙语和中文的刻板印象数据,并设计两项评估指标,其中一项基于社会群体与刻板属性间互信息(MI)的新指标更适合跨语言、跨模型聚合比较。代码已开源。
研究基准测试了13个量子与经典生成模型,在最高30 qubits的基数约束数据集和基因组单核苷酸变异数据集上直接采样。结果显示,将MMD²等矩匹配损失收敛到相同值的模型,对未见有效集的覆盖差异巨大,说明收敛的损失不能可靠衡量泛化能力。"经典训练、量子部署"流程必须通过采样来测量泛化,而这在目标规模下被认为需要量子设备。
研究指出,复用挑选 Best-of-N 获胜者的分数会高估其期望奖励。基于每个候选 K 个独立分数的固定矩阵,仅当 J<K 时,单一估计量才能对期望评判奖励完全无偏;在 J=K-1 时,无偏 minimax 风险为 σ²/√K 量级,允许偏差则可提升至 σ²/K。对两个候选者,Holdout 无需已知方差即可达到 1/(π√2) 的渐近无偏 minimax 常数。
研究提出一种统一的自回归扩散图生成模型,联合学习结构与特征,从观测到的垂直平面自底向上构建任意层级深度的完整3D场景图(3DSG)。该方法在合成场景、真实建筑平面图和机器人传感器数据等3DSG数据集上持续超越所有基于学习和随机的基线,并在最大层级和真实单层数据上超越可获取目标图尺寸的one-shot模型。
一项针对 K-12 数学辅导对话的探索性研究发现,LLM 对五种学生失败模式(不确定性、错误归因、算子选择、概念缺口、程序失误)的分类中,人机一致性仅为中等(kappa = .524-.597),而跨模型一致性显著更高(kappa = .755-.781;alpha = .769)。这表明跨模型共识可能制造正确性的假象,模型间的一致不能替代对推断构念有效性的独立证据。
研究者提出 Gromov-Wasserstein 目标的多线性推广,在温和假设下可得到以对称群 G 取商的概率分布间形状距离。针对 G = SO(d),他们提出对手性敏感的手性 Gromov-Wasserstein(CGW)距离,并证明其鲁棒性、给出高效算法,通过将耦合投影到低维空间重写优化问题,得到局部解与近似全局解算法及完全多项式时间近似方案。
研究用同数字引用替换法压力测试 Jev 作为金融证据评判器的表现,评估其对 GPT-4.1-mini 计算轨迹的来源支撑验证能力。在固定操作数与运算、仅在同数字单元格间移动引用的条件下,带符号数字指针基线解释了大部分恢复效果,显式列标签能改善部分错误角色判定,但也会降低对等价证据的支持。在 36 个新来源页上的后续评测复现了检测角色错误与保留有效引用之间的同一权衡。
研究者提出一种薄板交互模型与交互驱动的量子核,由纠缠 Pauli-string 特征映射构建,可显式编码稀疏高阶块交互,其保真度核具有半正定性并支持精确块因子化。
研究者提出神经语义验证框架,将放射组学测量转化为可寻址证据记录与机器可检验声明,在 611 例 UPenn 病例上定义语义状态,外部证据账本覆盖 331 名患者的 1,655 条模型关联记录。
RIPE++ 提出一种仅从正样本对中同时导出奖励与惩罚的强化学习奖励机制,无需构造负样本对即可学习判别性关键点检测器与描述子。该方法将同一 RL 目标扩展至匹配阶段,通过适配 LightGlue 将 MegaDepth1500 上的 AUC@5 从 56.58 提升至 59.65,并支持部分视觉重叠图像对的弱监督全流程训练。在低纹理医学视频序列等相机位姿缺失场景下同样可训练,结果与全监督方法相当。
一篇综述系统梳理了在部署阶段为 LLM 增强"参数内记忆"的方法:将承载记忆的参数对象在推理时接入前向传播,以补充 ICL 消耗上下文容量、重复离散编码成本随上下文增长的问题。
研究提出 InterCorrect,针对基于 Speech-LLM 的公平 ASR 做人口统计感知模型合并:在 SLAM-ASR 上仅微调 connector,再按子群 WER 与 task-vector 冲突定位跨轴人口统计对,施加交叉群体校正向量。
研究者提出 Token 级离策略标注(TOPL),将后训练重构为 token 级正确性预测任务,通过让模型区分回复中的好 token 与坏 token 来引导生成。
一项针对地震指令文本英译中、英译西的实验显示,使用话语特定提示词可显著提升生成式 AI 译文的可理解性与可操作性,但译者仍可能不信任这些译文。研究指出人工修订依然必要,既为发现错误,也因这类信息需有人对错误或延误承担责任。
针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。
研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。
研究首次探索粒子喷流生成任务中是否存在缩放定律,成功复现了模型规模缩放的对数缩放行为。研究发现切片 Wasserstein 距离与下一 token 预测验证损失单调相关,表明该损失是物理性能的良好代理指标。数据集规模和计算量的缩放行为明显较弱,作者通过引入可学习窗口概念分析这一现象,认为喷流成分的自回归预测相比语言模型更快饱和。
ForcingDAS 是一个基于 Diffusion Forcing 的统一数据同化框架,为每帧分配独立噪声水平,学习联合轨迹先验而非逐帧转移,从而捕捉长程时序依赖并减少误差累积。
一篇立场论文提出"翻译同构假设"(TIA)在原则上就不成立,即部分概念(如语用标记、敬语、历时分层词汇)的语义结构无法跨语言无损映射。作者用 usage-cloud 框架将概念表示为上下文化嵌入的点集,定义 α-unalignability 为无法同时保持词汇忠实(质心对应)与结构忠实(局部邻域拓扑)。
研究用 EverMemBench 评估 LLM 长期对话记忆中结构深度与上下文宽度的交互,测试深度 D1-D4、1,024/2,048/4,096 token 核心预算及 Production、Oracle 条件。
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
研究团队基于 Fields of The World(FTW)基准首次系统评测了 18 个分割模型与地理空间基础模型(GFM),发现 U-Net 语义分割模型在性能与部署指标上优于实例分割和 GFM 方案。
DirectSpeech2LLM 是一个端到端框架,用于缓解 Speech-LLM 的提示词过拟合问题——仅在 ASR 指令上训练的模型难以泛化到语音翻译等新指令。