Nord-Parl-TTS:基于议会演讲的芬兰语和瑞典语 TTS 数据集
Nord-Parl-TTS 是一个面向芬兰语和瑞典语的开放 TTS 数据集,从北欧议会演讲录音中提取了 900 小时芬兰语和 5090 小时瑞典语语音,采用改编版 Emilia 数据处理流程构建,并包含统一评测集。该数据集旨在缩小高资源与低资源语言之间的 TTS 资源差距,已被 ICASSP 2026 接收。
Nord-Parl-TTS 是一个面向芬兰语和瑞典语的开放 TTS 数据集,从北欧议会演讲录音中提取了 900 小时芬兰语和 5090 小时瑞典语语音,采用改编版 Emilia 数据处理流程构建,并包含统一评测集。该数据集旨在缩小高资源与低资源语言之间的 TTS 资源差距,已被 ICASSP 2026 接收。
研究者将 Embedded Language Flows(ELF)扩展至数学推理与代码生成,提出 ELF-REG,用冻结的 AR 教师模型监督中间去噪特征并提供与响应联合去噪的全局表示。
研究者提出 PPG2Speech,一个基于扩散模型的多说话人音素后验图到语音(PPG-to-Speech)模型,无需文本对齐即可编辑单个音素,用于将母语语音编辑为近似二语(L2)语音。该模型以 Matcha-TTS 的流匹配解码器为骨干,引入无分类器引导(CFG)和 Sway Sampling,并提出音素对齐一致性(PAC)评估指标。在芬兰语约 60 小时数据上验证,代码已开源。
VoxReason 提出一个 100 案例的验证器基准,固定每句话、只改动一个指定来源标签线索,并评估引用证据、八个计划字段和允许的响应。在 24 案例的来源键不相交测试中,来源情绪先验的计划槽准确率达 0.958,但 24 个编辑后的中性目标均未出现在其训练标签中,必需变更准确率为 0.000。在 32 案例的情绪不相交测试中,该先验的计划槽准确率为 0.219,必需变更准确率为 1.000。
针对大语言模型偏见评估中单对对比句不可靠的问题,研究者提出双最小对(dual minimal pair)评估框架,通过改写与替换属性生成英文、俄语、西班牙语和中文的刻板印象数据,并设计两项评估指标,其中一项基于社会群体与刻板属性间互信息(MI)的新指标更适合跨语言、跨模型聚合比较。代码已开源。
研究基准测试了13个量子与经典生成模型,在最高30 qubits的基数约束数据集和基因组单核苷酸变异数据集上直接采样。结果显示,将MMD²等矩匹配损失收敛到相同值的模型,对未见有效集的覆盖差异巨大,说明收敛的损失不能可靠衡量泛化能力。"经典训练、量子部署"流程必须通过采样来测量泛化,而这在目标规模下被认为需要量子设备。
研究指出,复用挑选 Best-of-N 获胜者的分数会高估其期望奖励。基于每个候选 K 个独立分数的固定矩阵,仅当 J<K 时,单一估计量才能对期望评判奖励完全无偏;在 J=K-1 时,无偏 minimax 风险为 σ²/√K 量级,允许偏差则可提升至 σ²/K。对两个候选者,Holdout 无需已知方差即可达到 1/(π√2) 的渐近无偏 minimax 常数。
研究提出一种统一的自回归扩散图生成模型,联合学习结构与特征,从观测到的垂直平面自底向上构建任意层级深度的完整3D场景图(3DSG)。该方法在合成场景、真实建筑平面图和机器人传感器数据等3DSG数据集上持续超越所有基于学习和随机的基线,并在最大层级和真实单层数据上超越可获取目标图尺寸的one-shot模型。
一项针对 K-12 数学辅导对话的探索性研究发现,LLM 对五种学生失败模式(不确定性、错误归因、算子选择、概念缺口、程序失误)的分类中,人机一致性仅为中等(kappa = .524-.597),而跨模型一致性显著更高(kappa = .755-.781;alpha = .769)。这表明跨模型共识可能制造正确性的假象,模型间的一致不能替代对推断构念有效性的独立证据。
研究者提出 Gromov-Wasserstein 目标的多线性推广,在温和假设下可得到以对称群 G 取商的概率分布间形状距离。针对 G = SO(d),他们提出对手性敏感的手性 Gromov-Wasserstein(CGW)距离,并证明其鲁棒性、给出高效算法,通过将耦合投影到低维空间重写优化问题,得到局部解与近似全局解算法及完全多项式时间近似方案。
研究用同数字引用替换法压力测试 Jev 作为金融证据评判器的表现,评估其对 GPT-4.1-mini 计算轨迹的来源支撑验证能力。在固定操作数与运算、仅在同数字单元格间移动引用的条件下,带符号数字指针基线解释了大部分恢复效果,显式列标签能改善部分错误角色判定,但也会降低对等价证据的支持。在 36 个新来源页上的后续评测复现了检测角色错误与保留有效引用之间的同一权衡。
研究者提出一种薄板交互模型与交互驱动的量子核,由纠缠 Pauli-string 特征映射构建,可显式编码稀疏高阶块交互,其保真度核具有半正定性并支持精确块因子化。
研究者提出神经语义验证框架,将放射组学测量转化为可寻址证据记录与机器可检验声明,在 611 例 UPenn 病例上定义语义状态,外部证据账本覆盖 331 名患者的 1,655 条模型关联记录。
RIPE++ 提出一种仅从正样本对中同时导出奖励与惩罚的强化学习奖励机制,无需构造负样本对即可学习判别性关键点检测器与描述子。该方法将同一 RL 目标扩展至匹配阶段,通过适配 LightGlue 将 MegaDepth1500 上的 AUC@5 从 56.58 提升至 59.65,并支持部分视觉重叠图像对的弱监督全流程训练。在低纹理医学视频序列等相机位姿缺失场景下同样可训练,结果与全监督方法相当。
一篇综述系统梳理了在部署阶段为 LLM 增强"参数内记忆"的方法:将承载记忆的参数对象在推理时接入前向传播,以补充 ICL 消耗上下文容量、重复离散编码成本随上下文增长的问题。
研究提出 InterCorrect,针对基于 Speech-LLM 的公平 ASR 做人口统计感知模型合并:在 SLAM-ASR 上仅微调 connector,再按子群 WER 与 task-vector 冲突定位跨轴人口统计对,施加交叉群体校正向量。
研究者提出 Token 级离策略标注(TOPL),将后训练重构为 token 级正确性预测任务,通过让模型区分回复中的好 token 与坏 token 来引导生成。
一项针对地震指令文本英译中、英译西的实验显示,使用话语特定提示词可显著提升生成式 AI 译文的可理解性与可操作性,但译者仍可能不信任这些译文。研究指出人工修订依然必要,既为发现错误,也因这类信息需有人对错误或延误承担责任。
针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。
研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。
研究首次探索粒子喷流生成任务中是否存在缩放定律,成功复现了模型规模缩放的对数缩放行为。研究发现切片 Wasserstein 距离与下一 token 预测验证损失单调相关,表明该损失是物理性能的良好代理指标。数据集规模和计算量的缩放行为明显较弱,作者通过引入可学习窗口概念分析这一现象,认为喷流成分的自回归预测相比语言模型更快饱和。
ForcingDAS 是一个基于 Diffusion Forcing 的统一数据同化框架,为每帧分配独立噪声水平,学习联合轨迹先验而非逐帧转移,从而捕捉长程时序依赖并减少误差累积。
一篇立场论文提出"翻译同构假设"(TIA)在原则上就不成立,即部分概念(如语用标记、敬语、历时分层词汇)的语义结构无法跨语言无损映射。作者用 usage-cloud 框架将概念表示为上下文化嵌入的点集,定义 α-unalignability 为无法同时保持词汇忠实(质心对应)与结构忠实(局部邻域拓扑)。
研究用 EverMemBench 评估 LLM 长期对话记忆中结构深度与上下文宽度的交互,测试深度 D1-D4、1,024/2,048/4,096 token 核心预算及 Production、Oracle 条件。
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
研究团队基于 Fields of The World(FTW)基准首次系统评测了 18 个分割模型与地理空间基础模型(GFM),发现 U-Net 语义分割模型在性能与部署指标上优于实例分割和 GFM 方案。
DirectSpeech2LLM 是一个端到端框架,用于缓解 Speech-LLM 的提示词过拟合问题——仅在 ASR 指令上训练的模型难以泛化到语音翻译等新指令。
视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。
一项被 AACL-IJCNLP 2026 接收的研究测试了 SLM 与 LLM 是否具备文字系统(script)知识,即能否让输出文字系统匹配输入,以及能否遵循指定文字系统的指令。测试模型均达到近乎完美的拉丁文字系统保真度(超过 98%),并能高频遵循文字系统指令,但 LLM 在非标准文字系统组合上得分高于 SLM。
一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。
研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。
研究提出 TACIT 框架,将外部能力需求分解为 Source、Transformation、World Effect 三个维度,定义八种能力类别,并用 1,600 条平衡训练查询在四个开源 LLM 家族的生成前隐藏状态上训练线性探针。
研究首次系统分析了 LLM 多目标对齐中"跨目标干扰"现象——标量化训练只提升部分目标而其他目标退化,该现象普遍存在但强依赖模型。作者推导出局部协方差定律,并据此提出 COVER(协方差下限强制重加权)控制器,仅在目标奖励与标量化分数的协方差低于阈值时提升其权重。实验表明 COVER 能缓解干扰,且在目标已协同改善时与线性标量化持平。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。
研究将无监督与监督学习结合,用短无序纳米线中 Majorana 分裂的无标签模拟数据,区分"拓扑"与"平庸"相并定位二者在参数空间中的交叉点。该方法有望用于在实验 Majorana 纳米线中识别拓扑,论文发表于 Phys. Rev. B 114, 165418。
研究用两个意大利语二选一伪词实验测试五款 LLM,并与人类行为基线对比。当选项含真实词提供的词汇熟悉度线索时,LLM 与人类的一致性更高;在纯伪词条件下则明显低于字符 n-gram 模型 fastText。驱动人类与 fastText 一致的亚词汇余弦相似度线索未能稳定迁移到人类与 LLM 的对齐上,推理 token 消耗也与人类处理难度无稳定关系。
PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。
针对粤语歌词创作中旋律与声调需紧密对齐的问题,研究者提出 ARIA 框架,可直接从带字符级时间戳的演唱录音生成粤语歌词。该框架先用 TRATE 从演唱音频预测 0243 声调序列,再用 DRA-TCLG 结合检索增强的词汇引导生成流畅歌词,并构建了大规模对齐的音频-粤拼-0243 数据集。
研究人员开发了 DRTool,一个通过 R 包提供的交互式工具箱,用于帮助分析人员识别高维聚类中的虚假簇。该工具包含可视化评估和假设检验等新的聚类验证技术,可辅助识别数据过度聚类现象,并更好地解读高维聚类结果。
研究者提出 OMIT 基准,包含 218 个配对框架场景、覆盖 10 种冲突类型,场景由基于 LLM 的五视角哲学人格面板(功利主义、义务论、美德伦理、关怀伦理与契约主义)的分歧模式构建。