针对多语言语音匿名化的声学与内容导向说话人验证攻击研究
研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。
研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。
研究用受控污染框架测试数学智能体能否识别并纠正被篡改的工具调用结果,在 31 道题上对比四种验证设计。无验证时准确率从 100% 骤降至 72.4%,强制同上下文反思可完全恢复至 100%,可选验证仅在模型主动调用时有效。显式检测后完整重启问题在 100% 情况下成功,表明验证器可用性与验证策略是数学智能体可靠性的两个独立组成部分。
SAGE 是一个面向医疗问答的数据合成框架,利用 MeSH 等公开分类体系作为语义锚点,让本地部署的小模型通过原子与关联合成交替迭代,从极少种子数据生成高质量医疗训练数据。在多个医疗问答基准上,用 SAGE 合成数据微调的模型持续优于自生成或传统文档式方法,且无需大量医疗文档或外部 API。代码已开源,论文被 EMNLP 2026 收录。
针对语义查询引擎中查询计划同时影响成本与结果的问题,研究者给出了成本-精度优化的形式化定义,以决策模型(如 Jev)的校准置信度计算每个决策的期望误差,并按各决策对输出的贡献加权,无需标注数据即可估计计划的期望输出质量。
TICDA 通过 TFM 潜在嵌入上训练的线性代理模型,单次前向传播即可测出上下文中每条演示样本的影响,成本可忽略。该方法在标注错误检测、上下文筛选、跨 TFM 归因迁移和主动学习采集四项任务上取得优于对比方法的效果。
VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。
PixelTriage 是一个置于检索之后的小模型插件,不生成文本,仅凭对话、简短笔记和每张检索记忆的缩略图,就能在回答模型运行前预测该记忆的像素能带来多少增益。
研究者提出 ReGraph——一种带生物归纳偏置的循环双流图模型,包含视网膜驱动的分流编码、背侧到腹侧调制和动态侧向连接,在 Something-Something V2 动作基准上训练。结果显示,上下文不变编码与网格样空间基仅沿扩展背侧通路共同涌现,单流、无调制变体和标准基线中均不出现。事后分析表明这些网格样基可作为可复用的路由模板,提示泛化能力在感觉信息被分解为层级化分流时便已成形。
研究者提出自监督测试时自适应方法 SALT,利用上一动作块中未执行的"剩余轨迹"作为监督信号,在视觉干扰发生时更新 VLA 策略,并通过 Transition Anchoring 与 Sequential Correction Propagation 将修正沿执行轨迹传递。
针对循环语言模型重复堆叠层导致 KV cache 扩大 T 倍的问题,研究者提出 Hybrid Latent Attention(HLA),在滑动窗口内保留精确 key/value,窗口外旧 token 压缩为 latent 供各轮循环的 query 直接读取。
针对静态跨模态对齐易导致过度对齐、置信度融合忽视特征量级差异的问题,研究者提出对齐与校准驱动的多模态学习框架 ACML。该框架包含动态跨模态三元组对齐模块和差异感知注意力校准策略,前者按置信度差距对正样本对施加差异化约束,后者依据特征量级与置信度差异自适应调整注意力正则。在多个多模态基准数据集上,ACML 的性能与鲁棒性持续优于近期 SOTA 方法。
研究提出多模态知识蒸馏(MKD)框架,用低秩多模态融合(LMF)结合预训练WSI图像编码器与临床文本编码器,教师模型学习图像-文本融合表示,学生模型蒸馏后仅凭图像即可推理。在PatchGastric基准上平均准确率比SOTA至少高3.35%,且不依赖Transformer融合、多任务学习或大语言模型,源代码已开源。
针对视频生成中运动定制的内容泄漏问题,研究者提出 Control-based Motion Customization(CMC)训练框架,用随机最优控制(SOC)引导生成动态朝向目标运动、避免向参考视频坍缩。该方法去除显式奖励并引入仅作用于生成早期阶段的时间步自适应运动代价,训练速度提升 2.5 倍,在缓解内容泄漏的同时保持运动保真度与基座模型的多样性。
IEEE 802.11 正在定义 802.11bx 修正案 WLAN Intelligent Networking(WIN),目标是让 Wi-Fi 9 不仅承担通信,还提供感知与计算等新服务。
VAN-Flow 是一个面向生成式离线强化学习的框架,通过类别分布式 critic、方差规避期望算子和基于拒绝采样的流匹配生成 actor,在 D4RL 与 OGBench 的 40 多个任务上持续超越强基线,长时程与高方差场景增益最大。该工作已被 NeurIPS 2026 接收。
研究提出视觉弃权概念,即模型在请求的视觉变换不可能完成时应识别并拒绝生成。为此构建了 Draw-or-Decline 基准,包含 7 类任务的 1,050 对可行-不可行请求,评测 8 个统一多模态模型发现编辑能力与弃权能力相互独立,最强编辑器编辑准确率 68.4% 却仅拒绝 0.4% 的不可行请求。
一项多数据集基准研究显示,经自监督预训练和半监督微调的深度学习模型在 ECG 波形分割上全面超越常用工具,在心律多样数据集上 mIoU 达 71.3%,而最强工具仅为 54.8%。
ReFold 是一种免训练的渲染层方法,可在保留底层交互历史的同时压缩模型渲染的上下文,无需辅助预测器即可去除轮间冗余,且每次删除严格可逆。在五个长程基准和两个前沿 LLM 上,它将 token 消耗降低最多 2.5 倍、每会话 KV-cache 内存减半,且不降低任务成功率。
研究团队提出自学习科学智能体 Gan Jiang,基于 XMatcher、XQueryer、XDecomposer 和 WPEM 组成的粉末 X 射线衍射分析生态,通过诊断失败、修订技能指令与代码并验证后复用,无需重训语言模型或改动物理模型。
研究者提出 PEFT 方法 DyPAM(Dynamic Positional Attention Modulation),直接作用于 query 和 key 表示,通过输入条件化的维度级调制与 head 级、layer 级结构调制,在不改动预训练主干的前提下对齐 RoPE 引发的位置结构。
研究者提出 Dev-Primitives(开发原语),把仓库组件与其常驻 LLM 配对,使其具备自然语言推理、组件间通信和局部自我修改能力,并据此构建 Harness Engineering 框架 HERMES。
研究团队提出通过 Model Context Protocol(MCP)逐步下发流程步骤,让智能体每执行一步就返回结构化 step_output,以牺牲自主性换取过程可预测性。
一项 110 人参与的临床实体抽取实验发现,在缺乏实时性能反馈时,AI 解释会让新手用户系统性地滑向过度依赖,而自评任务理解度更高者依赖行为更具选择性。研究提出"依赖校准"概念,用于刻画新手用户如何动态调整对 AI 的依赖,并为缺乏性能信号场景下的 AI 工具设计提供可操作建议。
一篇 arXiv 论文将 empowerment 最大化与技能学习(skill-learning)方法关联,为解释和分析 empowerment 提供了新的几何框架。该分析回答了 empowerment 与结构中心性之间关系的长期开放问题,并揭示了信息几何与奖励几何之间的区别,为构建可扩展的 empowerment 最大化方法提供了理论启示。论文共 34 页、12 张图,网站与代码已公开。
研究者提出 ServeLearnBench,用于评估 LLM 智能体从服务经验中持续学习的能力,覆盖零售客服、银行和销售话术生成,包含 53 个环境窗口和 7,718 个任务。
研究者提出属性图聚类基础模型 OFAG,基于 Prior-data Fitted Networks 从合成属性图中学习可复用的聚类推理策略,无需针对单个图训练、微调或调参。
一项基于英国出生队列 National Child Development Study 的研究发现,用 11 岁作文预测 23 岁抑郁症状时,仅依赖六项童年协变量的逻辑回归基线 AUC-ROC 达 0.737,优于所有只看作文的文本模型,包括七个微调 Transformer、词袋模型、冻结嵌入和四个零样本大语言模型,其中最佳 Transformer 仅为 0.670。
CLARER 模型通过对比学习与 Transformer 编码器学习评论文本中的方面特征,并结合 MLP 学习的评分特征生成用户和物品表示,再用 Transformer 解码器生成推荐解释。在三个基准数据集上,该模型在推荐准确性和解释生成方面均优于基线方法,相关论文获 WI-IAT 2025 最佳学生论文奖。
研究者提出一种单参数、后期集中的幂律 token 削减调度,在无额外推理成本下持续提升视觉 Transformer 的分布外准确率。在 ImageNet-C 上用 DeiT-S,该调度在削减 26% 计算量时弥补了 83% 的精度差距(+1.17pp),在削减 7% 时弥补 99%(+0.26pp)。
研究揭示工具调用智能体在证据到行动链条上的失败模式:在十种模型-框架配置中,静态动作评估能力强,但交互式执行明显偏弱。失败常始于执行前——智能体调查不完整便停止,或在所需证据建立前就行动;一旦证据齐备,单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。
机器学习编译器 Cleave 通过符号化解耦,将代数变换搜索与算子调度分离,在常见 LLM 子图上生成的 kernel 比最优基线最高快 2.8 倍(平均 1.6 倍),编译时间比 Mirage 平均减少 5.9 倍。
研究者提出 RELER(REinforcement Learning for Retrieval),一个让现有嵌入模型在嵌入向量空间中直接学习检索并对齐任务奖励的强化学习框架,通过从以归一化编码器输出为中心的 von Mises-Fisher 分布采样查询和文档嵌入,并用 RLOO 更新编码器。
SanSi 将预训练循环语言模型改造为类型化决策模型,每次循环后读取选项概率,并用恰当评分规则训练每一轮循环,使单次运行即可覆盖 1 到 8 次循环的任意预算。
研究者提出 WASD,一种基于 Wasserstein 距离的大语言模型知识蒸馏方法,通过由 token 嵌入构建的代价矩阵引入 token 级语义信息,并采用 Sinkhorn 散度推导出梯度等价目标以降低计算开销。在多个 LLM 系列和规模上的实验显示,WASD 在指令跟随、数学推理和代码生成等任务上持续提升蒸馏性能。该工作已被 NeurIPS 2026 接收,实现已公开。
研究分析了仅用帧级目标有无标签训练的小型无人机点检测架构,该架构冻结分类学到的空间特征,再用同类帧标签训练读出层生成空间得分图与点检测,无需外部检测器。
研究者提出 Dual-FDM,一种在频率感知扩散模型中解耦双重图像参考的个性化生成范式,可同时处理定制风格迁移与色彩风格迁移。该方法通过掩码策略在频域解耦不同频段:定制风格迁移用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移则用色彩参考前景与背景的低频段替换风格参考背景的低频段。实验验证其优于当前最先进的个性化图像生成扩散模型,代码已公开,论文将发表于 NeurIPS 2026。
针对灵巧操作中独立关节扰动难以发现协调行为的问题,研究者提出 EigenDEXplore,通过沿人类手部数据导出的特征向量方向添加扰动来诱导相关探索,同时保持动作空间不变。在多种灵巧手上,该方法在抓取、手内重定向和接触丰富操作中持续优于关节空间和学习动作空间基线,并适用于无结构及参考引导的 RL、轨迹优化和 sim-to-real 部署。
研究提出归一化精确解体积(NESV)指标,用于衡量 Transformer 解在更长输入上的泛化能力。对固定宽度单层 Transformer,FIRST 和 MAJORITY 任务的 NESV 为 Θ(1) 和 Θ(1/(n log n)),INDEX 为 Θ(1/n³),PARITY 为 0。
加州葡萄园精准病害防控项目评估了两种人机协作工作流。Workflow 1 中,多智能体研究系统 Aleks v1 在 145 分钟内开发出 vine-scale 预测模型,在回顾性模拟中对 45% 藤蔓位置进行侦察,模型辅助行优先级排序将新记录红叶观测的遇到比例从 85.8% 提升至 94.1%。
CACHEFORGE 是首个将大语言模型嵌入硬件感知闭环、端到端演化缓存替换策略的框架,每轮由 LLM 生成新的 C++ 替换逻辑,并在 CRC-2 ChampSim 模拟器上评估。