通过对抗强化学习改进论辩挖掘的合成数据生成
研究提出一种对抗强化学习框架用于论辩挖掘(AM)的合成数据生成,生成器产出结构化 AM 实例,判别器通过区分真实与合成数据提供学习信号,二者在对抗循环中联合优化。实验表明,该框架在三个基准数据集的全数据和低资源设置下均持续提升 AM 性能。该工作已被 EMNLP 2026 Findings 接收。
研究提出一种对抗强化学习框架用于论辩挖掘(AM)的合成数据生成,生成器产出结构化 AM 实例,判别器通过区分真实与合成数据提供学习信号,二者在对抗循环中联合优化。实验表明,该框架在三个基准数据集的全数据和低资源设置下均持续提升 AM 性能。该工作已被 EMNLP 2026 Findings 接收。
对高分辨率模型逆向攻击(MIA)的标准评估显著低估了训练数据隐私泄露:在 FaceScrub 上对攻击做简单自适应调整后,MixUp、对抗训练等防御及无防御模型的图像泄露率提升 1.16 至 6.59 倍,声称隐私最强的防御增幅最大。
研究团队提出心电基础模型 MS-ECG-FM,通过对比对齐 ECG、超声心动图、放射和出院报告等多种临床记录类型进行训练,突破以往仅依赖 ECG 解读报告作为监督的局限。在扩展的 ECG 检测基准上,该模型在 ECG 可检测的全部病症范围内全面超越现有方法,在减少导联配置下同样表现优异。不同报告分别提升不同诊断领域的表征,多源对齐则捕捉其互补信息,在临床多样化任务上保持稳定强劲表现。
研究提出 Co-Train 与 Dual-Space Retrieval 两个与骨干无关的框架,将自监督表征(SSL)作为监督表征的互补信号,用于 OOD 节点分类。
针对半监督学习中标注与未标注数据在类别分布和标签空间上双重失配的问题,研究者提出 hub-spoke 隐空间几何结构,让已知类均匀分布在中心 hub 周围并各自围绕原型形成紧凑簇,hub 同时作为高不确定性未知类样本的低证据区域锚点。该方法结合基于证据的分类器,通过结构化特征组织缓解多数类主导,提升特征判别力与不确定性分离能力。实验显示其优于现有 SOTA 方法,在不同设置下最高提升 3.25%。
TAFFY 是一个结合 In-Context Diversity Prior 与 Task-Conditioned Looped Transformer 的表格基础模型,通过从共享因果过程经受控干预和分布偏移生成的多个相关环境中采样来构建合成预训练上下文,并迭代地选择性应用共享 Transformer 块进行任务自适应精炼。在六个分类和五个回归基准数据集上,TAFFY 取得最低平均排名。
研究者提出 Global Transport(GT),一种不依赖类别标签的全局类别无关最优传输耦合,用于条件流模型的训练。GT 单独使用会因将不同条件关联到源噪声不同区域而降低性能,但与无分类器引导(CFG)结合后,在离散类别和连续文本条件的图像生成中,跨模型规模和采样预算均稳定提升生成效果。该结果表明耦合设计应在推理时的引导流下评估,可作为无需改动架构、采样器或引导机制的训练期优化手段。
一项针对混合 Fourier 神经算子的数值案例研究表明,在模拟相干 4f 处理器上,定向搜索找到的器件在 120 个模型中的留出误差达到 200 个随机 Monte Carlo 器件最大值的 1.08-3.10 倍。
研究提出掩码频带功率预测(MBP)作为 EEG 自监督预训练目标,对掩码通道-时间块预测固定窄带对数谱能量,避免相位敏感的波形重建和学习式码本。
研究在 Android in the Wild 上用 LoRA 微调 Qwen2-VL-2B,比较五种向小型 GUI grounding 模型注入动作类型的方式。
StaFIR 是一种因果有限脉冲响应滤波器,通过可学习的非负指数滞后剖面混合,以凸优化目标在经验平稳性与输入相似度之间取得平衡。在 ARFIMA–GARCH 和滚动金融序列实验中,它能随序列持续性调整滤波强度,并在平稳状态下减少不必要的变换。下游预测中其精度与固定半阶差分无明显差异,但对原始信号的相似度更高。
研究提出一个面向 EEG 脑机接口解码的在线自适应基准,在时间有序的 prequential(先测后训)评估下比较 CSP 与黎曼协方差两类流水线。在四个数据集(三个运动想象、一个运动解码)上,标签揭示的在线更新在两个最大数据流中改善了 14 个模型/数据集组合中的 13 个,相对冻结模型准确率提升最高约 18%。
研究者提出可学习频谱激活函数(LSA),用残差截断傅里叶级数替代固定的神经元级非线性,谐波幅值在训练中学习。LSA 不扩展渐近函数类,而是改变表示的因子分解方式,使线性权重选择特征、激活系数控制频谱整形,两者由独立梯度更新。在音频、图像、神经辐射场和神经声场任务上,LSA 均提升了重建质量。
研究提出用 prior-data fitted networks(PFN)从有限离线数据中学习和评估主动特征获取策略。作者发现,在离线数据覆盖不均衡时,以总预测熵为奖励会引入认知偏差,惩罚对稀疏观测特征的获取,因为它把认知不确定性与偶然不确定性混为一谈。
一项被 NeurIPS 2026 预训练到后训练 Workshop 接收的研究指出,pass@k 只依赖问题被答对的概率,无法反映答案分布。用 GRPO 和 RFT 训练 Qwen2.5-1.5B-Instruct 后,三项多样性指标走向相反,GRPO 正确解的词法多样性低 15%,但 pass@8 和 pass@32 在 GSM8K 上无一致赢家,仅在低 k 时出现分离。
Fed-BRDECS 是一个隐私保护且异构感知的联邦深度嵌入聚类框架,用本地可计算的样本稳定性损失替代全局归一化聚类目标,避免传输本地软分配分布。它引入预测均衡采样和质心级重启来应对非 IID 客户端分布,在图像与文本聚类基准的 IID 和非 IID 划分下均优于代表性联邦聚类与深度聚类基线。该框架还可用于联邦时间序列异常检测,在不增加推理成本的情况下提升基于重构的检测器。
研究团队提出统一基准,用于跨模型、跨特征配置公平评估数据驱动的野火后泥石流(PFDF)预测,并开源代码与基准。同时提出基于强化学习的特征选择框架,通过识别扰动后正负样本不可区分的因子,揭示不同区域 PFDF 发生的潜在机制。
研究揭示现成 MoE 模型在智能体轨迹中已存在专家选择专门化结构:执行语义相似操作(如 READ、UPDATE)的轮次之间专家路由重叠度更高。标准 RL 算法忽略这一结构,导致训练中 MoE 路由失控,限制任务性能与推理效率。
研究者提出 lock-in equilibrium propagation(LIEP)训练方法,可为振荡网络中每个组件提供局部梯度信息,无需单独的前向与反向扫描,从而有望在模拟振荡硬件上实现原位学习。LIEP 既可用于从零训练,也能在预训练参数被扰动后恢复性能,并可表述为三因子更新规则。该方法目前仅在浅层网络上验证,作者认为其他架构或可将其扩展至深层大规模网络。
研究者提出 NN-linkage,一种与 Lance-Williams(LW)递推算法对齐的神经网络模型,可学习任务特定的局部依赖合并规则,同时保留经典 linkage 算法的递归结构与高效推理。
研究者提出 BiToK-SD,一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中自适应学习哪些 token 位置最值得蒸馏。该方法将 Top-K token 选择建模为可微的阈值松弛作为下层问题,上层问题则对选中位置执行知识蒸馏,使选择随学生策略演化而调整。在数学推理基准上,BiToK-SD 在全部对比方法中取得最佳平均性能,且仅需轻量额外计算。
研究对 4 个从零训练的模型和 4 个时间序列基础模型(TSFM)在 3 个真实负荷预测数据集上进行了基准测试,考察未来协变量信息可用性与质量不同的运行场景。结果显示 Chronos-2 在协变量可用或预测准确时,零样本和微调设置下均持续达到 SOTA,但随着协变量预测噪声增大性能下降,而 TimesNet 在严重协变量不确定性下表现更稳健。
三份面向数学研究的数值计算与机器学习实用教程发布,源自 2026 年 4 月在 Banff 国际研究站举办的 DANGER: Data, Numbers, and Geometry 研讨会。
研究首次为 RLVR 训练给出差分隐私保证:以单个提示词的全部回复为隐私记录,聚合梯度后只裁剪一次并加高斯噪声,隐私预算与每个提示词的回复数量和裁剪范数无关。
研究测试了用 LLM 从新闻中提取移民推拉信号、并通过特征级正则化惩罚融入加权 Lasso 预测框架的效果。在 2021 年 11 月至 2022 年 11 月的墨西哥—美国、乌克兰—波兰、叙利亚—土耳其等走廊上,各配置表现不一,没有单一正则化方法全面胜出。
研究者提出 Quantized Sufficient Statistics(QSS),将冻结的全局 schema 与可变、可求和分解的内容分离,使删除内容成为精确减法而非优化。
研究者构建了 ResearchTrails 数据集,从 Git 仓库的 commit 历史中提取结构化的人类研究轨迹,作为科学探索过程的代理,捕捉方法、实验与消融的连续变化。该数据集包含论文最终结果之外的中间研究决策信号,可用于在测试时检索人类研究经验作为外部技能,以及训练模型以提升对新研究决策的泛化能力。
研究者提出 WRAP(Wasserstein-Reweighting Adversarial Perturbation),一种面向非平稳市场的漂移感知对抗训练框架,用于深度对冲。
针对测定异质性会削弱元学习效果的问题,研究者提出 MetaHeta 框架,通过以相关测定的辅助数据为条件进行预测,并用线性注意力处理大规模辅助数据、精确注意力处理稀缺任务上下文。在 ChEMBL 和 BindingDB 的测定数据上,该方法提升了小样本生物活性预测及回顾性贝叶斯优化中的化合物优先级排序表现。
研究提出一种诊断框架,将缓存预测视为时间异质监督,区分样本存储时已知的类别与之后学到的类别,并在任务级偏移前后评估模型。在 CIFAR-100 上使用 DER++,固定常数可在 1 个百分点等价范围内替代后学类别的未刷新存储分数,偏移将删除其匹配的代价从 14.9 降至 1.8 个百分点;而重分配存储时已知类别的非金标分数代价为 4.3 和 4.0 个百分点,图像蒸馏中同样存在。
一项基于 Vision Transformer 双路径时空注意力架构的研究显示,欧洲次季节土壤湿度预测的精度取决于问题构建方式:残差学习是超越持续性预测的关键,且仅在以物理单位预测根区土壤湿度时才有效。
研究者提出 Sculpt,一种嵌套势框架,将几何相关的耦合约束直接内置于参数化中,通过三维交错网格上体积矢量势的离散旋度生成无散度速度更新,并用共享标量势约束边界值以同时满足不可穿透性,无需逐步压力投影。该方法还引入覆盖多种城市形态与入流条件的 LES 数据集 UrbanWindFlow,用于同时评估精度与运动学可行性。
研究者提出 Contrastive Diffusion Alignment(ConDA),在冻结的预训练扩散模型潜变量之上仅学习一个轻量对齐映射,即可获得可识别的坐标表示。在 TCL/GCL 假设下,该方法能将潜在动力学状态识别到排列和逐分量可逆变换的程度,并保留潜在动态结构因果模型。在物理与机器人视频系统上,TCL 和 GCL 变体实现了近乎完美的分块状态恢复,并在模拟落体系统中实现精确恢复。
Stock-JEPA 提出一种联合嵌入预测框架,以低复杂度金融模型生成的多周期收益与风险统计作为先验锚点,再通过上下文条件修正预测器估计未来表征相对锚点的可预测位移。理论上最优修正可将先验锚点的期望平方误差降低 E[‖Δ‖₂²]。实验显示其在中国和美国股票市场上以 5 项关键指标超越 13 个强基线。
研究提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器每个 block 中 Self-Attention 和 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合作为编码器输出,以在保持训练稳定的同时学习更抽象的表征。
研究者提出一种面向知识追踪(KT)的信息论评测框架,用 Context Tree Weighting(CTW)在题目作答历史上构建因果不确定性坐标,将预测投影到该坐标上,按不同熵区间评估模型增益,而非只看全局指标。
福特汽车提出一种面向高维时序数据的多元监测框架,用于 End-of-Line 测试数据的无监督异常检测,采用两阶段流程:先清洗并对齐时间序列,再做非线性降维与基于控制图的 Phase I 监测。在福特真实生产数据上,该方法的准确率、召回率和 F1 分别从原有模型的 0.50、0.30、0.429 提升至 0.625、1.00、0.769。框架支持无监督与有监督两种设置,模块化结构便于适配不同领域。
研究者提出知识蒸馏框架 MemKD,通过专门的损失函数捕捉教师与学生模型在时间序列子序列上的记忆保留差异,让紧凑循环神经网络更有效地模仿教师行为。实验显示 MemKD 显著优于现有 SOTA 知识蒸馏方法,并能在多种压缩比例下匹配教师模型性能,大幅减少参数量和内存占用而精度损失不显著。
QiYao-I 是一个面向不规则多变量时间序列预测的流形基础模型,通过采样条件化时间流形注意力机制将真实时间戳映射到可学习的时间流形特征空间,并向注意力层注入时间流形偏置,以捕捉不规则时间间隔与局部采样结构。
亚马逊与汽车制造业合作运行的事件驱动云基础设施,三年来调度 40000+ 次生产训练任务,训练物理预测模型与强化学习控制策略的专用模型对,相比常开 GPU 基础设施降低 72-78% 成本。