从噪声样本迭代精炼的神经全局优化方法
一种新的神经优化方法通过迭代精炼从噪声样本中寻找全局最小值,在多模态测试函数上平均误差为 8.05%,相比样条初始化的 36.24% 提升了 28.18%。该模型在 72% 的测试案例中成功找到全局最小值且误差低于 10%,无需导数信息或多次重启。
一种新的神经优化方法通过迭代精炼从噪声样本中寻找全局最小值,在多模态测试函数上平均误差为 8.05%,相比样条初始化的 36.24% 提升了 28.18%。该模型在 72% 的测试案例中成功找到全局最小值且误差低于 10%,无需导数信息或多次重启。
针对现有奖励模型依赖昂贵显式反馈的问题,研究者提出 ImplicitRM,可从点击、复制、跳过等隐式用户反馈中学习无偏奖励模型。该方法用分层模型将训练样本划分为四个潜在组,并推导出理论上无偏的似然最大化目标,以解决隐式反馈缺乏明确负样本和存在选择偏差两大挑战。
研究者提出目标感知频率-空间协同增强(FSCE)框架,用于抗噪 SAR ATR,通过频率-空间建模实现早期特征稳定并结合语义正则化。该框架在网络入口设计 FS-EAE 模块抑制噪声传播,并引入 APSA 机制以在线教师策略施加语义约束。在 MSTAR、OpenSARShip 和 FUSARShip 上的实验验证了其有效性,轻量版 FSCE-Net_μ 仅 0.17M 参数。
针对移动边缘设备上 MoE 大语言模型联邦微调中的数据异构问题,研究者提出联邦聚合对齐框架 FedAlign-MoE,通过一致性加权对齐路由分布、分布正则优化本地门控网络,并量化同索引专家的语义一致性以选择性聚合。实验显示,该框架在非 IID 联邦环境下收敛更快、精度更高,且计算轻量、通信高效。
研究提出"道德推理轨迹"概念,追踪 LLM 中间推理步骤中伦理框架的调用序列,在六个模型和三个基准上发现 55.4–57.7% 的连续步骤发生框架切换,仅 16.4–17.8% 的轨迹保持框架一致。
PC-Diffuser 是一种安全增强框架,将可认证、路径一致的障碍函数结构直接嵌入扩散规划的每一步去噪循环中。它用胶囊距离障碍函数评估碰撞风险以更好反映车辆几何、减少不必要的保守性,并通过运动学自行车模型把去噪路点转为动态可行运动,再施加路径一致安全过滤器消除残余约束违反且不产生几何畸变。
针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。
静态词嵌入在四项已发表案例中复现了 LLM 激活的线性解码结果:预测地点坐标与死亡年份(R² = 0.42-0.59)、区分疼痛与对照句(held-out AUC 0.85-0.88)、对十二种情绪故事分类(AUC 0.84-0.88)。
研究提出两种基于提示的解码策略实现实时游戏视频解说生成:固定间隔解码与动态间隔解码,后者根据上一句解说的预估时长调整下一次预测时机,无需微调即可实现停顿感知生成。在日语和英语的赛车与格斗游戏数据集上,动态间隔解码生成的解说在时间与内容上更贴近人类解说。团队同时开源了多语言基准数据集、训练模型与实现代码。
该方法在解码阶段恢复分割与分类分支的信息交换,通过四级解码器上的 Task Interaction Module(TIM)传递边界上下文,并用 Adaptive Interaction Weighting(AIW)按图像和层级自适应融合特征。
SimToolReal 提出一种以物体为中心的 sim-to-real 强化学习策略,通过在仿真中程序化生成大量工具类物体并训练单一策略,实现测试时无需任何物体或任务特定训练即可完成灵巧工具操作。
ReLoop 通过结构化生成与行为验证两项机制,解决 LLM 生成优化代码时"可求解但语义错误"的静默失败问题。结构化生成将代码生产拆为理解、形式化、合成、验证四阶段,在 RetailOpt-190 上配合 Claude Opus 4.6 提升 8.5pp 准确率;行为验证借助求解器参数扰动检测残留错误,在 MAMO-ComplexLP 上提升 4.4pp。
UniST-Pred 是一个统一时空交通预测框架,先将时间建模与空间表征学习解耦,再通过自适应表征级融合将两者整合。研究基于 MATSim 微观交通模拟器构建数据集,在严重网络断连场景下评估其鲁棒性,并在标准交通预测数据集上取得与现有成熟模型相当的竞争性表现,同时保持轻量设计。源代码与生成数据集已公开。
研究基于 X 平台向法国 682 名志愿者展示的 250 万条 "Who to Follow" 推荐,重建了 X 推荐系统对 26,509 个账号的嵌入向量近似值,并计算出经调查校准的意识形态分数。该嵌入中存在一个按左—右政治立场排序的方向(Pearson rho = 0.887),且区别于年龄、性别或热度方向,移除该方向可在精度损失有限的情况下提升推荐多样性。
研究者提出异步 gossip 原始-对偶算法 Goal-PD,每个节点仅需维护两个变量,不再随节点度数增长,从而大幅降低去中心化学习的显存开销。该算法被证明几乎必然收敛到最优解,并在目标函数为分段线性二次时具有线性收敛速度;在去中心化均值估计中,成对平均被证明是 Goal-PD 的特例。
研究者提出基于混合整数优化(MIO)的统一框架,用于训练交叉群体公平且内在可解释的分类器,并证明了 MSD 与 SPSF 两种交叉公平性度量在检测最不公平子群上的等价性。实验表明该 MIO 算法在发现偏见方面表现更优,可将交叉偏见控制在可接受阈值以下,面向金融、医疗等受监管行业。
研究者提出跨语言激活引导(CLAS),一种无需训练、在推理时选择性调节神经元激活的干预方法,用于缩小大模型主导语言与非主导语言之间的性能差距。在分类和生成基准上,CLAS 平均提升 2.3%(Acc.)和 3.4%(F1),同时保持高资源语言性能。研究发现有效迁移依赖功能分化而非严格对齐,性能增益与语言聚类分离度提升相关,该方法无需修改模型权重。
研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。
研究者提出 Balanced Fine-Tuning(BFT),一种双尺度后训练方法,通过组归一化 token 重加权与序列级重分配,让模型聚焦知识密集、认知不确定性高的样本。
针对 PPO、GRPO 等 RL 算法在离策略训练多轮 LLM 智能体时优化不稳定、易性能崩溃的问题,研究者提出 SORL 框架,并实例化出 SO-PPO 与 SO-GRPO 两种算法。
针对现有均方误差等学习目标忽略未来步标签自相关、且对不同预测步采用等权处理的问题,研究者提出二次型加权学习目标及 Quadratic Direct Forecast(QDF)学习算法,通过自适应更新的加权矩阵训练预测模型。实验显示 QDF 能有效提升多种预测模型性能,达到 SOTA,代码已开源,该工作被 ICLR 2026 接收。
针对时间序列预测中直接预测(DF)依赖均方误差估计条件负对数似然、在标签序列存在自相关时产生偏差的问题,研究者提出 DistDF,通过最小化预测与标签序列条件分布间的分布差异实现对齐。该方法引入联合分布 Wasserstein 差异,可证明其上界为所需条件差异,且可处理、可微、兼容梯度优化。实验显示 DistDF 提升了多种预测模型并取得领先性能,代码已开源,论文被 ICLR 2026 接收。
Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。
研究提出 Hermite 特征结构假设(HEA),仅用经验数据协方差矩阵和目标函数的经验多项式分解两项测量,即可预测核回归在 CIFAR-5m、SVHN、ImageNet 等真实数据集上的学习曲线。该假设在高斯数据上得到证明,真实图像数据也"足够高斯"使其成立;研究还发现 MLP 在特征学习阶段按 HEA 预测的顺序学习 Hermite 多项式。
研究者提出量子比特中心 Transformer(QCT),一种基于 Transformer 架构、采用量子比特中心注意力机制的通用量子纠错解码器,通过专用嵌入策略将稳定子域的 syndrome 转换为量子比特中心 token,并引入融合量子码拓扑结构的图掩码方法。
针对 LLM 作为自动评估器时偏爱自身输出的"自我偏好偏差",研究者提出在推理阶段用轻量引导向量(steering vectors)进行干预,无需重新训练。通过 Contrastive Activation Addition(CAA)和基于优化的方法构建向量,可将不合理的自我偏好偏差降低最多 97%,显著优于提示词和 DPO 基线。
一项 arXiv 研究系统评估了图像类联邦学习场景下梯度反转攻击的实际可行性,覆盖图像分类与目标检测任务及当代分辨率的经典视觉架构。结果显示,现代性能优化模型在视觉上始终能抵抗有意义的图像重建,此前的成功案例多依赖推理模式运行或架构简化等上界设定。在诚实但好奇的服务器假设下,高保真图像重建不构成生产级联邦学习系统的关键隐私风险。
LHM-Humanoid 提出一种无需重置的长时程人形运动控制方法,让物理仿真人形在单次连续运行中反复完成走向物体、全身平衡抬起、绕过障碍搬运并放置的完整循环。
研究者提出 CMCM-DLM,一个模块化框架,可将预训练扩散模型扩展至支持异构分子约束而无需重训主干。该框架用结构控制模块(SCM)在扩散早期引导分子骨架生成,再由性质控制模块(PCM)将生成导向目标化学性质。多数据集实验显示其具备有效的跨模态可控性与较强适应性。
FedCoT 是一个联邦推理框架,通过轻量级 CoT 重采样配合紧凑判别器筛选,并用客户端感知的 LoRA 堆叠与加权分类器聚合来应对数据异构、降低聚合噪声和通信开销。客户端本地生成候选推理链与监督信号,服务器仅聚合轻量模块,数据始终保留在本地。在医疗推理基准上,该方法在紧张资源预算下取得稳定提升,代码已公开,论文被 EMNLP 2026 收录。
研究用认知评价理论构建了覆盖 15 种情绪类别的基准数据集,通过行为表征对比 LLM 与人类的情感概念结构。结果显示 LLM 的情感表征比人类更分类化、同质化和确定化,单一情绪概念内部多样性更低、不同情绪间距更大,且该分类结构对任务框架和人口学角色等上下文变化保持稳健。
针对时间序列预测中时序均方误差忽略标签自相关、任务数量过多的问题,研究者提出变换增强损失函数 Time-o1,将标签序列变换为去相关且显著性可区分的分量,让模型对齐最显著分量。实验显示 Time-o1 达到 SOTA 性能,并兼容多种预测模型,代码已开源,该工作被 NeurIPS 2025 接收为 poster。
研究者提出 KO(Kinetics-inspired Optimizer),一种基于动力学理论与偏微分方程的可插拔优化模块,通过离散化 Boltzmann 输运方程引入随机交互来增强参数多样性、缓解权重凝聚。理论分析表明 KO 可证明地提升参数多样性并保持收敛保证。在 CIFAR-10/100、ImageNet 图像分类和大规模语言模型预训练中,KO 以可忽略的额外计算成本持续提升准确率。
研究者提出 Mask Fine-Tuning(MFT),一种在不更新模型权重的前提下,对已充分微调的 LLM 学习并施加二值掩码的微调范式,用标准微调目标做监督。在 LLaMA2-7B 与 LLaMA3.1-8B 上,MFT 使用相同微调数据集在 IFEval 上平均提升 2.70/4.15。该方法可与现有 LLM 优化流程兼容,并将掩码操作从网络剪枝压缩拓展到更广泛的模型能力提升。
研究提出 Robustness Inheritance Benchmark(ImageNet-RIB),用于评估预训练模型微调后的鲁棒性保持情况。结果显示,在 LAION-2B 等最大最多样数据集上预训练的模型,在小数据集上微调后鲁棒性损失更大、绝对鲁棒性更低,这种崩溃出现在 CLIP 等对比预训练模型及其微调变体中,并随预训练规模增大而加剧,而所测试的监督模型未出现该现象。
研究提出用选择性状态空间模型(Selective State Space)的深度神经网络建模光学动态范围压缩器,性能超过此前的循环层方法。该架构结合 Feature-wise Linear Modulation 与 Gated Linear Units,按外部参数动态调节压缩的 attack 和 release 阶段,适合低延迟实时音频处理。
一篇综述系统梳理了基于扩散模型的视频编辑技术,涵盖数学基础、图像域关键方法及按核心技术关联划分的视频编辑方法演化脉络。文章还探讨了基于点的编辑和姿态引导的人体视频编辑等新应用,并引入新基准 V2VBench 进行全面对比,最后总结了现存挑战与未来方向。
针对直接预测(DF)范式忽略未来标签间自相关导致学习目标有偏的问题,研究者提出频域增强直接预测方法 FreDF,通过在频域中学习预测来缓解标签自相关、降低估计偏差。实验显示 FreDF 显著优于现有 SOTA 方法,并兼容多种预测模型,代码已开源,该工作被 ICLR 2025 接收。
研究者提出超图增强双卷积神经网络(HED),构建包含用户—捆绑、用户—物品、捆绑—物品交互及用户内、捆绑内关系的完整超图,并将完整超图传播与用户—捆绑分支耦合。在 NetEase 上 HED-128 在六项指标上较最强基线提升 5.04–6.97%,在 Youshu 上 HED-64 提升 1.87–4.56%。消融实验支持用户—捆绑分支与类型内关系的贡献,并量化了完整超图的内存开销等计算代价。
研究者提出 Bag-Of-Receptive-Field(BORF),一种快速、可解释且确定性的时间序列变换方法,通过在 SAX 中引入膨胀和步幅,将 Bag-Of-Patterns 扩展为稀疏多元张量表示。