跳到正文
今天10月7日周三1241 条
  1. arXiv cs.LG22

    MSPR:面向目标条件强化学习的多尺度预测表征

    针对离线目标条件强化学习(GCRL)在稀疏奖励下编码器易学到与目标无关特征、导致策略学习不稳定的问题,研究者提出 MSPR 框架,通过多尺度预测监督在隐空间中强化目标导向对齐。该方法在视觉与状态任务上均取得强劲表现,并在具有挑战性的真实数据条件下保持 SOTA 性能。

  2. arXiv cs.LG24

    Particle MCTS:面向 GPU 批并行的并行蒙特卡洛树搜索算法

    研究者提出 Particle MCTS(PMCTS),一种适配神经网络评估、面向 GPU 批并行加速的并行 MCTS 算法,同时保留 MCTS 的近似策略改进解释。PMCTS 随并行算力扩展良好,在 Chess、19x19 Go、9x9 Go、Gardner Chess、Snake、Brax 经典控制环境及 Sokoban 中的 LLM 推理等离散与连续动作基准上,持续优于或比肩主流启发式基线。

  3. arXiv cs.LG12

    从双循环到梯度裁剪:分布鲁棒多目标优化取得更快收敛

    研究者提出分布鲁棒多目标优化(DR-MOO),在各自最坏分布下最小化多个目标,并给出 Pareto 型解概念与带理论保证的 MGDA 算法。基于拉格朗日对偶重构的双循环 MGDA 达到 ε-Pareto 稳定点的样本复杂度为 O(ε^-8),而结合大批量采样与梯度裁剪的单循环 double-clip MGDA 将复杂度降至 O(ε^-4)。

  4. arXiv cs.LG18

    Observable Neural ODEs:连续时间下可识别因果预测的新方法

    研究者提出 Observable Neural ODEs(ObsNODEs),一种基于可观测标准型的 Neural ODE 模型,可在隐藏混杂和部分观测状态下实现连续时间动态治疗效应的识别与因果预测。该方法通过连续时间条件前门调整公式,将潜在结果分布表达为测量模型、潜在动态与滤波分布的组合,并在合成、半合成及真实临床数据上验证了其优于近期序列模型的性能。

  5. arXiv cs.LG24

    MLP 能否精确吸收自身的残差连接?研究给出否定答案

    针对残差块 x -> x + MLP(x),研究发现同宽度的无残差 MLP 无法精确计算相同函数:对 ReLU^2、ReGLU、SwiGLU、GeGLU 等前沿语言模型所用激活函数,该结论在任意深度下无条件成立。仅无门控的 ReLU 和 GELU 存在吸收可能,但仅限于测度为零的权重集合,两类函数族因此普遍不相交,等宽度下移除残差连接并重训练无法精确复现原函数。

  6. arXiv cs.LG13

    基于混合专家机制的自适应无线图像语义通信

    研究提出一种面向MIMO信道的多阶段端到端图像语义通信系统,基于自适应MoE Swin Transformer块,通过动态专家门控机制联合评估实时CSI与图像patch语义内容来计算路由概率,仅激活相关专家子集。仿真结果显示,该方法在保持传输效率的同时,重建质量较现有方法显著提升。

  7. arXiv cs.LG22

    基于高斯过程的质量控制主动学习:面向自主显微镜中鲁棒结构-性能学习

    研究提出一种门控主动学习框架,将好奇心驱动采样与基于简谐振子模型拟合的物理信息质量控制过滤器结合,可在数据采集阶段自动排除低保真数据。在PbTiO3薄膜的BEPS数据集上,该方法优于随机采样、标准主动学习和多任务学习策略,并已在另一PbTiO3薄膜样品的实时自主显微镜实验中验证有效。

  8. arXiv cs.LG22

    面向降雨-径流建模的过程感知 AI:带水文过程约束的质量守恒神经网络框架

    研究提出质量守恒感知机(MCP)框架,通过在单一 MCP 储水单元中逐步嵌入有界土壤储水、状态依赖导水率、可变孔隙度、下渗能力、地表积水、垂向排水与非线性地下水位动态等水文过程约束,在美国本土 5 个水文气候区共 15 个流域上以日径流预测为目标进行评估。

  9. arXiv cs.LG29

    RAM-Net:用稀疏可寻址状态实现线性时间序列建模

    RAM-Net 将循环状态组织为固定大小的独立槽位数组,通过 Address Decoder 把每个 key 或 query 映射为稀疏地址,只读写少量槽位,从而抑制 token 间干扰。该模型在细粒度长程检索上优于强循环基线,困惑度最低且常识推理具竞争力,每步访问的状态元素比 Mamba2 少 8 倍。论文已被 NeurIPS 2026 接收。

  10. arXiv cs.LG17

    重新思考微调:Mask Fine-Tuning 无需改动权重即可释放视觉语言模型隐藏能力

    研究者提出 Mask Fine-Tuning(MFT),一种不修改骨干权重的视觉语言模型适配方法,通过学习掩码选择性路由预训练连接中的信息,动态发现更对齐下游目标的子网络。实验显示 MFT 在多个视觉语言基准上持续优于 Full Fine-Tuning(FFT)和 Parameter-Efficient Fine-Tuning(PEFT),且不增加知识、不改变部署架构。

  11. arXiv cs.LG23

    TIDAL-Net:面向物理神经网络的时间复用层复用架构

    针对物理神经网络(PNN)权重调整缓慢的瓶颈,研究者提出 TIDAL-Net,利用 PNN 中快速前向动态与缓慢可训练权重之间的时间尺度分离,通过逐层时间复用提升有效深度并控制实现成本。在图像分类和自然语言处理任务上的数值实验显示,仅需对常规 PNN 做少量修改即可提升性能。

  12. arXiv cs.LG31

    HARL-A:基于 IsaacLab 的可扩展异构多智能体对抗强化学习基准框架

    HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。

  13. arXiv cs.LG22

    贝叶斯优化中的直接遗憾优化(Direct Regret Optimization)

    研究者提出一种直接遗憾优化方法,通过从候选模型与采集函数集合中蒸馏,联合学习最优模型与非短视采集策略,显式以最小化多步遗憾为目标。该框架用不同超参数的 Gaussian Process 集成生成模拟 BO 轨迹,训练端到端 Decision Transformer 选择下一次查询,并以少量真实评估在线精调 GP。在合成与真实基准上,其最终简单遗憾达到最佳或接近最佳,高维场景增益最大。

  14. arXiv cs.LG17

    无需网络无混杂假设的网络干扰下因果效应估计

    针对网络干扰下因果效应估计依赖"网络无混杂假设"、而观测数据中潜在混杂因子常使该假设失效的问题,研究者提出一个混杂因子恢复框架,显式刻画仅影响个体、仅影响邻居、同时影响两者三类潜在混杂因子,并基于可识别表示学习设计网络效应估计器。理论证明了三类潜在混杂因子的可识别性,并据此建立网络效应的形式化识别结果,大量实验验证了理论发现与方法的有效性。该工作已被 IEEE TPAMI 接收。

  15. arXiv cs.LG17

    TURS:概率化真正无序规则集,兼顾可解释性与预测性能

    研究者提出 TURS(Truly Unordered Rule Sets)概率规则集模型,通过仅允许概率输出相近的规则重叠来化解冲突,并基于 MDL 原则形式化学习问题、设计了启发式算法。基准测试显示,该方法学到的规则集模型复杂度更低,预测性能具竞争力,且规则间经验上"独立",实现真正无序。该工作已被 JMLR 接收。

  16. arXiv cs.LG24

    H-CDLM:面向语言建模的层级表示联合连续扩散框架

    研究者提出层级连续扩散语言模型 H-CDLM,通过并行扩散 token 及其聚类得到的粗粒度语义表示,以极小的算力与参数开销提升连续扩散语言模型。应用于 CoBit 得到 H-CoBit,在 LM1B 上生成困惑度 49.4、OWT 上 50.4,较基线分别改善 24.2 和 20.7 点,GSM8K 准确率达 27.4%。该框架同样适用于流匹配模型 FLM,代码将公开。

  17. arXiv cs.LG36

    语言模型微调中的伪遗忘机制:遗忘为何不总是灾难性的

    语言模型微调时看似遗忘的知识往往仍被存储且可恢复,这种现象被称为伪遗忘。研究通过一个最小联想记忆模型复现了该动态:共享结构的键、集中的新值和网络归一化三者共同作用,微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。

  18. arXiv cs.LG18

    通过路径-流对齐实现路径与流的协同演化

    研究提出路径-流对齐作为 flow matching 的统一训练目标,联合训练保端点的路径网络与流网络,使流匹配路径速度、路径对齐当前流。作者发现路径过拟合:对齐损失下降但样本质量变差,与概率路径中的低熵瓶颈有关。为此引入随机路径正则化器,隐藏部分源信息并保持端点精确,在 ImageNet-256x256 与 SiT 骨干上跨模型规模持续改善 FID。

  19. arXiv cs.LG22

    冻结的 VideoLLM 是否已编码证据就绪信号?Readiness Gating 提升回答时机准确率

    研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。

  20. arXiv cs.LG17

    多模态几何表示中的方向依赖响应:超越扰动幅度

    研究发现多模态几何对齐分数对模态退化的响应并非由扰动幅度主导,位移幅度最多只能解释15%的样本外方差。基于Gram行列式的闭式一阶展开,作者提出方向性几何响应(DGR),在MSR-VTT(N=878)和DiDeMo(N=980)上取得0.838-0.969的样本外R²和0.864-0.963的匹配幅度排序准确率。DGR依赖已观测的退化状态位移,属于解释性量而非部署时预测器。

  21. arXiv cs.LG29

    Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线

    Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。

  22. arXiv cs.LG22

    DIPrune:面向高效多模态语言模型的双重要性任务感知 token 剪枝

    DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。