跳到正文
10月7日周三
  1. arXiv cs.LG17

    TURS:概率化真正无序规则集,兼顾可解释性与预测性能

    研究者提出 TURS(Truly Unordered Rule Sets)概率规则集模型,通过仅允许概率输出相近的规则重叠来化解冲突,并基于 MDL 原则形式化学习问题、设计了启发式算法。基准测试显示,该方法学到的规则集模型复杂度更低,预测性能具竞争力,且规则间经验上"独立",实现真正无序。该工作已被 JMLR 接收。

  2. arXiv cs.LG24

    H-CDLM:面向语言建模的层级表示联合连续扩散框架

    研究者提出层级连续扩散语言模型 H-CDLM,通过并行扩散 token 及其聚类得到的粗粒度语义表示,以极小的算力与参数开销提升连续扩散语言模型。应用于 CoBit 得到 H-CoBit,在 LM1B 上生成困惑度 49.4、OWT 上 50.4,较基线分别改善 24.2 和 20.7 点,GSM8K 准确率达 27.4%。该框架同样适用于流匹配模型 FLM,代码将公开。

  3. arXiv cs.LG36

    语言模型微调中的伪遗忘机制:遗忘为何不总是灾难性的

    语言模型微调时看似遗忘的知识往往仍被存储且可恢复,这种现象被称为伪遗忘。研究通过一个最小联想记忆模型复现了该动态:共享结构的键、集中的新值和网络归一化三者共同作用,微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。

  4. arXiv cs.LG18

    通过路径-流对齐实现路径与流的协同演化

    研究提出路径-流对齐作为 flow matching 的统一训练目标,联合训练保端点的路径网络与流网络,使流匹配路径速度、路径对齐当前流。作者发现路径过拟合:对齐损失下降但样本质量变差,与概率路径中的低熵瓶颈有关。为此引入随机路径正则化器,隐藏部分源信息并保持端点精确,在 ImageNet-256x256 与 SiT 骨干上跨模型规模持续改善 FID。

  5. arXiv cs.LG22

    冻结的 VideoLLM 是否已编码证据就绪信号?Readiness Gating 提升回答时机准确率

    研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。

  6. arXiv cs.LG17

    多模态几何表示中的方向依赖响应:超越扰动幅度

    研究发现多模态几何对齐分数对模态退化的响应并非由扰动幅度主导,位移幅度最多只能解释15%的样本外方差。基于Gram行列式的闭式一阶展开,作者提出方向性几何响应(DGR),在MSR-VTT(N=878)和DiDeMo(N=980)上取得0.838-0.969的样本外R²和0.864-0.963的匹配幅度排序准确率。DGR依赖已观测的退化状态位移,属于解释性量而非部署时预测器。

  7. arXiv cs.LG29

    Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线

    Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。

  8. arXiv cs.LG22

    DIPrune:面向高效多模态语言模型的双重要性任务感知 token 剪枝

    DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。

  9. arXiv cs.LG22

    grappa-fullFF:从第一性原理一致学习分子力学力场

    研究者提出 grappa-fullFF,一种从 ab initio 参考数据中一致且同时学习键合与非键合参数的统一方法,无需外部指定的非键合参数。该模型通过静电梯度监督引入物理正则化,并采用利于电荷平衡的架构,恢复了准确的电响应性质,在几何优化基准上达到 SOTA 精度,并复现了经典力场与现有机器学习力场的构象采样。

  10. arXiv cs.LG12

    Learned AMDI:用强化学习策略替代固定选择器的自适应多分辨率扩散成像

    Learned AMDI 保留 AMDI 固定树传播器与层级约束,用 proximal policy optimization 训练的共享局部策略替换传播后选择器。在九个留出案例中,它执行 393 次细化,将平均终端参考差异从 0.17496 降至 0.13657,占用率从 0.13737 升至 0.26660。该共享 actor 无需重训练即可迁移到 64×64 和 128×128 图像。

  11. arXiv cs.LG21

    Scen-Opt:面向数据驱动凸规划的场景优化工具箱

    Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。

  12. arXiv cs.LG12

    CHARTER:计算病理学分层紧凑证据评估中的参考替换审计

    针对数字病理学中分层紧凑证据流程因候选过滤引入策略相关预测、导致评估参考偏移的问题,研究者提出 CHARTER 参考感知评估规范,要求声明预期目标与参考、量化候选引发的预测偏移并审计比较结论的稳定性。在五种子 Random-K 审计的 15 组比较中,4 组出现确定性反转;匹配的原生排序压力测试中,ACMIL 比较从 REVERSED 变为 PRESERVED。

  13. arXiv cs.LG22

    预测精度不等于交易利润:神经进化小型循环网络用于股票收益预测

    研究对比线性、固定循环、Transformer 与混合架构和神经进化搜索出的循环网络,在四个中盘股组合、三个交易年度上评估预测精度与日度多空策略净收益。进化网络在预测精度和净交易表现上均排第一,而精度第二的模型在建仓并计入成本后亏损;其优势来自周期匹配,rank IC 从 1 日到 10 日评分周期上升,而所有超过 300 参数的模型均下降。

  14. arXiv cs.LG17

    共模误差限制低时间步深度脉冲Q网络,CMC-DSQN 提出补偿方案

    研究发现低时间步深度脉冲Q网络(DSQN)的性能退化主要源于动作价值间共享的共模误差,这类误差会通过自举目标损害时序差分学习。为此提出的 CMC-DSQN 用辅助 ANN 补偿 SNN 输出的共模误差,推理时可直接从 SNN 输出做贪心动作选择并完全移除辅助 ANN,保持 SNN 能效。

  15. arXiv cs.LG36

    多轮 LLM 的答案侧后门攻击:模型自生成触发词绕过安全拒答

    研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。

  16. arXiv cs.LG22

    MITNN:数学不变量驱动的拓扑神经网络用于分子与材料性质预测

    研究者提出数学不变量驱动的拓扑神经网络(MITNNs),通过融合拓扑、谱理论、交换代数、微分几何与离散曲率的多尺度不变量,结合拓扑神经架构表示复杂三维结构。在蛋白质-配体结合、金属有机框架性质、突变诱导的蛋白质溶解度及分子毒性预测任务中,MITNN 持续优于现有方法,且特定数学表示与神经架构的配对组合优于单一模型及全部组件聚合。

  17. arXiv cs.LG22

    CASTLE:基于反事实语义-社会世界模型的独立多智能体强化学习

    CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。

  18. arXiv cs.LG22

    液压起重机原木堆清理:从点云学习抓取目标定位

    研究提出一种从无分割点云中学习抓取目标定位的策略,部署在拖车式液压林业起重机上,由同一网络支持行为克隆(BC)与强化学习(RL)。仿真中 BC 可清理 100 堆 200 根原木中的 98 堆,BC→RL 提升负载稳定性。12 次现场试验中,BC 与 BC→RL 分别完成 93.8% 和 88.9% 的库存堆放,高于几何启发式的 80.4%。