跳到正文
10月7日周三
  1. arXiv cs.LG29

    Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线

    Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。

  2. arXiv cs.LG22

    DIPrune:面向高效多模态语言模型的双重要性任务感知 token 剪枝

    DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。

  3. arXiv cs.LG22

    grappa-fullFF:从第一性原理一致学习分子力学力场

    研究者提出 grappa-fullFF,一种从 ab initio 参考数据中一致且同时学习键合与非键合参数的统一方法,无需外部指定的非键合参数。该模型通过静电梯度监督引入物理正则化,并采用利于电荷平衡的架构,恢复了准确的电响应性质,在几何优化基准上达到 SOTA 精度,并复现了经典力场与现有机器学习力场的构象采样。

  4. arXiv cs.LG12

    Learned AMDI:用强化学习策略替代固定选择器的自适应多分辨率扩散成像

    Learned AMDI 保留 AMDI 固定树传播器与层级约束,用 proximal policy optimization 训练的共享局部策略替换传播后选择器。在九个留出案例中,它执行 393 次细化,将平均终端参考差异从 0.17496 降至 0.13657,占用率从 0.13737 升至 0.26660。该共享 actor 无需重训练即可迁移到 64×64 和 128×128 图像。

  5. arXiv cs.LG21

    Scen-Opt:面向数据驱动凸规划的场景优化工具箱

    Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。

  6. arXiv cs.LG12

    CHARTER:计算病理学分层紧凑证据评估中的参考替换审计

    针对数字病理学中分层紧凑证据流程因候选过滤引入策略相关预测、导致评估参考偏移的问题,研究者提出 CHARTER 参考感知评估规范,要求声明预期目标与参考、量化候选引发的预测偏移并审计比较结论的稳定性。在五种子 Random-K 审计的 15 组比较中,4 组出现确定性反转;匹配的原生排序压力测试中,ACMIL 比较从 REVERSED 变为 PRESERVED。

  7. arXiv cs.LG22

    预测精度不等于交易利润:神经进化小型循环网络用于股票收益预测

    研究对比线性、固定循环、Transformer 与混合架构和神经进化搜索出的循环网络,在四个中盘股组合、三个交易年度上评估预测精度与日度多空策略净收益。进化网络在预测精度和净交易表现上均排第一,而精度第二的模型在建仓并计入成本后亏损;其优势来自周期匹配,rank IC 从 1 日到 10 日评分周期上升,而所有超过 300 参数的模型均下降。

  8. arXiv cs.LG17

    共模误差限制低时间步深度脉冲Q网络,CMC-DSQN 提出补偿方案

    研究发现低时间步深度脉冲Q网络(DSQN)的性能退化主要源于动作价值间共享的共模误差,这类误差会通过自举目标损害时序差分学习。为此提出的 CMC-DSQN 用辅助 ANN 补偿 SNN 输出的共模误差,推理时可直接从 SNN 输出做贪心动作选择并完全移除辅助 ANN,保持 SNN 能效。

  9. arXiv cs.LG36

    多轮 LLM 的答案侧后门攻击:模型自生成触发词绕过安全拒答

    研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。

  10. arXiv cs.LG22

    MITNN:数学不变量驱动的拓扑神经网络用于分子与材料性质预测

    研究者提出数学不变量驱动的拓扑神经网络(MITNNs),通过融合拓扑、谱理论、交换代数、微分几何与离散曲率的多尺度不变量,结合拓扑神经架构表示复杂三维结构。在蛋白质-配体结合、金属有机框架性质、突变诱导的蛋白质溶解度及分子毒性预测任务中,MITNN 持续优于现有方法,且特定数学表示与神经架构的配对组合优于单一模型及全部组件聚合。

  11. arXiv cs.LG22

    CASTLE:基于反事实语义-社会世界模型的独立多智能体强化学习

    CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。

  12. arXiv cs.LG22

    液压起重机原木堆清理:从点云学习抓取目标定位

    研究提出一种从无分割点云中学习抓取目标定位的策略,部署在拖车式液压林业起重机上,由同一网络支持行为克隆(BC)与强化学习(RL)。仿真中 BC 可清理 100 堆 200 根原木中的 98 堆,BC→RL 提升负载稳定性。12 次现场试验中,BC 与 BC→RL 分别完成 93.8% 和 88.9% 的库存堆放,高于几何启发式的 80.4%。

  13. arXiv cs.LG24

    SkillFormer:面向音频语言模型的技能分解适配方法

    SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。

  14. arXiv cs.LG31

    MobileVISTA:面向移动操作姿态泛化的生成式数据增强框架

    MobileVISTA 是一种数据生成框架,通过联合增强自我中心视觉观测并重定向动作以补偿基座姿态变化,将标准姿态下的演示转化为多样化的姿态扰动训练数据。该框架针对相机随运动链移动且机器人占据大部分画面的自我中心平台(如人形机器人),在仿真任务和真实 Galaxea R1 Pro 上验证,无需额外采集演示或训练生成模型即可提升策略对分布外姿态的鲁棒性,且在人形机器人上收益最大。

  15. arXiv cs.LG15

    虚拟现实平衡任务中,伪迹去除改善皮肤电波形却未提升下游分类

    一项 VR 平衡干扰任务研究发现,伪迹去除虽能改善皮肤电活动(EDA)波形,却无法提升下游分类性能。基于专家校正 EDA 训练的残差门控网络在基准集上中位 AUROC 达 0.94,伪迹区域误差降低 17.8%,但迁移到 VR 录制数据后,五种已发表时间序列方法的平衡准确率变化仅为 -1.35 至 +0.93 个百分点,无一提升且两种下降。

  16. arXiv cs.LG13

    Identity-Conditioned Score Fusion:面向开放集行人重识别的身份条件化分数融合

    研究者提出身份条件化分数融合框架,无需训练即可为每个底库身份定制融合权重,通过对比身份内一致性与跨身份冒充者提取身份专属画像,并与查询条件化自适应结合。在三个换装行人重识别基准上,该方法一致优于统计、排序和学习类基线,假未识别率最高绝对降低 8.8%。

  17. arXiv cs.LG17

    SICO:单循环恒定批量的一阶惩罚方法求解随机双层优化

    研究者提出随机单循环恒定批量一阶惩罚方法 SICO,用于求解随机非凸-强凸双层优化问题。该方法每次迭代仅需 O(1) 个随机梯度样本,在无偏有界方差假设下达到 O(ε⁻⁶) 样本复杂度,在额外均方光滑假设下提升至 O(ε⁻⁴)。这是首个以单循环和恒定批量匹配全一阶 SBO 方法已知最优收敛速率的工作。