跳到正文
今天10月7日周三374 条
  1. arXiv cs.LG22

    贝叶斯优化中的直接遗憾优化(Direct Regret Optimization)

    研究者提出一种直接遗憾优化方法,通过从候选模型与采集函数集合中蒸馏,联合学习最优模型与非短视采集策略,显式以最小化多步遗憾为目标。该框架用不同超参数的 Gaussian Process 集成生成模拟 BO 轨迹,训练端到端 Decision Transformer 选择下一次查询,并以少量真实评估在线精调 GP。在合成与真实基准上,其最终简单遗憾达到最佳或接近最佳,高维场景增益最大。

  2. arXiv cs.LG17

    无需网络无混杂假设的网络干扰下因果效应估计

    针对网络干扰下因果效应估计依赖"网络无混杂假设"、而观测数据中潜在混杂因子常使该假设失效的问题,研究者提出一个混杂因子恢复框架,显式刻画仅影响个体、仅影响邻居、同时影响两者三类潜在混杂因子,并基于可识别表示学习设计网络效应估计器。理论证明了三类潜在混杂因子的可识别性,并据此建立网络效应的形式化识别结果,大量实验验证了理论发现与方法的有效性。该工作已被 IEEE TPAMI 接收。

  3. arXiv cs.LG22

    冻结的 VideoLLM 是否已编码证据就绪信号?Readiness Gating 提升回答时机准确率

    研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。

  4. arXiv cs.LG29

    Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线

    Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。

  5. arXiv cs.LG22

    DIPrune:面向高效多模态语言模型的双重要性任务感知 token 剪枝

    DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。

  6. arXiv cs.LG22

    预测精度不等于交易利润:神经进化小型循环网络用于股票收益预测

    研究对比线性、固定循环、Transformer 与混合架构和神经进化搜索出的循环网络,在四个中盘股组合、三个交易年度上评估预测精度与日度多空策略净收益。进化网络在预测精度和净交易表现上均排第一,而精度第二的模型在建仓并计入成本后亏损;其优势来自周期匹配,rank IC 从 1 日到 10 日评分周期上升,而所有超过 300 参数的模型均下降。

  7. arXiv cs.LG17

    共模误差限制低时间步深度脉冲Q网络,CMC-DSQN 提出补偿方案

    研究发现低时间步深度脉冲Q网络(DSQN)的性能退化主要源于动作价值间共享的共模误差,这类误差会通过自举目标损害时序差分学习。为此提出的 CMC-DSQN 用辅助 ANN 补偿 SNN 输出的共模误差,推理时可直接从 SNN 输出做贪心动作选择并完全移除辅助 ANN,保持 SNN 能效。

  8. arXiv cs.LG22

    CASTLE:基于反事实语义-社会世界模型的独立多智能体强化学习

    CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。

  9. arXiv cs.LG22

    语言能保留多少地点信息?零样本语言推理用于跨视角地理定位

    研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。

  10. arXiv cs.LG17

    交错投影梯度下降:面向安全模仿学习的神经网络控制策略

    研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。

  11. arXiv cs.LG26

    四旋翼飞行控制的统计湍流与高保真扰动场:风场保真度对 PPO 策略鲁棒性影响研究

    一项针对四旋翼飞行控制的研究对比了从无风、离散 1-cosine 阵风、统计湍流、合成相干结构到大气边界层大涡模拟场的五种扰动保真度,在全交叉训练-测试矩阵中评估 PPO 智能体,并以级联 PID 和几何 SE(3) 控制器作为免训练参照,风速扫描范围 0-12 m/s。

  12. arXiv cs.LG16

    精确滑动窗口约束下的线性 Bandit 问题研究

    研究精确滑动窗口约束下的线性 bandit:离线场景下凸性与循环平移不变性使平稳解在 w∣T 时最优,否则存在 O(w) 加性差距;在线场景仅靠几何结构不足以学习,甚至可能无法实现次线性 regret。作者引入转移直径 τ 与稀有切换 OFUL 算法,regret 为 Õ(d√T+τd+w),并在去除循环不变性后引入历史状态直径 D,取得 Õ(d√T+dD+w) 的 regret 界。

  13. arXiv cs.LG26

    高斯过程因果模型离散结果的反事实概率推断

    研究提出统一概率框架,将 GP 预测器与显式外生噪声机制配对,为二元、名义和有序离散结果分别推导精确的条件噪声反演方法,并证明其能复现拟合模型的观测与干预分布。在合成 SCM 上,对有序数据误用分类耦合会使反事实误差膨胀约三倍,且该误差不随数据量增加而下降。

  14. arXiv cs.LG12

    VOCEM:用联合效应建模实现方差最优的离策略评估

    针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。

  15. arXiv cs.LG17

    面向可靠选择性预测的结构感知图弃权方法

    研究提出结构感知图弃权方法,将实例级可信度与变量间关系一致性视为两条独立可靠性轴,通过可学习稀疏图和 Dirichlet 式结构能量 E_struct 实现后者,并用误差加权图正则化与分数-误差对齐训练。在七个长时程基准和四个骨干模型上,结构门控在相同覆盖率下常比 TEM 降低选择性 MSE,跨变量结构信息更丰富时增益最大,但增益并非普遍存在。

  16. arXiv cs.LG18

    线性函数逼近下基于分段奖励反馈的强化学习

    研究在线性函数逼近下用分段奖励反馈替代逐状态-动作奖励的强化学习。针对等长分段,作者提出 $\bitssegd$、$\edlinucbsegd$ 及统一 $\seglsvits$ 框架,并给出近匹配下界;二元反馈下增加分段数可指数级降低 regret,而求和反馈下分段粒度影响不大。允许任意分段的 $\uneqsegbitsd$ 表明等长分段性能最佳。

  17. arXiv cs.LG20

    Mu-DisCoCat:面向量子处理器组合泛化的变分流水线

    研究者提出 Mu-DisCoCat,一个面向 DisCoCat 的多模态变分量子学习框架,用于实现组合概念泛化(CoCoGen)。该框架先从单物体图文对学习稳定的物体表示,再固定这些表示学习多物体场景中的关系;经典模拟中使用 Uhlmann 态保真度计算多模态电路表示的重叠,关系 OOD 准确率高于所评估的 CLIP 基线。