贝叶斯优化中的直接遗憾优化(Direct Regret Optimization)
研究者提出一种直接遗憾优化方法,通过从候选模型与采集函数集合中蒸馏,联合学习最优模型与非短视采集策略,显式以最小化多步遗憾为目标。该框架用不同超参数的 Gaussian Process 集成生成模拟 BO 轨迹,训练端到端 Decision Transformer 选择下一次查询,并以少量真实评估在线精调 GP。在合成与真实基准上,其最终简单遗憾达到最佳或接近最佳,高维场景增益最大。
研究者提出一种直接遗憾优化方法,通过从候选模型与采集函数集合中蒸馏,联合学习最优模型与非短视采集策略,显式以最小化多步遗憾为目标。该框架用不同超参数的 Gaussian Process 集成生成模拟 BO 轨迹,训练端到端 Decision Transformer 选择下一次查询,并以少量真实评估在线精调 GP。在合成与真实基准上,其最终简单遗憾达到最佳或接近最佳,高维场景增益最大。
针对网络干扰下因果效应估计依赖"网络无混杂假设"、而观测数据中潜在混杂因子常使该假设失效的问题,研究者提出一个混杂因子恢复框架,显式刻画仅影响个体、仅影响邻居、同时影响两者三类潜在混杂因子,并基于可识别表示学习设计网络效应估计器。理论证明了三类潜在混杂因子的可识别性,并据此建立网络效应的形式化识别结果,大量实验验证了理论发现与方法的有效性。该工作已被 IEEE TPAMI 接收。
该研究针对 GSAM 算法,在采用递增批量大小或余弦退火、线性衰减等学习率策略时从理论上证明了其收敛性。数值实验表明,使用递增批量大小相比固定批量大小和学习率,能达到更低的最坏情况 ℓ∞ 自适应锐度。
研究者提出 TURS(Truly Unordered Rule Sets)概率规则集模型,通过仅允许概率输出相近的规则重叠来化解冲突,并基于 MDL 原则形式化学习问题、设计了启发式算法。基准测试显示,该方法学到的规则集模型复杂度更低,预测性能具竞争力,且规则间经验上"独立",实现真正无序。该工作已被 JMLR 接收。
QF3 是一种在线 off-policy 强化学习算法,通过流匹配加 critic 动作梯度训练流策略,梯度经流输出的一步预测反向传播,并只对接近回放动作的维度施加 critic 梯度。
研究者为具有空间变化抗扩散系数的 Kuramoto–Sivashinsky 方程提出首个反馈镇定设计,通过引入第二个边界输入并借助 Heymann 引理分配不同角色,克服了 Coron 与 Lü(2015)单输入 Fredholm 设计在重复不稳定特征值处的可控性失效。
研究者提出层级连续扩散语言模型 H-CDLM,通过并行扩散 token 及其聚类得到的粗粒度语义表示,以极小的算力与参数开销提升连续扩散语言模型。应用于 CoBit 得到 H-CoBit,在 LM1B 上生成困惑度 49.4、OWT 上 50.4,较基线分别改善 24.2 和 20.7 点,GSM8K 准确率达 27.4%。该框架同样适用于流匹配模型 FLM,代码将公开。
语言模型微调时看似遗忘的知识往往仍被存储且可恢复,这种现象被称为伪遗忘。研究通过一个最小联想记忆模型复现了该动态:共享结构的键、集中的新值和网络归一化三者共同作用,微调将所有旧表示沿同一方向移动,暂时隐藏旧事实但保留其相对几何结构;归一化在新事实学会后撤回这一偏移,而事实特异性变化则持续累积并导致侵蚀。
研究提出路径-流对齐作为 flow matching 的统一训练目标,联合训练保端点的路径网络与流网络,使流匹配路径速度、路径对齐当前流。作者发现路径过拟合:对齐损失下降但样本质量变差,与概率路径中的低熵瓶颈有关。为此引入随机路径正则化器,隐藏部分源信息并保持端点精确,在 ImageNet-256x256 与 SiT 骨干上跨模型规模持续改善 FID。
研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。
研究发现多模态几何对齐分数对模态退化的响应并非由扰动幅度主导,位移幅度最多只能解释15%的样本外方差。基于Gram行列式的闭式一阶展开,作者提出方向性几何响应(DGR),在MSR-VTT(N=878)和DiDeMo(N=980)上取得0.838-0.969的样本外R²和0.864-0.963的匹配幅度排序准确率。DGR依赖已观测的退化状态位移,属于解释性量而非部署时预测器。
研究者提出 UNREAL,一种模型原生的证据选择框架,从冻结 LLM 的内部表示直接编码 chunk 并生成检索 query,仅新增不到 500K 可训练参数且不改动主干。
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。
研究基于德国四大输电系统运营商2021至2024年的48242条再调度记录,在至少7天目标延迟约束下对比了季节性经验模型、ARX、分位数LightGBM、GRU和Transformer的概率预测精度。
针对持久图两样本检验只评估全局差异、不定位差异区域的问题,研究者提出在持久图数量固定时对局部均值对比做同步推断,用加性 landmark 响应估计对比,并以高斯乘子 bootstrap 校准同时置信区间,允许组间协方差不等。
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
研究在 IndicMT Eval 上把目标译文重新编码为拉丁字母后发现,文字系统身份可解释原生文字 COMET 分数方差的 22.9%,且五种语言与人工标注的一致性全部下降,问题根源在 tokeniser。
研究在统一 Frenet 框架运动学模型下对比了 NMPC、PPO、PID-SF 和 Stanley 四种路径跟踪控制器,并采用含显式再生制动的 VT-CPEM 能量模型评估电动车能耗。
现有针对 AI 智能体技能注入攻击的评估假设恶意技能已被选中执行,会高估攻击成功率;在真实多技能环境中,注入技能需先通过检索竞争,使现有注入的有效攻击成功率(ASR)下降 87-97%。
研究用可解释时序逻辑规则挖掘器分析 JAMES 双观测点抓包数据集,得到的可移植 Fragment-EH 规则经负对照协议检验后,被判定为包内近乎定义性的共现,而非跨包时序模式,时序逻辑机制对该主导规则不起作用。
一项 arXiv 预印研究用小型开源权重 LLM 读取双人咨询转录文本,跨域迁移预测专家整体印象,留一域迁移的嵌套 Spearman ρ 达 0.54,高于目标域内训练的 ≤0.48,配对差距 +0.15,训练集规模匹配后仍为 +0.12。
研究者提出 grappa-fullFF,一种从 ab initio 参考数据中一致且同时学习键合与非键合参数的统一方法,无需外部指定的非键合参数。该模型通过静电梯度监督引入物理正则化,并采用利于电荷平衡的架构,恢复了准确的电响应性质,在几何优化基准上达到 SOTA 精度,并复现了经典力场与现有机器学习力场的构象采样。
研究者构建了 H(div) 与 H(curl) 图空间的 de Rham 原生神经网络逼近类,二维、三维均适用,H(div) 情形可推广到任意维度,所有参数取值下的实现都落在对应空间内,且无需网格或有限元模拟。
研究对 RAVE 音频解码器激活做逐层与跨层聚类分析,发现合成音频的音高编码 |ρ|=0.45(为空值的 5.1 倍)、BPM 编码 |ρ|=0.76(8.6 倍);自然音频编码减弱但依然显著(平均 |ρ|=0.25,2.8 倍),非线性探针下平均 R²=0.56(18 倍)。
研究者提出 Pairwise Faithfulness Benchmark(PFaithBench),评估模型能否在支持性与非支持性上下文下对同一问题切换回答与弃答。
Learned AMDI 保留 AMDI 固定树传播器与层级约束,用 proximal policy optimization 训练的共享局部策略替换传播后选择器。在九个留出案例中,它执行 393 次细化,将平均终端参考差异从 0.17496 降至 0.13657,占用率从 0.13737 升至 0.26660。该共享 actor 无需重训练即可迁移到 64×64 和 128×128 图像。
Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。
针对数字病理学中分层紧凑证据流程因候选过滤引入策略相关预测、导致评估参考偏移的问题,研究者提出 CHARTER 参考感知评估规范,要求声明预期目标与参考、量化候选引发的预测偏移并审计比较结论的稳定性。在五种子 Random-K 审计的 15 组比较中,4 组出现确定性反转;匹配的原生排序压力测试中,ACMIL 比较从 REVERSED 变为 PRESERVED。
研究对比线性、固定循环、Transformer 与混合架构和神经进化搜索出的循环网络,在四个中盘股组合、三个交易年度上评估预测精度与日度多空策略净收益。进化网络在预测精度和净交易表现上均排第一,而精度第二的模型在建仓并计入成本后亏损;其优势来自周期匹配,rank IC 从 1 日到 10 日评分周期上升,而所有超过 300 参数的模型均下降。
研究发现低时间步深度脉冲Q网络(DSQN)的性能退化主要源于动作价值间共享的共模误差,这类误差会通过自举目标损害时序差分学习。为此提出的 CMC-DSQN 用辅助 ANN 补偿 SNN 输出的共模误差,推理时可直接从 SNN 输出做贪心动作选择并完全移除辅助 ANN,保持 SNN 能效。
APEX 是一个学习型控制器,通过请求级专家选择与块级深度自适应来平衡推测解码的速度与草稿 token 浪费。APEX-Router 为每个请求在 EAGLE-3、n-gram 和草稿模型推测之间选择,APEX-Depth 则按验证块调整草稿长度。
研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。
RefRoute 通过紧凑残差条件与条件/注意力路由,降低多参考图像生成的参考 token 数量与注意力开销。在 ManyRef100 基准上,其 Weighted-Ref-VIEScore 达 36.06,FLUX.2-Klein-9B 为 8.88;16 个参考下,50 步与 4 步配置分别较对应 FLUX 基线提速 18.3 倍和 14.2 倍。
研究者提出数学不变量驱动的拓扑神经网络(MITNNs),通过融合拓扑、谱理论、交换代数、微分几何与离散曲率的多尺度不变量,结合拓扑神经架构表示复杂三维结构。在蛋白质-配体结合、金属有机框架性质、突变诱导的蛋白质溶解度及分子毒性预测任务中,MITNN 持续优于现有方法,且特定数学表示与神经架构的配对组合优于单一模型及全部组件聚合。
CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。
研究提出一种从无分割点云中学习抓取目标定位的策略,部署在拖车式液压林业起重机上,由同一网络支持行为克隆(BC)与强化学习(RL)。仿真中 BC 可清理 100 堆 200 根原木中的 98 堆,BC→RL 提升负载稳定性。12 次现场试验中,BC 与 BC→RL 分别完成 93.8% 和 88.9% 的库存堆放,高于几何启发式的 80.4%。
研究者提出一种无网格神经 JKO 格式,用于求解 Hellinger-Kantorovich 几何下具有梯度流结构的平流-反应-扩散方程,每次更新由空间映射与质量变化因子共同参数化,将空间重分布与局部质量增减纳入同一步变分。
GaugeBench 通过改写固定机械结构的物理等价约定(如关节轴方向、关节角零点和连杆命名顺序)来评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅剩 51.6,低于 98 个真正未见机器人的 1489.6。
BiGym 2.0 将 BiGym 适配到 Unitree G1,用统一全身控制器覆盖 20 项家务任务,并为每项任务提供 60 条人类 VR 演示,含同步多视角与全身执行记录。