Agentic AutoRAG:用推理驱动的智能体优化 RAG 流水线
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
Agentic AutoRAG 是一个面向多目标 RAG 超参数优化的 LLM 智能体优化器,可区分检索与生成阶段的失败归因。在三个多跳 QA 基准上,它的 LLM 评判准确率超过所有对比基线,并在前 10 次试验内追平或超越统计基线完整 30 次试验的准确率。在真实医疗语料库的成本感知模式下,它以约 58% 的单次查询成本达到 77% 的中位准确率,高于最强基线的 71.5%。
DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。
研究基于德国四大输电系统运营商2021至2024年的48242条再调度记录,在至少7天目标延迟约束下对比了季节性经验模型、ARX、分位数LightGBM、GRU和Transformer的概率预测精度。
针对持久图两样本检验只评估全局差异、不定位差异区域的问题,研究者提出在持久图数量固定时对局部均值对比做同步推断,用加性 landmark 响应估计对比,并以高斯乘子 bootstrap 校准同时置信区间,允许组间协方差不等。
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
研究在 IndicMT Eval 上把目标译文重新编码为拉丁字母后发现,文字系统身份可解释原生文字 COMET 分数方差的 22.9%,且五种语言与人工标注的一致性全部下降,问题根源在 tokeniser。
研究在统一 Frenet 框架运动学模型下对比了 NMPC、PPO、PID-SF 和 Stanley 四种路径跟踪控制器,并采用含显式再生制动的 VT-CPEM 能量模型评估电动车能耗。
现有针对 AI 智能体技能注入攻击的评估假设恶意技能已被选中执行,会高估攻击成功率;在真实多技能环境中,注入技能需先通过检索竞争,使现有注入的有效攻击成功率(ASR)下降 87-97%。
研究用可解释时序逻辑规则挖掘器分析 JAMES 双观测点抓包数据集,得到的可移植 Fragment-EH 规则经负对照协议检验后,被判定为包内近乎定义性的共现,而非跨包时序模式,时序逻辑机制对该主导规则不起作用。
一项 arXiv 预印研究用小型开源权重 LLM 读取双人咨询转录文本,跨域迁移预测专家整体印象,留一域迁移的嵌套 Spearman ρ 达 0.54,高于目标域内训练的 ≤0.48,配对差距 +0.15,训练集规模匹配后仍为 +0.12。
研究者提出 grappa-fullFF,一种从 ab initio 参考数据中一致且同时学习键合与非键合参数的统一方法,无需外部指定的非键合参数。该模型通过静电梯度监督引入物理正则化,并采用利于电荷平衡的架构,恢复了准确的电响应性质,在几何优化基准上达到 SOTA 精度,并复现了经典力场与现有机器学习力场的构象采样。
研究者构建了 H(div) 与 H(curl) 图空间的 de Rham 原生神经网络逼近类,二维、三维均适用,H(div) 情形可推广到任意维度,所有参数取值下的实现都落在对应空间内,且无需网格或有限元模拟。
研究对 RAVE 音频解码器激活做逐层与跨层聚类分析,发现合成音频的音高编码 |ρ|=0.45(为空值的 5.1 倍)、BPM 编码 |ρ|=0.76(8.6 倍);自然音频编码减弱但依然显著(平均 |ρ|=0.25,2.8 倍),非线性探针下平均 R²=0.56(18 倍)。
研究者提出 Pairwise Faithfulness Benchmark(PFaithBench),评估模型能否在支持性与非支持性上下文下对同一问题切换回答与弃答。
Learned AMDI 保留 AMDI 固定树传播器与层级约束,用 proximal policy optimization 训练的共享局部策略替换传播后选择器。在九个留出案例中,它执行 393 次细化,将平均终端参考差异从 0.17496 降至 0.13657,占用率从 0.13737 升至 0.26660。该共享 actor 无需重训练即可迁移到 64×64 和 128×128 图像。
Scen-Opt 是一个开源 Python 工具箱,将凸规划与数据样本结合,并提供基于场景理论的统计保证,支持数据驱动的线性、二次与半定规划。它提供基于 Python 的 Web 应用和图形界面,可在线使用或本地安装,支持 CSV、JSON、TXT、TSV、MAT、Excel、NPY、NPZ、Parquet 等文件上传。该工具在多个代表性基准上验证了其数据驱动凸优化的实际效果。
针对数字病理学中分层紧凑证据流程因候选过滤引入策略相关预测、导致评估参考偏移的问题,研究者提出 CHARTER 参考感知评估规范,要求声明预期目标与参考、量化候选引发的预测偏移并审计比较结论的稳定性。在五种子 Random-K 审计的 15 组比较中,4 组出现确定性反转;匹配的原生排序压力测试中,ACMIL 比较从 REVERSED 变为 PRESERVED。
研究对比线性、固定循环、Transformer 与混合架构和神经进化搜索出的循环网络,在四个中盘股组合、三个交易年度上评估预测精度与日度多空策略净收益。进化网络在预测精度和净交易表现上均排第一,而精度第二的模型在建仓并计入成本后亏损;其优势来自周期匹配,rank IC 从 1 日到 10 日评分周期上升,而所有超过 300 参数的模型均下降。
研究发现低时间步深度脉冲Q网络(DSQN)的性能退化主要源于动作价值间共享的共模误差,这类误差会通过自举目标损害时序差分学习。为此提出的 CMC-DSQN 用辅助 ANN 补偿 SNN 输出的共模误差,推理时可直接从 SNN 输出做贪心动作选择并完全移除辅助 ANN,保持 SNN 能效。
APEX 是一个学习型控制器,通过请求级专家选择与块级深度自适应来平衡推测解码的速度与草稿 token 浪费。APEX-Router 为每个请求在 EAGLE-3、n-gram 和草稿模型推测之间选择,APEX-Depth 则按验证块调整草稿长度。
研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。
RefRoute 通过紧凑残差条件与条件/注意力路由,降低多参考图像生成的参考 token 数量与注意力开销。在 ManyRef100 基准上,其 Weighted-Ref-VIEScore 达 36.06,FLUX.2-Klein-9B 为 8.88;16 个参考下,50 步与 4 步配置分别较对应 FLUX 基线提速 18.3 倍和 14.2 倍。
研究者提出数学不变量驱动的拓扑神经网络(MITNNs),通过融合拓扑、谱理论、交换代数、微分几何与离散曲率的多尺度不变量,结合拓扑神经架构表示复杂三维结构。在蛋白质-配体结合、金属有机框架性质、突变诱导的蛋白质溶解度及分子毒性预测任务中,MITNN 持续优于现有方法,且特定数学表示与神经架构的配对组合优于单一模型及全部组件聚合。
CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。
研究提出一种从无分割点云中学习抓取目标定位的策略,部署在拖车式液压林业起重机上,由同一网络支持行为克隆(BC)与强化学习(RL)。仿真中 BC 可清理 100 堆 200 根原木中的 98 堆,BC→RL 提升负载稳定性。12 次现场试验中,BC 与 BC→RL 分别完成 93.8% 和 88.9% 的库存堆放,高于几何启发式的 80.4%。
研究者提出一种无网格神经 JKO 格式,用于求解 Hellinger-Kantorovich 几何下具有梯度流结构的平流-反应-扩散方程,每次更新由空间映射与质量变化因子共同参数化,将空间重分布与局部质量增减纳入同一步变分。
GaugeBench 通过改写固定机械结构的物理等价约定(如关节轴方向、关节角零点和连杆命名顺序)来评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅剩 51.6,低于 98 个真正未见机器人的 1489.6。
BiGym 2.0 将 BiGym 适配到 Unitree G1,用统一全身控制器覆盖 20 项家务任务,并为每项任务提供 60 条人类 VR 演示,含同步多视角与全身执行记录。
REViT-v2 是一种基于窗口化群卷积自注意力和层级特征架构的可扩展旋转-反射群等变视觉 Transformer,可扩展至数百万参数规模并在 ImageNet 等大尺寸图像数据集上训练。该模型的代码与预训练权重已公开,相关论文被 NeurIPS NeurREPS workshop 2026 接收。
NASA 喷气推进实验室的 CETUS 研究对比了 DINOv2、DOFA、CROMA 与经典图像特征及未训练 ViT 在 USGS Cassini SAR 镶嵌图上的土卫六地形分类表现。
研究者提出 STAVE,用两个任务专属向量替代上下文示例,实现冻结大模型的任务适配。一个 readout 向量更新生成答案的 token,一个 context 向量更新其他结构 token 组,二者用带/不带示例的提示词答案标签训练。
SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。
MobileVISTA 是一种数据生成框架,通过联合增强自我中心视觉观测并重定向动作以补偿基座姿态变化,将标准姿态下的演示转化为多样化的姿态扰动训练数据。该框架针对相机随运动链移动且机器人占据大部分画面的自我中心平台(如人形机器人),在仿真任务和真实 Galaxea R1 Pro 上验证,无需额外采集演示或训练生成模型即可提升策略对分布外姿态的鲁棒性,且在人形机器人上收益最大。
研究提出双 IDS 框架,由量化 LSTM 的 QLSTM-IDS 与 8-bit 量化卷积自编码器的 QCAE-IDS 组成,分别检测已知与未知 CAN 总线攻击。
一项 VR 平衡干扰任务研究发现,伪迹去除虽能改善皮肤电活动(EDA)波形,却无法提升下游分类性能。基于专家校正 EDA 训练的残差门控网络在基准集上中位 AUROC 达 0.94,伪迹区域误差降低 17.8%,但迁移到 VR 录制数据后,五种已发表时间序列方法的平衡准确率变化仅为 -1.35 至 +0.93 个百分点,无一提升且两种下降。
AccentCL 是一个面向英语口音分类的类增量学习框架,基于冻结的 Whisper-Large-v3 编码器提取多层表示,结合不平衡感知交叉熵损失和域均值对齐损失,提升类别不平衡与跨语料域偏移下的鲁棒性。
研究者提出身份条件化分数融合框架,无需训练即可为每个底库身份定制融合权重,通过对比身份内一致性与跨身份冒充者提取身份专属画像,并与查询条件化自适应结合。在三个换装行人重识别基准上,该方法一致优于统计、排序和学习类基线,假未识别率最高绝对降低 8.8%。
研究评估行为与环境上下文能否为可解释的 IAM 策略风险优先级排序带来增量价值,使用包含 534 条真实 AWS 实验观测的 AWS IAM Context Bench 基准。
研究比较了量子测量 PAC 学习中纠缠测量学习规则与单副本学习规则的差异,构造出单副本学习规则渐近次优的学习场景。在自然联合可测性覆盖假设下,基于纠缠测量的学习规则相对单副本学习规则最多只有多项式级的样本复杂度优势。
研究者提出随机单循环恒定批量一阶惩罚方法 SICO,用于求解随机非凸-强凸双层优化问题。该方法每次迭代仅需 O(1) 个随机梯度样本,在无偏有界方差假设下达到 O(ε⁻⁶) 样本复杂度,在额外均方光滑假设下提升至 O(ε⁻⁴)。这是首个以单循环和恒定批量匹配全一阶 SBO 方法已知最优收敛速率的工作。