跳到正文
今天10月7日周三366 条
  1. arXiv cs.AI31

    E4:用受限 DSL 实现互联网级服务智能体根因分析

    针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。

  2. arXiv cs.AI29

    研究揭示 LLM 潜在空间偏见方向实际编码的是模型置信度而非公平性

    研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。

  3. arXiv cs.AI21

    DeltaTTT:面向非线性循环记忆的逐层优化方法

    针对非线性记忆网络在序列测试时训练中难以单遍优化、串行 TTT 反而不如固定基座并行 TTT 的问题,研究者提出 DeltaTTT,将两层记忆网络的联合内循环优化改为逐层学习,每层分配局部预测目标并通过状态相关的 delta 规则更新。该方法保留非线性读出并支持分块并行计算,在 DeltaNet 和 LaCT 骨干上提升了语言建模与检索表现。

  4. arXiv cs.AI13

    FlowCF:用流匹配为混合类型表格数据生成稀疏反事实解释

    FlowCF 是一种模型无关的生成式反事实解释方法,将反事实生成建模为从事实类到目标类的稀疏传输,并用流匹配求解,通过新型混合流算子扩展到混合特征类型。在六个基准数据集上,FlowCF 取得最佳数值稀疏性与接近度,仅改变 29% 的数值特征(最佳基线为 89%),位移小 70%。该工作已被 NeurIPS 2026 GDDL Workshop 接收。

  5. arXiv cs.AI20

    X-OPM:面向鲁棒性增强的可解释自动数字片上功耗建模

    X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。

  6. arXiv cs.AI29

    GeoPID:分解与引导视觉语言模型中的视觉信息

    研究者提出免训练框架 GeoPID,从几何视角将 VLM 中的多模态信息分解为冗余、模态独有和协同三类成分。在 22 个 VLM 和 14 个 benchmark 上的分析显示,需要视觉 grounding 的问题中正确预测具有更强的视觉独有成分。基于此,GeoPID 在推理时沿视觉独有子空间选择性放大视觉表征,无需更新模型参数即平均提升 7.63% 相对准确率。

  7. arXiv cs.AI22

    Foresight-over-Graph:面向知识库问答的远见感知证据检索框架

    针对 LLM 引导的图推理中逐跳贪心剪枝过于短视、易过早丢弃关键证据分支的问题,研究者提出远见感知证据检索框架 Foresight-over-Graph(FoG),通过远到近反馈引导路径探索并维护紧凑记忆子图。在常用 KBQA 基准上 FoG 达到 SOTA,CWQ 的 Hit 指标提升 16.58%,同时减少 LLM 调用与 token 消耗。代码已开源,论文被 NeurIPS 2026 接收。

  8. arXiv cs.AI17

    利用历史数据缓解自动驾驶远程操控 QoS 预测中的概念漂移

    针对自动驾驶远程操控的预测性 QoS(pQoS),研究者基于实测数据提出预测框架,预测上行数据速率与往返时延两项网络 KPI。该框架将历史数据纳入预测流程,以缓解概念漂移导致的机器学习模型在未见数据上的性能退化,并引入关键场景检测指标专门评估远程操控场景下的预测表现。

  9. arXiv cs.AI22

    DySCo:面向边缘-云协同 LLM 推理的动态分片与深度同步批处理

    DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。

  10. arXiv cs.AI29

    S1-MAS:用 System One 引导计算分工实现 token 高效多智能体协作

    研究者提出 S1-MAS 多智能体框架,将任务选择、角色分配、消息路由等有界协调决策交给轻量 System One 模型,把开放式推理留给能力更强的 LLM worker。在七个基准上与 AgentVerse、DyLAN、SelfOrg 对比,S1-MAS 将 GPT-4o token 消耗降低 44.9%-97.2%,端到端延迟降低 37.8%-93.0%,同时取得更高准确率。

  11. arXiv cs.AI62

    论文指出 Lean 验证 AI 自动形式化无法保证自然语言证明正确

    arXiv 论文指出,AI 自动形式化把自然语言数学文本翻译成 Lean 后,机械验证通过并不能保证原自然语言论证正确。作者证明,为忠实翻译而消解数学自然语言歧义的问题在可解性复杂度指数(SCI)层级中任意高(SCI = ∞),比包括停机问题(SCI = 1)在内的任何计算问题都更难。

    推荐理由:论文用可计算性层级论证自然语言数学文本的忠实翻译不可判定,并给出 Lean 形式化与原文不符的实例。

  12. arXiv cs.AI24

    基于查询的可达自车未来代价学习:超越端到端驾驶的航点回归

    研究者提出一种基于查询的代价学习框架,为动态可达的自车轨迹查询估计有界代价,而非密集 BEV 网格或少量回归轨迹。在 nuScenes 上,该方法碰撞率优于 ST-P3、NMP 及多数回归基线,L2 保持竞争力;在真实驾驶日志上无需微调即比 SparseDrive 和 Alpamayo 降低碰撞率。该工作已被 ACCV 2026 接收。

  13. arXiv cs.AI37

    VisionWeave:让弹性视觉表征成为 MLLM 的原生能力

    VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。

  14. arXiv cs.AI22

    ReGraph:双视觉通路中涌现泛化能力的计算解释

    研究者提出 ReGraph——一种带生物归纳偏置的循环双流图模型,包含视网膜驱动的分流编码、背侧到腹侧调制和动态侧向连接,在 Something-Something V2 动作基准上训练。结果显示,上下文不变编码与网格样空间基仅沿扩展背侧通路共同涌现,单流、无调制变体和标准基线中均不出现。事后分析表明这些网格样基可作为可复用的路由模板,提示泛化能力在感觉信息被分解为层级化分流时便已成形。

  15. arXiv cs.AI22

    《The Geometry of Empowerment》论文:将 empowerment 最大化与技能学习关联,给出新的几何解释

    一篇 arXiv 论文将 empowerment 最大化与技能学习(skill-learning)方法关联,为解释和分析 empowerment 提供了新的几何框架。该分析回答了 empowerment 与结构中心性之间关系的长期开放问题,并揭示了信息几何与奖励几何之间的区别,为构建可扩展的 empowerment 最大化方法提供了理论启示。论文共 34 页、12 张图,网站与代码已公开。

  16. arXiv cs.AI17

    CLARER:面向可解释推荐的对比学习方面表示模型

    CLARER 模型通过对比学习与 Transformer 编码器学习评论文本中的方面特征,并结合 MLP 学习的评分特征生成用户和物品表示,再用 Transformer 解码器生成推荐解释。在三个基准数据集上,该模型在推荐准确性和解释生成方面均优于基线方法,相关论文获 WI-IAT 2025 最佳学生论文奖。

  17. arXiv cs.AI22

    为世界模型潜在空间建模扰动,实现鲁棒决策

    研究者提出将潜在空间扰动建模为对世界模型所学潜在动力学的扰动,通过动力学感知相似度度量与分布外检测构建合理潜在动力学集合,并用共形预测校准不确定性集,再以博弈论优化联合求解鲁棒动作与最坏情况扰动。在 Franka 机械臂硬件实验中,该方法使安全过滤失败率降低 70%、基于采样的策略引导失败率降低 54%。

  18. arXiv cs.AI15

    基础模型辅助的多智能体强化学习用于无线随机接入网络优化

    研究提出用基础模型(FM)提升多智能体强化学习(MARL)在无线随机接入(RA)网络优化中的效率,设计了基于共识的去中心化 MARL 架构下的 FM 辅助 actor-critic 算法。收敛性分析表明,该算法在局部奖励交换与非线性价值函数近似下,达到与传统 MARL 相同的收敛阶数。数值结果显示该方法显著提升了 RA 网络优化的 MARL 速度。

  19. arXiv cs.AI24

    AlignQuant:面向高效 LLM 生成的 Tile 对齐混合精度量化

    AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。