跳到正文
10月7日周三
  1. arXiv cs.AI36

    COMPASS:在语言模型中定位推理发生的位置

    COMPASS 是一种推理时激活引导方法,利用模型自身直接作答的正确性信号构造潜在方向,并通过 logit 空间归因分数定位可有效干预的注意力头。在三个模型家族和多个数学基准上,它平均将 GSM8K 准确率提升 16 个百分点,并以少 20-70% 的生成 token 接近 CoT 准确率,干预无需重新拟合即可迁移到未见基准。

  2. arXiv cs.AI29

    关于 AI 智能体的可审计声明:arXiv 论文提出 Auditable Agents 框架

    arXiv 论文提出让 AI 智能体的声明变得可审计的方法:声明必须先明确其策略、范围、可据以判定的记录及记录撰写方,并在裁决前固定决策规则。该研究将 Auditable Agents 框架的 Policy Checkability 维度从单一动作扩展到声明,并针对智能体补充独立记录覆盖、动作参数授权绑定、超越完整性的完备性三项条件。

  3. arXiv cs.AI29

    MemCo:面向 LLM 智能体泛化到未见环境的记忆中心协作框架

    MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。

  4. arXiv cs.AI31

    评估 LLM 路由的升级信号:目标、对照与五种自欺方式

    研究测试语义熵作为 LLM 路由升级信号,在 GSM8K 上以约 12 倍规模差的小/大模型组合实现 AUROC 0.871,同等成本下路由准确率较随机升级最高提升 9 个百分点。作者指出合成基准上的亮眼结果实为假象:仅基于问题难度的无模型规则几乎完全匹配语义熵,并据此提出一套检查清单,涵盖难度对照、升级成功定义分歧、基准天花板及实时采样真实成本等陷阱。

  5. arXiv cs.AI22

    Trajectory-Retrieval Speculative Decoding:模型自身历史何时有用?

    研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。

  6. arXiv cs.AI24

    RGPO:用自适应理由脚手架让大模型学会推理

    研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。

  7. arXiv cs.AI19

    神经符号 AI 的规则语言综述:Datalog、答案集与概率逻辑程序

    一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。

  8. arXiv cs.AI24

    长期记忆智能体的检索可采性验证:RHELM 与 MemOps 基准上 Top-20 锚点召回率从 0.432 提升至 0.533

    研究者提出检索可采性验证框架,为每个记忆-查询对分配可采、不可采或未决三种状态,并在 RHELM 和 MemOps 两个公开长期记忆基准的 3,767 条查询上做 Top-20 事后重分析,锚点召回率从 0.432 升至 0.533,80% 召回可行性从 0.237 升至 0.311,精确相似度评估减少 98.3%。

  9. arXiv cs.AI24

    LLM 内部特征不等于模型机制:论文提出区分"引导"与"使用"的实证检验方法

    针对 LLM 内部特征常被当作模型机制的问题,研究者提出一套实证契约,在自然输入观测值上检验特征:通过 installation(将表现某行为的输入特征值复制到不表现的匹配输入)和 removal(反向操作)以及 downstream rescue(上游编辑后恢复特征)来区分特征是否被模型真正使用。

  10. arXiv cs.AI42

    NP-Bench 与调度规划器:验证并行编码智能体的协作

    研究者提出将并行编码智能体的协作问题重构为调度问题,通过预先划分工作范围并按生产者→消费者图排序合并,并构建了 NP-Bench 三臂基准(无协作、反应式检测、主动规划)进行验证。该规划器将干净集成率从 1/9 提升至 9/9,合并冲突从 13 降至 0,在实时破坏性契约变更中干净集成率从 0 升至前沿模型的 1.0、小模型的 0.6。跨会话记忆将重复错误率从 1.00 降至 0.00。

  11. arXiv cs.AI32

    MemMux:面向并行编码智能体集群的运行时验证与资源归属

    MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。

  12. arXiv cs.AI22

    语义几何能否教会 AI 判断?四项研究未获可靠行动前判断

    一项 arXiv 研究用向量表示动作与策略,测试几何测量能否让 AI 智能体在行动前识别约束规则,四项研究均未建立可靠的行动前判断。最终合成研究中,词法路由器找回了全部管辖与阻断策略、将策略检查中位数减少 97.7%,但组合流水线仍升级了全部 2,304 个测试动作,包括本应放行的动作。作者据此修正假设:AI 智能体的判断需要构建后果图,该假设尚待验证。

  13. arXiv cs.AI13

    能量条件化噪声调度与白化:面向频谱扩散模型的新方法

    该研究提出一种能量自适应噪声调度与白化策略,将全局频谱白化与能量条件化噪声分配结合,根据各变换系数的能量及图像相关的能量路径联合调制注入噪声,同时保持高斯转移与闭式边缘分布,兼容标准 DDPM 和 DDIM 流程。在 CIFAR-10 上,该方法将紧凑型 DCTdiff U-Net 变体的 FID 从 142.48 降至 100.45。

  14. arXiv cs.AI22

    基于阿克曼转向移动机器人的连续环境视觉语言导航 Sim-to-Real 迁移

    研究将连续环境下的视觉语言导航(VLN)方法从仿真迁移到真实世界,无需导航图或全景视图。系统采用 Cross-Modal Attention(CMA)架构,在仿真数据集上训练后,用自建阿克曼转向机器人(配备摄像头和 LiDAR)采集的真实数据微调,结合线性光度调整,在少量 episode 上即完成适配,并可在专用硬件上离线运行。SPL 和 nDTW 指标验证了方法的鲁棒性与适应性。

  15. arXiv cs.AI36

    把 AI 编程助手放进虚拟身体:三十小时运行中它开始"玩耍"了吗?

    研究者将一款现代 AI 编程助手置于未知数字岛屿上的虚拟身体中,仅给出不含具体任务、奖励或活动的极简指令,机器便开始驱动身体行动。在三十小时的运行中,该具身智能体爬山、把方块堆成塔、画曼陀罗、重新诠释运动项目,并对自己世界的物理规律做实验,还习得后来扩展其能力的技巧。

  16. arXiv cs.AI22

    边缘端智能数据模型分类的小语言模型:一种成本感知的混合方法

    研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。

  17. arXiv cs.AI24

    CuratorMAS:通过多智能体编排实现数据集自动策展

    CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。

  18. arXiv cs.AI24

    无需重训即可修正物理违规:Boltz-2 与 OpenFold-3 的推理时投影方法

    针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。

  19. arXiv cs.AI24

    MOTIVE:面向视觉语言模型的多视角自验证与可靠性引导重思考框架

    针对视觉语言模型自验证依赖单一标准或固定提示词、可靠性评估不完整的问题,研究者提出 MOTIVE 多视角自验证框架,通过正确性对齐的多视角验证学习为每个候选答案打分。推理时该分数决定直接采纳还是触发历史引导的重思考,在多种多模态基准和 VLM 主干上持续优于强自验证与自纠正基线,并减少不必要的推理轮次。

  20. arXiv cs.AI22

    TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架

    TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。