跳到正文
今天10月7日周三374 条
  1. arXiv cs.AI22

    Trajectory-Retrieval Speculative Decoding:模型自身历史何时有用?

    研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。

  2. arXiv cs.AI24

    RGPO:用自适应理由脚手架让大模型学会推理

    研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。

  3. arXiv cs.AI19

    神经符号 AI 的规则语言综述:Datalog、答案集与概率逻辑程序

    一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。

  4. arXiv cs.AI24

    LLM 内部特征不等于模型机制:论文提出区分"引导"与"使用"的实证检验方法

    针对 LLM 内部特征常被当作模型机制的问题,研究者提出一套实证契约,在自然输入观测值上检验特征:通过 installation(将表现某行为的输入特征值复制到不表现的匹配输入)和 removal(反向操作)以及 downstream rescue(上游编辑后恢复特征)来区分特征是否被模型真正使用。

  5. arXiv cs.AI24

    无需重训即可修正物理违规:Boltz-2 与 OpenFold-3 的推理时投影方法

    针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。

  6. arXiv cs.AI24

    MOTIVE:面向视觉语言模型的多视角自验证与可靠性引导重思考框架

    针对视觉语言模型自验证依赖单一标准或固定提示词、可靠性评估不完整的问题,研究者提出 MOTIVE 多视角自验证框架,通过正确性对齐的多视角验证学习为每个候选答案打分。推理时该分数决定直接采纳还是触发历史引导的重思考,在多种多模态基准和 VLM 主干上持续优于强自验证与自纠正基线,并减少不必要的推理轮次。

  7. arXiv cs.AI22

    TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架

    TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。

  8. arXiv cs.AI22

    视觉 Transformer 如何通过转喻回路为抽象概念奠基

    研究揭示 Vision Transformer 通过"转喻式奠基"机制识别抽象概念:在 CLIP 和 DINO 视觉编码器上应用 Transcoders 后发现,抽象预测由"火"等具体可解释的锚概念驱动,感知原语主导浅层、类物体锚点先于抽象目标出现,含渲染文字的图像则走独立的感知到文本路径。因果干预实验验证这些转喻中间特征确实参与抽象概念奠基。该成果发表于 EMNLP 2026 主会。

10月6日周二
  1. 掘金22

    ReAct Agent 思维范式解析:推理与行动如何驱动 AI 智能体

    ReAct 智能体是一种将思维链(CoT)推理与外部工具调用相结合的 AI 智能体框架,通过"思考、行动、观察"循环交替运行,让大语言模型动态调整任务处理方案。该框架最早在 ReAct 原始论文中提出,可减少模型幻觉并提升输出准确性,其效果高度依赖核心大语言模型的推理与指令遵循能力。

  2. 量子位66

    陶哲轩在SAIR演讲中呼吁AI公司放慢数学研究节奏

    陶哲轩在SAIR最新演讲中公开喊话模型公司,认为AI无休止加速却对后果一无所知,必须慢下来。他提出Proof Indigestion(证明消化不良)概念,指出AI只在生成解答和Lean形式化验证两步加速,理解、同行评审和写入教科书三步几乎停滞,并担心数学家创造力丧失与AI生成证明污染下一代训练数据。

  3. Hacker News26

    AI 时代数学的未来:Jeremy Avigad 谈数学研究如何转向

    数学家 Jeremy Avigad 在 Convergent Research 支持的科技创新创业会议上指出,AI 已能轻松生成一年前足以发表的研究成果,数学界日常解题工作正被颠覆。他认为数学作为严谨推理与交流的文化不会消失,出路在于借助 AI 攻克更难的问题、提出更大的构想,而非纠结是否还需要数学。

  4. TechCrunch · AI71

    Reflection 发布开源权重模型 Beam,对标中国开源模型

    Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,且推理算力消耗少 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。Reflection 称本月将公开 Beam 的权重和完整技术细节,并通过超大规模云厂商和新云分发。

  5. Hacker News72

    Reflection 发布 501B 开源权重模型 Beam

    Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数 501B、激活 23B,面向编码、推理和智能体任务。该模型在 23.8 万亿 token 上预训练,并用 10.5K 张 NVIDIA GB300 GPU 进行四周高算力 RL,生成超 1 亿次 rollout。官方称其推理效率优于同规模模型,权重将于本月以 Apache 2.0 协议发布。

10月5日周一
  1. arXiv stat.ML22

    ENCORE:用副本交换实现扩散生成精确非平衡控制

    研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。

  2. arXiv cs.AI24

    用程序精化与 LLM 智能体发现认知算法

    研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。

  3. arXiv cs.CL18

    大语言模型在时间抽取任务中的多维泛化能力评估

    研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。

  4. arXiv cs.CL32

    语言智能体为何无法将历史转化为经验:动作校准研究

    语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。

  5. arXiv cs.LG29

    ReRoute:无需受控实验,用部分机制知识实现科学仿真器反事实预测

    研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。

  6. arXiv cs.CL24

    EpiWorld:将 LLM 政策智能体锚定在流行病学世界模型中

    EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。