跳到正文
今天10月7日周三563 条
  1. arXiv cs.AI26

    BluffJAX:JAX 中的对抗性不完美信息博弈开源套件

    BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。

  2. arXiv cs.AI18

    LSC-DPO:学习信号受控的直接偏好优化

    研究提出 LSC-DPO,从损失几何视角将 DPO 损失中的 sigmoid 因子视为刻画目标局部敏感度的学习信号,并动态将其调节至目标区间。在 AlpacaEval 2、MT-Bench 和 Anthropic-HH 上,LSC-DPO 持续优于 DPO 及强偏好优化基线。研究还发现不同系数初始化会产生不同的瞬态学习信号轨迹,据此推导出信号预算补偿规则,显著降低跨初始化的性能波动。

  3. arXiv cs.AI22

    个人智能体中介推荐:跨平台用户历史如何平衡平台排序的救援与误改

    研究提出"个人智能体中介推荐"范式:平台推荐器用本地信息排序候选集,个人 LLM 智能体借助用户授权的跨平台历史对排序进行中介,生成最终 top-K 列表。为此推出 MediateRec 基准,并给出 Personal Attribution Mediation Optimization(PAMO)训练方法,通过反事实遮蔽跨平台历史来估计个人中介支持度。

  4. arXiv cs.AI19

    交错参与下的多智能体强化学习:SPL 训练增强方法

    研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。

  5. arXiv cs.AI22

    RouteFlow:在合成路线隐空间中导航以实现可合成分子设计

    RouteFlow 将可合成分子设计重构为在连续合成路线隐空间中的搜索,每个隐向量可映射回完整合成路线,从本质上保证可合成性。该框架采用奖励引导的流匹配作为采样器,并引入循环一致性机制稳定微调,防止优化偏离真实合成路线流形。在 Therapeutic Data Commons 的 16 项优化任务中,RouteFlow 在可合成性感知基线中取得最佳样本效率、最高合成可及性与最高逆合成成功率。

  6. arXiv cs.AI22

    GroundAct:面向自动驾驶物理智能的 grounded planning 新框架

    研究团队提出 GroundAct,将物理实体作为 grounding 单元,用轻量 reference token 保持每个被选实体的连续状态可被符号推理寻址,仅由被引用实体与演化方案的交互来修正规划,形成从推理依据到规划动作的显式路径。GroundAct 在开环与闭环评测中均表现良好,覆盖正常、分布外与安全关键场景,闭环结果进一步验证了仿真驾驶能力。

  7. arXiv cs.AI23

    不同 LLM 如何影响信息 elicitation 智能体的开放式信息搜寻行为

    研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。

  8. arXiv cs.AI29

    MemCo:面向 LLM 智能体泛化到未见环境的记忆中心协作框架

    MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。

  9. arXiv cs.AI24

    RGPO:用自适应理由脚手架让大模型学会推理

    研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。

  10. arXiv cs.AI19

    神经符号 AI 的规则语言综述:Datalog、答案集与概率逻辑程序

    一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。

  11. arXiv cs.AI22

    边缘端智能数据模型分类的小语言模型:一种成本感知的混合方法

    研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。

  12. arXiv cs.AI24

    CuratorMAS:通过多智能体编排实现数据集自动策展

    CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。

  13. arXiv cs.AI24

    无需重训即可修正物理违规:Boltz-2 与 OpenFold-3 的推理时投影方法

    针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。

  14. arXiv cs.AI31

    SAGA:通过知识抽象实现 LLM 智能体自我进化

    针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。

  15. arXiv cs.AI36

    GameGo:用真实资产锚定的合成轨迹训练游戏开发智能体

    研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。

  16. 量子位85

    OpenAI 公开 722 篇数学手稿,覆盖准黎曼猜想与 BSD 等难题

    OpenAI 公开 722 篇数学手稿,归为 372 组结果,出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。内容涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等,模型此前尝试约 4000 个研究问题,平均每项结果算力约相当于 ChatGPT Pro 思考 3 小时。

    推荐理由:OpenAI 一次性公开 722 篇数学手稿,读者可了解其覆盖范围与数学界对核验进度的保留态度。

  17. Hacker News38

    State of Devs 2026 开发者调查:近半受访者对 AI 持负面态度,62% 经历过职业倦怠

    Devographics 的 State of Devs 2026 调查(5,463 名开发者)显示,49% 受访者对 AI 持正面态度、42% 持负面态度,近一半认为 AI 未对自身心理状态产生积极影响。62% 开发者称职业生涯中经历过倦怠,与去年持平;近半数受访者遭遇过工作不安全感与薪资不足,约四分之一曾被裁员。

  18. The Verge · AI74

    OpenAI 发布 722 篇手稿,称未公开前沿模型解决数百个数学开放问题

    OpenAI 以 722 篇手稿的形式公开了一批数学问题解答,覆盖 372 个结果族,据 AGMAI 称其中包含对“数百个”开放问题的解答。这些结果由一个未发布的前沿模型产出,OpenAI 称“平均结果”相当于 ChatGPT Pro 思考三小时,并同时公布了部分推理摘要、算力估算和尝试问题数量等细节。