跳到正文
今天10月7日周三547 条
  1. arXiv cs.AI22

    RouteFlow:在合成路线隐空间中导航以实现可合成分子设计

    RouteFlow 将可合成分子设计重构为在连续合成路线隐空间中的搜索,每个隐向量可映射回完整合成路线,从本质上保证可合成性。该框架采用奖励引导的流匹配作为采样器,并引入循环一致性机制稳定微调,防止优化偏离真实合成路线流形。在 Therapeutic Data Commons 的 16 项优化任务中,RouteFlow 在可合成性感知基线中取得最佳样本效率、最高合成可及性与最高逆合成成功率。

  2. arXiv cs.AI22

    GroundAct:面向自动驾驶物理智能的 grounded planning 新框架

    研究团队提出 GroundAct,将物理实体作为 grounding 单元,用轻量 reference token 保持每个被选实体的连续状态可被符号推理寻址,仅由被引用实体与演化方案的交互来修正规划,形成从推理依据到规划动作的显式路径。GroundAct 在开环与闭环评测中均表现良好,覆盖正常、分布外与安全关键场景,闭环结果进一步验证了仿真驾驶能力。

  3. arXiv cs.AI23

    不同 LLM 如何影响信息 elicitation 智能体的开放式信息搜寻行为

    研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。

  4. arXiv cs.AI29

    MemCo:面向 LLM 智能体泛化到未见环境的记忆中心协作框架

    MemCo 是一个记忆中心协作框架,通过维护互补的局部与全局记忆空间,让 LLM 智能体泛化到未见交互环境。它按智能体当前状态和决策阶段路由局部与全局记忆,避免盲目迁移环境特定细节。在交互决策基准上,MemCo 相比孤立记忆和共享记忆基线提升了任务成功率并减少冗余探索。

  5. arXiv cs.AI24

    RGPO:用自适应理由脚手架让大模型学会推理

    研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,将其作为临时脚手架,仅把更高奖励的模型自生成解回传到原始无引导设置。在纯语言与视觉语言推理任务上,RGPO 均持续优于 RLVR 基线,消融实验显示自适应理由引导是性能提升的关键。该工作已被 NeurIPS 2026 接收。

  6. arXiv cs.AI19

    神经符号 AI 的规则语言综述:Datalog、答案集与概率逻辑程序

    一篇综述系统梳理了神经符号 AI 中用作符号组件的三类规则语言——Datalog、答案集程序与概率逻辑程序,并沿语义、表达能力、神经集成和求值机制四个维度展开对比。作者分析了 50 余个近期系统与应用,覆盖数据库与编程语言、机器学习、视觉和机器人四个研究领域,并给出将应用场景映射到所需特性的决策矩阵,最后列出开放问题。该文将收录于 RuleML+RR 2026 会议论文集。

  7. arXiv cs.AI22

    边缘端智能数据模型分类的小语言模型:一种成本感知的混合方法

    研究评估轻量级开源语言模型在资源受限的边缘环境下,将输入数据实体匹配到最合适的智能数据模型(SDM)的表现,系统基准测试了通用、推理专用和代码专用三类架构在多个领域数据集上的效果。实验还将所调研的大语言模型与 TF-IDF 和轻量级句子编码器两种近零成本相似度基线在同一任务上对比,为判断 LLM 分类在边缘平台的实际价值提供参考。

  8. arXiv cs.AI24

    CuratorMAS:通过多智能体编排实现数据集自动策展

    CuratorMAS 是一个多智能体协作框架,将数据集策展拆解为五个可编程执行阶段并组成可并行工作流,通过数据集探索、在线领域知识检索、评估标准推导与指标计算、过滤及技能进化模块完成自动策展。实验显示,该框架将噪声率最多降低 36.03 个百分点,下游模型 F1 分数最多提升 8.88 个百分点。

  9. arXiv cs.AI24

    无需重训即可修正物理违规:Boltz-2 与 OpenFold-3 的推理时投影方法

    针对 AlphaFold 3 类共折叠模型输出中链间原子重叠、配体键长键角失真、环不共面及手性反转等物理违规问题,研究者提出两种闭式投影算子,直接作用于扩散模型去噪后的干净坐标估计 x̂₀:链间范德华投影推开冲突最严重的原子对,配体距离几何投影恢复键长、键角、内部接触、共面性与手性。

  10. arXiv cs.AI31

    SAGA:通过知识抽象实现 LLM 智能体自我进化

    针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。

  11. arXiv cs.AI36

    GameGo:用真实资产锚定的合成轨迹训练游戏开发智能体

    研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。

  12. AWS Machine Learning Blog22

    Amazon SageMaker HyperPod 管理与治理最佳实践

    Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 连接项目后,团队可在项目工作区启动训练与微调工作负载,同时由基础设施团队继续通过 SageMaker AI 接口和 API 管理集群。文章提出组织、项目、集群、工作负载四层控制模型,并说明如何跨层设计身份、容量与可观测性策略,在共享加速器算力时保留底层治理控制。

10月6日周二
10月5日周一
  1. NVIDIA Blog22

    NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口

    NVIDIA Inception 计划中的多家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 FDA 获批 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 FDA 获批 WRDensity 已用于数十万患者,并研发可自动筛除阴性乳腺钼靶的新一代 AI。

  2. arXiv cs.LG24

    自适应批处理为何有助于 LLM 预训练?无界方差视角下的解释

    研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。

  3. arXiv stat.ML26

    DAWIS:基于多任务插值的窗口逆采样数据同化方法

    研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。

  4. arXiv cs.CL15

    HakemBench:土耳其语类型化决策基准发布

    HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。

  5. arXiv cs.CV22

    MapMergeLLM:用大语言模型实现矢量化地图聚合

    MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。

  6. arXiv cs.CL22

    面向大语言模型多任务后训练的自适应互蒸馏框架 AMD

    研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。

  7. arXiv stat.ML12

    不完备线性自编码器中的尺度对称性破缺

    研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。

  8. arXiv cs.CL22

    FOVEATED:用聚焦视图提升非结构化知识编辑中的原子事实召回

    针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。

  9. arXiv cs.CV24

    SCOPE-4D:内窥镜 4D 几何基础模型

    SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。

  10. arXiv cs.LG22

    SF-MOPD:慢-快多教师在线策略蒸馏如何缓解能力干扰

    研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。