跳到正文
10月5日周一
  1. 掘金17

    机器人越来越多以后,谁来把它们组织起来?

    当工厂里机器人从几十台增至几百台,生产能力并不会自动翻倍,核心问题从"单台机器人能做什么"变成"如何把分散能力组织成整体"。文章提出AI负责理解与判断、系统负责组织与调度、机器人负责落地执行,三者连接才构成完整的机器生产能力,系统让机器人围绕同一生产目标形成可运行的整体。

  2. 掘金62

    Agentic RAG 三种架构对比:检索自纠错、CRAG 与 Self-RAG

    文章对比 Agentic RAG 的三种架构演进形态:基础检索自纠错(本地循环重搜)、标准 CRAG(双阈值打分加联网兜底与句子级去噪)和带回环的 Self-RAG(前置门控加本地与网络两段式加质检回环)。文中给出三者的状态流转逻辑、核心实现代码与生产避坑指南,并建议将 CRAG 作为企业主力架构,仅在法律、医疗等场景开启带计数器的 Self-RAG 质检回环。

  3. MIT Technology Review · AI24

    人们一边痛恨 AI,一边为什么又离不开它?

    调查显示美国成年人中认为 AI 会带来负面影响的比例已超过正面预期,71% 反对在本地新建 AI 数据中心,但 ChatGPT 在 5 月月活用户突破 10 亿,Gemini 7 月达 9.5 亿,半数美国成年人已在用聊天机器人。作者认为,人们反感的并非技术本身,而是科技公司无孔不入的推销方式。

  4. Hacker News52

    华为与高通宣布广泛专利许可协议

    华为与高通宣布达成一项多年期广泛专利许可协议,包含双方在 5G、计算、AI 和网络等技术领域的专利组合交叉授权,以及高通购买华为在计算、AI、网络等领域的部分美国专利。该交易将在获得必要监管批准后完成,双方表示协议符合 FRAND 原则。

  5. arXiv stat.ML22

    ENCORE:用副本交换实现扩散生成精确非平衡控制

    研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。

  6. arXiv stat.ML12

    Expected Utility Regret 规则:投资组合选择的 Minimax 与 Bayes 最优解

    研究提出 Expected Utility Regret(EUR)规则,可同时选择投资组合类别并估计其权重,在正则参数化收益模型中,单一 EUR 规则无需先验分布即可同时达到 minimax 与 Bayes 下界(含主常数项)。均值—方差组合与风险平价组合被推导为该框架的特例;当收益除以波动率的联合分布与资产顺序无关时,EUR 规则与风险平价组合一致。

  7. arXiv cs.AI24

    用程序精化与 LLM 智能体发现认知算法

    研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。

  8. arXiv cs.LG24

    自适应批处理为何有助于 LLM 预训练?无界方差视角下的解释

    研究提出广义 BG-a 噪声模型,在方差有界(a=0)与 BG-0 噪声(a=2)之间插值,并推导出增长相关的信息论下界 Ω(ε^-(4+a)) 及匹配上界。基于此设计的自适应批调度器在 C4 上预训练最高 1B 参数的 OLMo2 模型,在相同 token 预算下验证损失低于固定小批量与大批量训练,且迭代次数不到小批量训练的 10%。

  9. arXiv stat.ML26

    DAWIS:基于多任务插值的窗口逆采样数据同化方法

    研究者提出 DAWIS,一种统一滤波、固定滞后平滑与块平滑的数据同化方法,用多任务随机插值替代状态级先验的单一流时间,为窗口内每个连续状态分配独立流时间。同化循环将窗口反演为逐状态转折点向量并在观测引导下重新生成,从而在新观测到来时修正过去状态。在稀疏、含噪、非线性观测下,DAWIS 优于滤波和平滑基线,代码已开源。

  10. arXiv cs.CL15

    HakemBench:土耳其语类型化决策基准发布

    HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开源,含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。

  11. arXiv cs.CV22

    MapMergeLLM:用大语言模型实现矢量化地图聚合

    MapMergeLLM 将矢量化地图聚合建模为条件序列生成任务,由大语言模型直接预测聚合后的全局地图折线。该框架用模拟预测误差的合成局部地图训练,并引入几何感知预训练的坐标 tokenizer 与线级关联损失。在 Argoverse2 和 nuScenes 上,它无需针对特定检测器重训即大幅超越启发式与优化类聚合基线。

  12. arXiv cs.CL22

    面向大语言模型多任务后训练的自适应互蒸馏框架 AMD

    研究者提出自适应互蒸馏(AMD),一种协同后训练框架,同时训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重调整,再按任务和迁移方向用验证分数择优。在六个基准和三个 LLM 主干上,两个 AMD 模型平均分均超过相同采样策略的 SFT 基线,合并后模型在三个主干上平均超出多任务 SFT 2.91 分。

  13. arXiv stat.ML12

    不完备线性自编码器中的尺度对称性破缺

    研究发现,不完备线性自编码器在 PCA 解流形上,SGD 会偏好较大的解码器权重,产生有方向的尺度漂移。该漂移发生在慢时间尺度上,且具有可解析处理的有效描述,但最终会因有限步长稳定性边界而停止。所得解在损失 Hessian 最大特征值意义上比平衡基线更尖锐,但不同尖锐度度量可能方向相反。

  14. arXiv cs.CL22

    FOVEATED:用聚焦视图提升非结构化知识编辑中的原子事实召回

    针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文上下文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,保持模型原生位置编码不变。该方法在五种知识编辑器、两个 LLM 主干和三个基准上均取得一致提升,并理论分析了其如何抵消上下文引起的难度低估。

  15. arXiv cs.CV24

    SCOPE-4D:内窥镜 4D 几何基础模型

    SCOPE-4D 是一个内窥镜 4D 几何基础模型,可从单目 RGB 视频单次前向推理中联合预测相机参数、稠密几何与 3D 组织轨迹。团队构建了约 5,000 段真实与合成胃肠内窥镜及腹腔镜视频的 SCOPE-5K 数据集,并提出 Common–Residual Motion(CRM)约束局部形变。在公开及新采集基准上,该模型展现出更强的域内外几何估计、3D 跟踪与长序列结肠重建稳定性。

  16. arXiv cs.LG22

    SF-MOPD:慢-快多教师在线策略蒸馏如何缓解能力干扰

    研究提出慢-快多教师在线策略蒸馏(SF-MOPD),通过将学生模型的指数移动平均作为"慢模型"能力参考,在 log-probability 空间剔除使快模型偏离慢模型的分量,保留对齐与正交分量。实验表明,SF-MOPD 在多模型规模上有效缓解能力干扰,增强多模态专业能力,并降低通用能力基准的平均退化,持续优于原版 MOPD。

  17. arXiv cs.CL18

    大语言模型在时间抽取任务中的多维泛化能力评估

    研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。

  18. arXiv cs.CL32

    语言智能体为何无法将历史转化为经验:动作校准研究

    语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。

  19. arXiv cs.LG27

    PowerBench:衡量语言模型在权力转移请求中的偏见

    研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。

  20. arXiv cs.CV24

    基于仿真的智能体 VLM 框架用于野火监测与报告

    研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。

  21. arXiv cs.LG29

    ReRoute:无需受控实验,用部分机制知识实现科学仿真器反事实预测

    研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。