跳到正文
10月5日周一
  1. arXiv cs.LG20

    Co-design Gym:面向具身与策略协同优化的统一基准

    研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。

  2. arXiv cs.LG20

    不同假设下 MS/MS 谱图分子指纹预测的最近邻基线

    针对 MS/MS 谱图预测分子指纹,最近邻检索已被证明是强基线,多种变体可匹敌或超越当前深度学习模型。该报告系统比较了在推理阶段假设可用信息不同的多种最近邻变体,展示这些假设如何影响性能,目标是建立更严格的基线以支持更严谨的基准测试并更好衡量该领域进展。

  3. arXiv cs.LG29

    LINEUP:将个性化与逐用户适配解耦,每个用户只需优化 8 个标量

    LINEUP 将个性化能力与逐用户可训练状态解耦,每个目标用户只需优化 8 个标量,而对比的 private-LoRA 配置每用户需 419 万参数。该方法学习一组可复用的低秩个性化因子,通过用户条件召回与查询相关校准组合,并把目标用户适配限制在共享修正空间上的极小用户编码中。

  4. arXiv cs.CL22

    WakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略

    WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。

  5. arXiv cs.CV12

    4DFEID:4D 面部表情强度数据集发布

    研究者构建了 4D 面部表情强度数据集 4DFEID,基于参数化人脸模型生成 2,869 条网格序列,并通过众包平台收集超过 90,000 条 Likert 量表主观强度评分。基线实验显示,时空图模型在片段强度估计上持续优于传统帧聚合方法。该数据集以动态 3D 刺激替代现有 2D 静态图像,为情感计算与人机交互中的表情强度感知研究提供资源。

  6. arXiv cs.CL17

    多模态声明验证对 LLM 改写有多鲁棒?

    研究测试了 11 个开源权重模型(覆盖 5 个 VLM 家族、2B 至 38B 参数)在多模态声明验证任务中对 LLM 改写的鲁棒性。结果显示多数模型准确率无显著下降,但概率出现一致性偏移:对冲类改写几乎在所有模型上引发显著偏移,增强类效果较弱,语法纠错等常规润色几乎无影响。

  7. arXiv stat.ML29

    AREX:面向 Flow Matching 少步采样的仿射残差指数积分器

    AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。

  8. arXiv cs.CV30

    SCION:用实例化神经基元实现场景组合

    SCION 是一种分层组合式场景表示,用可复用基元的紧凑词表加轻量级世界空间实例替代独立高斯,通过离散与连续场景参数的联合优化拟合多视图捕捉,在 1.2 MB 下仍保持高质量。它取得优于现有高斯压缩方法的率失真表现,并支持无需重训练的实例级场景编辑与动画,论文已被 NeurIPS 2026 接收。

  9. arXiv stat.ML13

    ResTGP:面向高维数据的残差树高斯过程建模框架

    研究者提出贝叶斯残差树高斯过程方法 ResTGP,用于处理多维域中具有异质结构的大规模空间数据。该方法沿二进树在多个分辨率上迭代分解预测过程与残差过程,实现灵活的多尺度协方差建模与分治计算,并基于递归消息传递的贝叶斯推断策略使计算量在给定树下随样本量线性增长。论文还证明了非参数回归框架下连续函数估计的后验一致性,数值实验与风暴潮应用验证了其优势。

  10. arXiv cs.AI31

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。

  11. arXiv cs.CV24

    MeshQuery:用智能体做 UV 展开的接缝规划

    MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。

  12. arXiv cs.AI31

    AI Risk Observatory:用 LLM 分析英国上市公司年报中的 AI 风险披露

    研究用两阶段分类流水线处理 1,362 家英国上市公司 2020-2025 年的 9,821 份年报,发现提及 AI 风险的报告占比从 2.8% 升至 41.2%,AI 采用披露从 13.8% 升至 45.2%,供应商提及集中在以 Microsoft 为首的少数厂商。2025 年 41.2% 的报告提及 AI 风险,但仅 4.3% 属于实质性披露,危害披露全语料仅 7 份。

  13. arXiv cs.AI22

    如何实现敏感辩论:面向 AI 辩论的实例最优协议

    研究者提出一种新的 AI 辩论协议,针对可稳定分解为子问题的问题类别,在正确性上实现最坏情况保证,并使双方辩手诚实作答成为占优策略均衡,而非 Stackelberg 均衡。该工作还证明了黑盒下界,表明新协议在实例层面最优,仅靠黑盒查询人类判断的任何协议都无法超越它。相关结论通过将稳定问题分解与查询复杂度中的分数块敏感度概念相关联而得到。

  14. arXiv cs.LG20

    固定目标异常检测器的收敛坍缩问题:用核锚定局部性正则化(KAR)缓解

    研究揭示固定目标异常检测器存在"收敛坍缩":优化越好、检测越差,因收敛后残差信号在异常与正常数据上同时消失。作者提出闭式、免训练、CPU 高效的 Kernel Contraction Matching(KCM),并在此基础上引入 Kernel-Anchored Regularizer(KAR),惩罚神经预测偏离训练目标的核加权平均。

  15. arXiv cs.CV22

    SymRegFlow:面向视频世界模型的对称正则化流匹配

    SymRegFlow 是一个对称正则化流匹配框架,可在无新视角 RGB 真值监督的情况下,实现连续视角下的多视角一致视频生成。该方法通过几何变换将源视图转为带噪锚点,结合掩码双锚点监督与跨锚点去噪输出一致性来抑制锚点误差,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优解。

  16. arXiv cs.CV24

    TRAC:面向高效自回归视频生成的轨迹感知复用与自适应校正框架

    TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。

  17. arXiv cs.CL22

    心理健康污名自动评估基准:LLM 常过度预测污名,除非给出明确操作规则

    研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。

10月1日周四
9月29日周二
  1. Microsoft Research18

    微软亚洲研究院新加坡成立一周年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。实验室与新加坡医疗生态伙伴合作探索多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。

9月21日周一
9月8日周二
  1. Google DeepMind74

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。

8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。

7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。

5月8日周五
4月20日周一
  1. Berkeley AI Research31

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使世界模型的长时程规划变得可行。现代世界模型长时程规划常因优化病态、非贪心结构导致的局部极小值和高维隐空间失败模式而脆弱。

3月13日周五
1月10日周六
  1. Berkeley AI Research35

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。相关论文发表于 NeurIPS 2025。