跳到正文
10月5日周一
  1. arXiv stat.ML13

    1-Bit 反馈下的近最优固定置信度最佳臂识别

    研究在严格 1-bit 反馈约束下的固定置信度最佳臂识别问题,学习者每轮只能收到一个比特,判断采样奖励是否属于所选查询集。作者提出基于随机阈值查询与截断尾积分恒等式的时间一致 1-bit 均值估计原语,并嵌入候选-挑战者算法:固定截断版本给出 anytime (ε,δ)-PAC 保证,分阶段自适应截断版本实现间隙自适应样本复杂度。

  2. arXiv cs.CL22

    WakeKV:面向会改变读取行为的注意力头的响应式可逆 KV 驻留策略

    WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。

  3. arXiv stat.ML29

    AREX:面向 Flow Matching 少步采样的仿射残差指数积分器

    AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。

  4. arXiv cs.AI31

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。

  5. arXiv cs.CV24

    TRAC:面向高效自回归视频生成的轨迹感知复用与自适应校正框架

    TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。

  6. Simon Willison22

    Qwen3.8 27B 用英文单词做加法的基准测试

    一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。

10月3日周六
10月2日周五
10月1日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月29日周二
8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。

7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。

5月8日周五
4月20日周一
  1. Berkeley AI Research31

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使世界模型的长时程规划变得可行。现代世界模型长时程规划常因优化病态、非贪心结构导致的局部极小值和高维隐空间失败模式而脆弱。

3月13日周五