e-ATS:e-process 授权的 Thompson Sampling 何时可以离开锚点?
e-process-authorized Thompson sampling(e-ATS)为每个臂维护全历史和折扣 Beta 状态,由 anytime-valid e-process 先授权折扣状态、再用可逆相关性分数控制其影响,未获授权前完全遵循乐观 Thompson sampling(OTS)。
e-process-authorized Thompson sampling(e-ATS)为每个臂维护全历史和折扣 Beta 状态,由 anytime-valid e-process 先授权折扣状态、再用可逆相关性分数控制其影响,未获授权前完全遵循乐观 Thompson sampling(OTS)。
AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。
FUSEye 将冻结骨干的 COCO 预训练 YOLO26-x 转为鱼眼检测器,仅新增约 227k 参数,在 WoodScape 环视鱼眼基准上把 mAP50 从 0.148 提升至 0.266,并保留全量微调 84.3% 的精度。
一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。
研究对开源 Laya 与托管 Jev 两个 System-1 决策模型在 11 个智能体决策点上做了配对评测,覆盖 7,283 个基础用例和 6,640 个鲁棒性变体。
DAGS 是一种轻量、无注意力机制的解耦外观与几何条件方案,可引导冻结的图像 DiT 生成高保真、高一致且可独立控制的渲染结果。它用两个小型卷积编码器逐帧计算条件特征,并以逐层逐元素的残差注入图像 token,避免注意力堆叠条件的二次开销。
TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
伯克利 AI Research 发布综述,梳理并行推理从固定结构走向自适应控制的研究进展,即让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使世界模型的长时程规划变得可行。现代世界模型长时程规划常因优化病态、非贪心结构导致的局部极小值和高维隐空间失败模式而脆弱。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。