1-Bit 反馈下的近最优固定置信度最佳臂识别
研究在严格 1-bit 反馈约束下的固定置信度最佳臂识别问题,学习者每轮只能收到一个比特,判断采样奖励是否属于所选查询集。作者提出基于随机阈值查询与截断尾积分恒等式的时间一致 1-bit 均值估计原语,并嵌入候选-挑战者算法:固定截断版本给出 anytime (ε,δ)-PAC 保证,分阶段自适应截断版本实现间隙自适应样本复杂度。
研究在严格 1-bit 反馈约束下的固定置信度最佳臂识别问题,学习者每轮只能收到一个比特,判断采样奖励是否属于所选查询集。作者提出基于随机阈值查询与截断尾积分恒等式的时间一致 1-bit 均值估计原语,并嵌入候选-挑战者算法:固定截断版本给出 anytime (ε,δ)-PAC 保证,分阶段自适应截断版本实现间隙自适应样本复杂度。
研究者提出 Lexicographic Multi-Objective On-Policy Distillation(LMOPD),一种按显式优先级整合奖励专精策略的多教师方法,通过字典序路由与对数策略修正投影保护高优先级能力。
多智能体辩论中,向一致多数派妥协的 LLM 智能体其实并未改变"想法"。研究用 J-lens 从残差流中读取中间实体(bridge),在 Qwen3.5-4B。
研究者预训练了共享内存的 Looped Transformer(LPT),仅第一次递归写入 key-value cache,后续递归读取该缓存并保留自身短窗口,结果共享内存不但不损质量反而提升质量。
研究者提出 Hyperbolic Entropy Steering(HEST),将隐藏状态嵌入 Poincaré 球,用仅以模型自身 next-token 熵为标签的轻量探针,在熵超过阈值的 token 处沿测地线调整状态。
WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。
e-process-authorized Thompson sampling(e-ATS)为每个臂维护全历史和折扣 Beta 状态,由 anytime-valid e-process 先授权折扣状态、再用可逆相关性分数控制其影响,未获授权前完全遵循乐观 Thompson sampling(OTS)。
AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。
FUSEye 将冻结骨干的 COCO 预训练 YOLO26-x 转为鱼眼检测器,仅新增约 227k 参数,在 WoodScape 环视鱼眼基准上把 mAP50 从 0.148 提升至 0.266,并保留全量微调 84.3% 的精度。
一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。
研究对开源 Laya 与托管 Jev 两个 System-1 决策模型在 11 个智能体决策点上做了配对评测,覆盖 7,283 个基础用例和 6,640 个鲁棒性变体。
DAGS 是一种轻量、无注意力机制的解耦外观与几何条件方案,可引导冻结的图像 DiT 生成高保真、高一致且可独立控制的渲染结果。它用两个小型卷积编码器逐帧计算条件特征,并以逐层逐元素的残差注入图像 token,避免注意力堆叠条件的二次开销。
TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。
一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。
TypeSafe 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中回应 Jev 估值 100 亿美元,并称其日处理量已突破一万亿 token。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
前 DeepMind AlphaGo 核心成员 Thore Graepel 撰文指出,当前 LLM 的链式推理仍由同一套下一 token 预测过程生成,不构成真正独立的推理机制。
openJiuwen 团队开源智能路由框架 model-router,并首发 x-router 算法,在 Agent 与模型之间增加一层按任务复杂度动态选模的决策能力。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其 Recursive Language Models(RLM)等工作,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,在 Stratego 中以 15 胜 1 负 4 平击败被视为史上最强的选手 Pim Niemeijer。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并对比同期 GPT-6.1 Sol 的成本差异。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
开源项目 Jeff 发布,定位为零样本分类器,基于 Qwen3.5 和 Gemma 4 微调,一次前向计算即返回每个选项的校准概率,不生成文本、无需解析。在 RTX PRO 6000 上约 22 毫秒出一次决策,并支持 Apple M4 Max(MLX)。其 0.8B 微调版本在 benchmark 上逼近 Jev。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:读者可以看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对最终性能差距的具体影响。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
伯克利 AI Research 发布综述,梳理并行推理从固定结构走向自适应控制的研究进展,即让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代加入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使世界模型的长时程规划变得可行。现代世界模型长时程规划常因优化病态、非贪心结构导致的局部极小值和高维隐空间失败模式而脆弱。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。