EnGRICH:用人类批评增强生成式奖励模型
研究者提出 GRM 训练框架 EnGRICH,通过一个从少量人类批评中学习的训练期 MetaCritic,为生成的批评构建针对性评分标准并评估其证据覆盖度与正确性,从而提供过程奖励和结构化探索引导。MetaCritic 在训练中进一步优化,将人类评价标准泛化到仅有结果标签的偏好数据;推理时训练好的 GRM 独立运行。在七个奖励模型基准上,EnGRICH 持续优于竞争基线。
研究者提出 GRM 训练框架 EnGRICH,通过一个从少量人类批评中学习的训练期 MetaCritic,为生成的批评构建针对性评分标准并评估其证据覆盖度与正确性,从而提供过程奖励和结构化探索引导。MetaCritic 在训练中进一步优化,将人类评价标准泛化到仅有结果标签的偏好数据;推理时训练好的 GRM 独立运行。在七个奖励模型基准上,EnGRICH 持续优于竞争基线。
针对 Agent 上下文窗口中工具观测数据过期后仍被复用的问题,研究者提出上下文一致性框架 Concord,可将每条观测关联到来源、检测源变更,并按可配置策略在复用前更新、标注或抑制过期上下文。
针对冻结的 VLA 策略可能选中局部可行但断绝安全完成任务路径的动作,研究者提出"可行性-似然差距"概念,并推导出受限安全完成任务的历史条件轨迹律的精确下一块边缘分布,据此设计免训练重排序器 VICS-G。
SpecFold 通过折叠注意力与 FFN 复用父分支计算,减少扩散语言模型多分支投机验证中的冗余开销。在两类 DLLM 家族、五个模型和五个基准上,其吞吐量最高达 Spiffy 的 1.64 倍、原生解码的 1.99 倍,且任务性能相当。该算法与时间缓存正交,兼容现有 DLLM 投机策略。
研究通过微调 Google DeepMind 的 Gemma-4 MoE 模型提升视觉语言模型的空间推理能力,在 2D 和 3D 旋转检测上均取得明显改进。微调后的 Gemma-4 MoE 模型在预测由轴和角度定义的旋转时显著优于微调后的 Gemma-4 通用模型,且无需显式坐标系即可改善 2D 表示的角度估计。研究还发现,可识别物体并未提升角度检测准确率,具有显著线性特征的物体反而表现更好。
研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。
研究对比 Laya、Jev 和 Qwen2.5-7B-Instruct 在候选集与任务变化下的拒绝策略迁移表现,发现源域校准常无法保持目标工作点:在 DBpedia 上校准的 Jev 策略会拒绝 69.3% 的 Emotion 测试输入,而 Emotion 策略则完全丧失检测能力。
研究者提出 TradeGrad,一个经验引导的文本梯度框架,用于稳健的量化交易策略优化,通过积累的优化经验估计文本梯度,并对策略探索与精炼进行多尺度修正。该框架还引入 Cross-Period Robust Objective(CPRO),强调在不利历史时期的表现以提升时间稳健性。
研究者发布 CreativePreferences 数据集,包含 2.8M 文本、317M 人类偏好判断,覆盖 7 个创意领域和 42 个基准任务,并用可执行程序、评分标准库和密集训练模型(V、A、VAT)建模这些标签。
研究者提出诊断框架 LUMOS,基于训练语料完全透明的 OLMo 2,追踪 LLM 参数化知识从训练数据曝光到行为输出的因果链。结果显示模型内部对罕见事实的编码可分性达 84%,但行为表达仅 54%,该检索差距随规模扩大而收窄。模型对已训练内容自我反思准确率为 83%,对未见内容降至随机基线 49%,且链式推理提示只会抬高置信度而非改善校准。
BitNest 是一种位嵌套投机解码框架,将低精度草稿模型直接嵌入高精度目标模型的权重表示中,两者共享同一份物理权重,并把渐进精度设计扩展到 KV cache 以支持长上下文推理。
PAPER2LLM++ 是一个让 LLM 从研究论文中持续自我进化的框架,它把论文当作模型改进的证据与监督信号,而非仅用于检索的知识。对每篇新论文,它提取有证据支撑的发现,检验所报告的局限是否仍存在于当前模型,必要时转化为候选学习信号,并通过 try-evaluate-commit 流程仅在提升目标行为且不显著遗忘或损害通用能力时才提交更新。
研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。
一篇综述系统梳理了 RAG(检索增强生成)的三大基础组件——检索、生成与增强,涵盖稠密与稀疏检索器、融合策略、嵌入向量优化及基于强化学习的检索策略。文章围绕效率、安全、以用户为中心的交互和复杂推理四条新兴轴线对近期创新进行分类,并回顾了 Naïve RAG、Advanced RAG 和 Modular RAG 等架构变体及评估协议与领域应用进展。
SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。
ReSolve 是一种免训练推理方法,通过选择性生成式审核复用候选推理:当候选答案分歧或无法解析时,调用模型检查已有推导并纳入有界循环。在 130 道竞赛数学题上,ReSolve 在两个独立候选池中分别答对 100 和 99 题,优于同四候选投票的 91 和 92 题,且相比八样本自一致性分别少用 46.3% 和 47.2% 的 token。消融实验显示移除可见推导后准确率从 100 降至 93。
一项研究提出 LLM 叙事框架,将时序 SHAP 证据与历史市场状态类比结合,用于横截面股票收益预测的可解释叙述。在 Qwen3 上的对照实验显示,逐步外化数值与关系推理后,Qwen3-32B-Instruct 的证据忠实度从 0.696 提升至 0.996,时序与关系准确率同步改善。历史类比虽未提升结构化自动忠实度,但获得了更高的人工评分有用性。
研究者提出 JudgeProfile 框架,将 LLM 评判拆解为感知(对清晰度、正确性、细节等属性的比较)与优先级(各属性对最终选择的影响权重)两部分,并构建了含 50,013 对回答、覆盖 17 个公开数据源、21 个 LLM 评判者和 87 个属性的 SubjectiveSet 数据集。
研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。
研究提出"智能体体验(AX)"是新的 AEO:在 1,056 家真实企业上运行 37,927 次智能体购买旅程后发现,仅 7-10% 的最终答案来自模型训练知识。具备 AX 的企业有 78% 的答案由自家页面构建(对照组 56%),被明确推荐的概率高 1.9 倍;而不可读企业获得有据答案的成本平均高 64%。主要失败并非编造而是遗漏——网页构建的答案缺失买家所需事实的概率高 3.7 倍。
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。
论文提出"动作塑形"原理:可训练策略会吸收其输出层能精确复现的动作偏移,被吸收的偏移可在部署时移除且回报不变。最小实例是学习门控后的零初始化线性头,门控会自行先升后降,在 20 个任务上移除该头几乎无代价。该吸收条件取决于精确复现而非容量,非线性头即使参数更多也不会被吸收。
研究软状态表示中类权重构造与状态动态如何共同决定线性预测精度,针对任意固定可测表示推导出有限样本下最小总体均方根预测误差的置信下界,该下界由独立评估对计算、无需拟合预测矩阵。
TwinCheck 是一种推理时验证策略,仅在轨迹满足与局部失败假设绑定的证据条件时才考虑替换工具调用,并构造轨迹锚定的反事实"负孪生"方案,通过结构检查与双向成对验证器比较后才替换智能体的提议。
JEV-as-a-Judge 提出用只输出标签概率的决策型评判模型 JEV 做评估,由置信度决定直接采纳还是升级给推理型评判模型。在 16 个生成式与奖励模型评判器的对比中,JEV 在可直接从文本读出结论的场景下与 GPT-6 相差 3 分以内,费用仅为其 0.36%,中位延迟 0.15 秒,但在数学、代码和逻辑等需推导结论的场景落后。
UnitBoost 提出用定义好的元级算子替代复合 LLM 系统中的生成式管理者模型,通过任务给定的 unit map 将 worker 输出转为槽值提案,再用受限 argmax 组装输出,未填充或不支持的槽位成为下一轮的显式残差。
FrogNano 是一个 4B 编程智能体,仅通过 RL 在约 1,500 个 SWE 环境上后训练,无需从更大模型蒸馏。其核心是在线任务合成管线,按当前 checkpoint 的可学习前沿生成任务,论文称这对提升性能至关重要。
GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。
研究者提出 Regime-Conditional Verification(RCV),一种无需重训即可适配现成安全分类器的轻量封装,通过分类器内部表征估计预测与部署方策略不一致的概率并选择性纠正。
Muon 训练的模运算 Transformer 会在保留线性可解码任务信息的同时丢失准确率,相邻交换将五例未归一化失败定位到 AdamW 读出更新。仅用训练数据训练的 decoder 可恢复 98.20-100% 的留出准确率,修正交叉熵导数错误后五条匹配分支稳定训练至 100,000 步。
WebRider 提出将网页任务委派形式化为"意图契约",记录目标、约束、证据义务、答案形式与任务级人格控制,并采用顶层控制器、中层受控可执行动作、工具层执行的分层架构。
针对不完整观测下的多模态情感分析(MSA),研究者提出 MRCF(Modality Reliability-Calibrated Framework),显式建模模态可靠性以缓解可靠性失配与可靠性传播偏差。MRCF 包含可靠性感知分支、可靠性引导交互分支和可靠性校准融合模块,在 CMU-MOSI、CMU-MOSEI 和 CH-SIMS 上取得强劲表现。
研究者提出拒绝门控解码(RGD),一种顺序解码方法,可在高温采样下保留模型的贪心解码拒绝响应,同时让其他提示词按原始高温分布采样。在 7 个模型和 3 个基准数据集上、T=2.0 时,RGD 将贪心拒绝保留率从直接采样的 91.9% 提升至平均 98.3%,非拒绝请求的中位延迟仅增加 2.2-4.3%。其残差流变体将延迟开销降至最多 0.5%,路由准确率相当。
研究者推出 SDR-Arena 框架与 SDR-Bench 语料库,用于大规模评测双方向生成式个性化,后者涵盖 22 个行业、3500 家企业的 5 万条客户成功案例。最佳模型 Claude Sonnet 4.6 仅达 55.8% WCS,表明只还原约一半制胜内容,且该瓶颈源于检索而非推理。与专业 SDR 的两项研究显示,仅 48% 生成话术无需编辑即可使用。
Critic Experience Bank(CEB)是一个免训练框架,将已完成轨迹的反馈转化为可复用证据,用于 LLM 智能体的步级置信度估计。它通过为动作打上事后生产力伪标签并检索相关经验,让固定 LLM 评论模型在无需参数更新或真实步级标签的情况下适应任务流。
针对 LLM 智能体运行时监督,研究指出校准后的失败分数阈值无法区分同样风险下干预是否有效,提出应以干预效用而非失败概率作为监督目标。在 ALFWorld 上固定特征、估计器与路由器,仅将监督目标从失败改为干预效用,regret 从 0.51 降至 0.09。在 300 个未见任务上,冻结前缀特征控制器相比失败触发路由将交接率从 48% 降至 35%,成功率从 37% 提升至 45%。
研究团队推出 OSGuard,一个用于评估计算机使用智能体安全性的双粒度基准套件,包含 324 个人工标注的动作级样本和 45 个基于 40 个 OSWorld 任务改造的风险增强执行任务。
一项研究对比人类与 46 个 LLM 的日常常识推理表现,发现两者呈现趋同的推理模式。通过分析内容不变与内容敏感的模型神经元,研究发现真正让模型输出与人类对齐的是内容敏感机制,而非内容不变的世界模型。这表明人类和 LLM 的日常因果推理都大量依赖模式匹配。
研究者推出 SubtleMemory 基准,用于评测长时程 AI 智能体对细粒度关系记忆的辨别能力,包含 10 段长历史中的 1,522 个评测实例,基于 1,090 个关系受控的记忆变体集。