用激活引导向量缓解 LLM 评估器中的自我偏好偏差
针对 LLM 作为自动评估器时偏爱自身输出的"自我偏好偏差",研究者提出在推理阶段用轻量引导向量(steering vectors)进行干预,无需重新训练。通过 Contrastive Activation Addition(CAA)和基于优化的方法构建向量,可将不合理的自我偏好偏差降低最多 97%,显著优于提示词和 DPO 基线。
针对 LLM 作为自动评估器时偏爱自身输出的"自我偏好偏差",研究者提出在推理阶段用轻量引导向量(steering vectors)进行干预,无需重新训练。通过 Contrastive Activation Addition(CAA)和基于优化的方法构建向量,可将不合理的自我偏好偏差降低最多 97%,显著优于提示词和 DPO 基线。
一项 arXiv 研究系统评估了图像类联邦学习场景下梯度反转攻击的实际可行性,覆盖图像分类与目标检测任务及当代分辨率的经典视觉架构。结果显示,现代性能优化模型在视觉上始终能抵抗有意义的图像重建,此前的成功案例多依赖推理模式运行或架构简化等上界设定。在诚实但好奇的服务器假设下,高保真图像重建不构成生产级联邦学习系统的关键隐私风险。
LHM-Humanoid 提出一种无需重置的长时程人形运动控制方法,让物理仿真人形在单次连续运行中反复完成走向物体、全身平衡抬起、绕过障碍搬运并放置的完整循环。
研究者提出 CMCM-DLM,一个模块化框架,可将预训练扩散模型扩展至支持异构分子约束而无需重训主干。该框架用结构控制模块(SCM)在扩散早期引导分子骨架生成,再由性质控制模块(PCM)将生成导向目标化学性质。多数据集实验显示其具备有效的跨模态可控性与较强适应性。
FedCoT 是一个联邦推理框架,通过轻量级 CoT 重采样配合紧凑判别器筛选,并用客户端感知的 LoRA 堆叠与加权分类器聚合来应对数据异构、降低聚合噪声和通信开销。客户端本地生成候选推理链与监督信号,服务器仅聚合轻量模块,数据始终保留在本地。在医疗推理基准上,该方法在紧张资源预算下取得稳定提升,代码已公开,论文被 EMNLP 2026 收录。
研究用认知评价理论构建了覆盖 15 种情绪类别的基准数据集,通过行为表征对比 LLM 与人类的情感概念结构。结果显示 LLM 的情感表征比人类更分类化、同质化和确定化,单一情绪概念内部多样性更低、不同情绪间距更大,且该分类结构对任务框架和人口学角色等上下文变化保持稳健。
针对时间序列预测中时序均方误差忽略标签自相关、任务数量过多的问题,研究者提出变换增强损失函数 Time-o1,将标签序列变换为去相关且显著性可区分的分量,让模型对齐最显著分量。实验显示 Time-o1 达到 SOTA 性能,并兼容多种预测模型,代码已开源,该工作被 NeurIPS 2025 接收为 poster。
研究者提出 KO(Kinetics-inspired Optimizer),一种基于动力学理论与偏微分方程的可插拔优化模块,通过离散化 Boltzmann 输运方程引入随机交互来增强参数多样性、缓解权重凝聚。理论分析表明 KO 可证明地提升参数多样性并保持收敛保证。在 CIFAR-10/100、ImageNet 图像分类和大规模语言模型预训练中,KO 以可忽略的额外计算成本持续提升准确率。
研究者提出 Mask Fine-Tuning(MFT),一种在不更新模型权重的前提下,对已充分微调的 LLM 学习并施加二值掩码的微调范式,用标准微调目标做监督。在 LLaMA2-7B 与 LLaMA3.1-8B 上,MFT 使用相同微调数据集在 IFEval 上平均提升 2.70/4.15。该方法可与现有 LLM 优化流程兼容,并将掩码操作从网络剪枝压缩拓展到更广泛的模型能力提升。
研究提出 Robustness Inheritance Benchmark(ImageNet-RIB),用于评估预训练模型微调后的鲁棒性保持情况。结果显示,在 LAION-2B 等最大最多样数据集上预训练的模型,在小数据集上微调后鲁棒性损失更大、绝对鲁棒性更低,这种崩溃出现在 CLIP 等对比预训练模型及其微调变体中,并随预训练规模增大而加剧,而所测试的监督模型未出现该现象。
研究提出用选择性状态空间模型(Selective State Space)的深度神经网络建模光学动态范围压缩器,性能超过此前的循环层方法。该架构结合 Feature-wise Linear Modulation 与 Gated Linear Units,按外部参数动态调节压缩的 attack 和 release 阶段,适合低延迟实时音频处理。
一篇综述系统梳理了基于扩散模型的视频编辑技术,涵盖数学基础、图像域关键方法及按核心技术关联划分的视频编辑方法演化脉络。文章还探讨了基于点的编辑和姿态引导的人体视频编辑等新应用,并引入新基准 V2VBench 进行全面对比,最后总结了现存挑战与未来方向。
针对直接预测(DF)范式忽略未来标签间自相关导致学习目标有偏的问题,研究者提出频域增强直接预测方法 FreDF,通过在频域中学习预测来缓解标签自相关、降低估计偏差。实验显示 FreDF 显著优于现有 SOTA 方法,并兼容多种预测模型,代码已开源,该工作被 ICLR 2025 接收。
研究者提出超图增强双卷积神经网络(HED),构建包含用户—捆绑、用户—物品、捆绑—物品交互及用户内、捆绑内关系的完整超图,并将完整超图传播与用户—捆绑分支耦合。在 NetEase 上 HED-128 在六项指标上较最强基线提升 5.04–6.97%,在 Youshu 上 HED-64 提升 1.87–4.56%。消融实验支持用户—捆绑分支与类型内关系的贡献,并量化了完整超图的内存开销等计算代价。
研究者提出 Bag-Of-Receptive-Field(BORF),一种快速、可解释且确定性的时间序列变换方法,通过在 SAX 中引入膨胀和步幅,将 Bag-Of-Patterns 扩展为稀疏多元张量表示。
研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。
研究提出用匿名公共行为数据诱导人口群体级人格画像来驱动 LLM 智能体模拟调查回答,并考察数据领域、规模与粒度对对模拟对齐的影响。结果显示,域外来源诱导的人格画像很少优于仅基于基本人口信息的模拟,主要原因是人群不匹配;但当画像被准确分配到目标人口群体时,对齐效果显著提升。来自目标域调查数据的画像随问题历史增多而泛化更好,表明更丰富的行为证据能带来更稳定的人格特质推断。
TeleTune 是一个从无目标标注、不可回放且任务交错的离线日志中学习文本技能库的框架,通过动作预测误差提出技能库编辑并保留能提升留出集动作预测准确率的修改。
研究者提出 GRM 训练框架 EnGRICH,通过一个从少量人类批评中学习的训练期 MetaCritic,为生成的批评构建针对性评分标准并评估其证据覆盖度与正确性,从而提供过程奖励和结构化探索引导。MetaCritic 在训练中进一步优化,将人类评价标准泛化到仅有结果标签的偏好数据;推理时训练好的 GRM 独立运行。在七个奖励模型基准上,EnGRICH 持续优于竞争基线。
针对 Agent 上下文窗口中工具观测数据过期后仍被复用的问题,研究者提出上下文一致性框架 Concord,可将每条观测关联到来源、检测源变更,并按可配置策略在复用前更新、标注或抑制过期上下文。
针对冻结的 VLA 策略可能选中局部可行但断绝安全完成任务路径的动作,研究者提出"可行性-似然差距"概念,并推导出受限安全完成任务的历史条件轨迹律的精确下一块边缘分布,据此设计免训练重排序器 VICS-G。
SpecFold 通过折叠注意力与 FFN 复用父分支计算,减少扩散语言模型多分支投机验证中的冗余开销。在两类 DLLM 家族、五个模型和五个基准上,其吞吐量最高达 Spiffy 的 1.64 倍、原生解码的 1.99 倍,且任务性能相当。该算法与时间缓存正交,兼容现有 DLLM 投机策略。
研究通过微调 Google DeepMind 的 Gemma-4 MoE 模型提升视觉语言模型的空间推理能力,在 2D 和 3D 旋转检测上均取得明显改进。微调后的 Gemma-4 MoE 模型在预测由轴和角度定义的旋转时显著优于微调后的 Gemma-4 通用模型,且无需显式坐标系即可改善 2D 表示的角度估计。研究还发现,可识别物体并未提升角度检测准确率,具有显著线性特征的物体反而表现更好。
研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。
研究对比 Laya、Jev 和 Qwen2.5-7B-Instruct 在候选集与任务变化下的拒绝策略迁移表现,发现源域校准常无法保持目标工作点:在 DBpedia 上校准的 Jev 策略会拒绝 69.3% 的 Emotion 测试输入,而 Emotion 策略则完全丧失检测能力。
研究者提出 TradeGrad,一个经验引导的文本梯度框架,用于稳健的量化交易策略优化,通过积累的优化经验估计文本梯度,并对策略探索与精炼进行多尺度修正。该框架还引入 Cross-Period Robust Objective(CPRO),强调在不利历史时期的表现以提升时间稳健性。
研究者发布 CreativePreferences 数据集,包含 2.8M 文本、317M 人类偏好判断,覆盖 7 个创意领域和 42 个基准任务,并用可执行程序、评分标准库和密集训练模型(V、A、VAT)建模这些标签。
研究者提出诊断框架 LUMOS,基于训练语料完全透明的 OLMo 2,追踪 LLM 参数化知识从训练数据曝光到行为输出的因果链。结果显示模型内部对罕见事实的编码可分性达 84%,但行为表达仅 54%,该检索差距随规模扩大而收窄。模型对已训练内容自我反思准确率为 83%,对未见内容降至随机基线 49%,且链式推理提示只会抬高置信度而非改善校准。
BitNest 是一种位嵌套投机解码框架,将低精度草稿模型直接嵌入高精度目标模型的权重表示中,两者共享同一份物理权重,并把渐进精度设计扩展到 KV cache 以支持长上下文推理。
PAPER2LLM++ 是一个让 LLM 从研究论文中持续自我进化的框架,它把论文当作模型改进的证据与监督信号,而非仅用于检索的知识。对每篇新论文,它提取有证据支撑的发现,检验所报告的局限是否仍存在于当前模型,必要时转化为候选学习信号,并通过 try-evaluate-commit 流程仅在提升目标行为且不显著遗忘或损害通用能力时才提交更新。
研究者提出 GraphMemory,一种轻量级图结构记忆系统,可累积、精炼、组织并连接可复用策略,每次查询只检索相关子图,使模型无需接触全部记忆即可完成在线上下文适配。在有界检索下,检索记忆量随处理样本数增长保持恒定,下游性能与基线相当,同时记忆构建 token 消耗减少约 81-85%。
一篇综述系统梳理了 RAG(检索增强生成)的三大基础组件——检索、生成与增强,涵盖稠密与稀疏检索器、融合策略、嵌入向量优化及基于强化学习的检索策略。文章围绕效率、安全、以用户为中心的交互和复杂推理四条新兴轴线对近期创新进行分类,并回顾了 Naïve RAG、Advanced RAG 和 Modular RAG 等架构变体及评估协议与领域应用进展。
SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。
ReSolve 是一种免训练推理方法,通过选择性生成式审核复用候选推理:当候选答案分歧或无法解析时,调用模型检查已有推导并纳入有界循环。在 130 道竞赛数学题上,ReSolve 在两个独立候选池中分别答对 100 和 99 题,优于同四候选投票的 91 和 92 题,且相比八样本自一致性分别少用 46.3% 和 47.2% 的 token。消融实验显示移除可见推导后准确率从 100 降至 93。
一项研究提出 LLM 叙事框架,将时序 SHAP 证据与历史市场状态类比结合,用于横截面股票收益预测的可解释叙述。在 Qwen3 上的对照实验显示,逐步外化数值与关系推理后,Qwen3-32B-Instruct 的证据忠实度从 0.696 提升至 0.996,时序与关系准确率同步改善。历史类比虽未提升结构化自动忠实度,但获得了更高的人工评分有用性。
研究者提出 JudgeProfile 框架,将 LLM 评判拆解为感知(对清晰度、正确性、细节等属性的比较)与优先级(各属性对最终选择的影响权重)两部分,并构建了含 50,013 对回答、覆盖 17 个公开数据源、21 个 LLM 评判者和 87 个属性的 SubjectiveSet 数据集。
研究者提出 ToolMLBench 工具套件与 SFT+RL 训练流程,让智能体学会在机器学习实验中诊断性地调用工具,并用 SPICE 方法以特权上下文对工具动作概率的改变作为轮级奖励。在 80 个合成任务上训练后,Qwen3-8B 域内成功率从 24.8% 升至 52.4%,Qwen3.5-35B-A3B 从 35.6% 升至 69.2%,后者域外也从 31% 提升到 48%。
研究提出"智能体体验(AX)"是新的 AEO:在 1,056 家真实企业上运行 37,927 次智能体购买旅程后发现,仅 7-10% 的最终答案来自模型训练知识。具备 AX 的企业有 78% 的答案由自家页面构建(对照组 56%),被明确推荐的概率高 1.9 倍;而不可读企业获得有据答案的成本平均高 64%。主要失败并非编造而是遗漏——网页构建的答案缺失买家所需事实的概率高 3.7 倍。
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。