DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
CrystalJev 将冻结的原子间势模型当作快速决策者,对未弛豫结构单次前向查询即可输出带校准概率的"稳定"判断,成本仅为弛豫计算的约三十分之一。在 65 个 Matbench Discovery 模型上,该方法用价值信息理论只在决策可能改变处调用慢速计算,并同样回答电子、力学与分子问题。
研究者提出 IAU-FOA,一种结合视觉不变性增强与自适应非平衡最优传输的定向对抗攻击方法,通过在全局与局部 patch 层面同时对齐对抗样本和目标样本,提升对闭源 MLLM 的可迁移性。
APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。
研究测量小语言模型仅凭判决结果后训练时的证据恢复能力,在 ContractNLI 上人类证据跨度留至评估阶段。纯标签训练达到准确率 0.896、跨度 F1 0.564,逐字引用率从 0.597 升至 0.729;拒绝采样达到 0.797 和 0.556,逐字引用率升至 0.701。两种方法都能在无人标注证据的情况下改善证据质量,但单一语料单一种子尚无法判定哪种更优。
研究者提出一种通过行为克隆训练的 System-1 决策算子,默认版本仅用 330K 参数即匹配 1.33M 参数的强化学习算子,并将 3,685-token 的推理压缩为 6-token 决策且不损失准确率。
AttSVD 提出一种免训练的低秩 KV Cache 压缩方法,通过对每个提示词自身的注意力几何做在线截断 SVD,只保留注意力真正读取的方向,将每头持久 KV 内存按保留秩成比例削减。
研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。
针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。
研究者提出零样本可视化(ZSV)任务,用户用自然语言指定概念,文档被映射到对应概念轴上以便可视化探索。团队建立基准,对比嵌入相似度、直接语义判断和条件似然估计三类方法,发现基于 next-token 概率的打分在语义忠实度、分数保真度和计算成本间取得最佳实用权衡。研究还发现分级轴配合二元相关性过滤的设计要点,并揭示离题文档中存在组合式情感偏差。
针对工业控制系统中 APT 与 MTD 随机博弈的均衡计算难题,研究者提出动态低秩均衡计算(DLR-NE),通过逐迭代扩展秩 r 搜索空间、正则化核心矩阵谱并经截断 SVD 回缩,每步提取 Nash 均衡。
研究提出预算自适应神经算子求解框架,用全局 Fourier 神经算子推进全场、局部算子提出分块残差修正,并由 set-aware 选择器决定精修位置,宏观策略决定何时花掉剩余精修预算。
一项对比综述评估了 13 种建筑热需求短期预测混合模型,基于苏格兰家庭历史热需求与天气预报数据,EMD-LSTM-Markov 对次日供暖和热水(DHW)功率曲线预测精度最高,但会低估高功率峰值。SVM-SA 与 RF-ISSA-LSTM 则倾向预测平滑曲线,同样低估多数功率峰值。
研究将 Random Forest + XGBoost + Logistic Regression 集成做中智学分解,在 CWRU 和 JNU 两个轴承基准(600-1000 rpm)上以留一工况协议评估 T-hat、F-hat、预测熵 I1-hat 与决策分歧 I2-hat 四项指标。
一篇 arXiv 论文提出在固定物理域、明确实验目录、传感器不确定性和采集预算下形式化"定律还原"问题,用率失真逆定理区分描述定律所需信息与仪器可揭示的信息。
研究系统评估了 10 个推理模型在 LLM-as-a-Judge 中的设计选择影响,涵盖句子情感与毒性评分(每类超 500 条)及问答对二元准确率分类(n=600)两项任务。
研究团队基于英国门诊肿瘤语料(290,026 份笔记、21,564 名肺癌与头颈癌患者)开发了肿瘤专用 BERT 编码器 OncoNoteBERT,采用肿瘤 WordPiece 分词器从零训练。
多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其所教学生在所有原型上平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究显示,其训练出的教师模型在 79.6% 的成对比较中优于基座模型。
研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。
研究基于 TRACE 公开语料库的 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示边界前历史对压缩后损害的预测能力很弱,最佳扩展协议触发器在留出集上 AUROC 仅 0.66,而同一边界复现为 0.72;最佳冻结可解释触发器避开 21% 有害边界,同时保留 84% 的压缩机会。
研究者推出 WorldSolver 基准,包含 168 个源自 61 篇经典计算机图形学论文的仿真任务,覆盖 7 个物理领域,要求 LLM 智能体补全求解器代码。评测从执行检查、视觉保真度和物理合理性三个维度展开,GPT-5.6-Sol 与 Claude-Opus-5 表现相对最好,总分仅为 48.7% 和 46.7%。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。
研究团队提出 ScienceClaw,将 AI-for-Science 智能体的自进化形式化为固定参数的程序自进化,统一任务求解、科学验证与程序更新。配套的 ScienceClaw-Eval 覆盖 23 个学科,通过顺序任务流与独立重置评测衡量科学正确性、进化增益、保持能力、跨数据集迁移和进化成本。
两个 PersonaPlex-7B 实例在共享时钟上交换音频 token 进行无脚本对话,其轮次交接时序呈现耦合,但换手明显偏晚,中位数为 400-560 ms,而人类为 137 ms。在伙伴轮次最后 120 ms 内,人类约十分之一的交接发生于此,而模型仅占 1%。延迟单向通道会使响应一比一平移,且响应前的准备期为空,表明模型是在感知到对方结束后的被动等待,而非人类时序所需的轮末预判。
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
研究者提出并行预测世界模型(PPWM),可并行预测有限时程轨迹,同时保留未来表示之间的因果交互,从而去除自回归 rollout 中逐状态解码反馈路径。在四项视觉控制任务上,PPWM 取得最低的长时程预测误差和最高的 CEM 模拟器成功率,CEM 规划速度平均超过自回归 LeWM 基线 3 倍以上。
Recursive Game Creator 是一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件构成递归开发闭环,将游戏原型迭代为可玩性更高的成品。
MINDSET 是一种将对话存为不可变 episode、并通过最小能量状态转移组织成版本化 schema 的记忆控制器,每个新 episode 可强化、取代、拆分或新建 schema。
研究者提出 Adaptive Power Sampling(APS),一种无需训练的 LLM 推理采样方法,按查询动态调整锐化指数,依据答案一致性与模型自奖励的关系在测试时逐查询设定。在 MATH500、HumanEval 和 GPQA 等推理任务上,APS 一致优于固定锐化指数的 power sampling,且无需额外训练。
AnyBottle 提出一种构建紧凑、任务专用概念瓶颈模型(CBM)的方法,仅需冻结骨干网络和无监督概念池(如稀疏自编码器),由黑盒教师模型引导逐轮筛选概念,候选限定在师生分歧区域。
研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
研究者提出柱面测地线流匹配(cylindrical geodesic flow matching),用于成对心血管波形的准周期生理信号变换。该方法用相位—振幅柱面上的闭式测地线替代流匹配中的标准仿射路径,消除插值时的振幅与瞬时频率失真,并将每个训练对转化为稠密的速度监督。
AssemState 是一个零样本家具装配框架,通过锚点引导的边界装配状态将手册页面分解为单部件操作并恢复装配树,再用迭代后状态反馈精修引导 SE(3) 位姿更新与修正,并通过仿真释放测试验证物理合理性。
研究者提出 EMHO,一种在具身模型冻结的前提下,通过分析执行轨迹与历史 Harness 记录来自我迭代优化 Harness 的框架,并配套 EMHO-Merge 以用单套 Harness 支持多子任务。在 EmbodiedBench 的导航与操作任务上,EMHO 持续提升 Qwen 9B 和 27B 的任务成功率。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
一篇 arXiv 综述提出面向海事系统的可解释故障预测与预防概念架构,将数据采集、时间序列预测、异常检测、风险评估、决策与可解释 AI 整合为闭环框架,以支持自主或人在回路的纠正措施。文章结合该架构回顾相关海事研究的方法、优势与局限,并指出不确定性、鲁棒性、模型泛化、可解释性、海事数据集稀缺及部署等挑战与未来方向。
针对黑盒 LLM 个性化中用户专属评分头导致参数量随用户数线性增长的问题,研究者提出 Mixture-of-Facets(MoF)框架,将用户偏好建模为共享潜在偏好分面的组合,通过历史条件路由在共享分面头上实现个性化。MoF 无需额外参数更新即可泛化到训练中未见的用户,在多种个性化任务上取得更强性能,同时保持更可扩展、更参数高效的设计。该工作已被 EMNLP 2026 接收。