ParanoiaEval:评测智能体编程中不必要的防御性工作
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
研究者推出 ParanoiaEval,首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
研究者提出并行预测世界模型(PPWM),可并行预测有限时程轨迹,同时保留未来表示之间的因果交互,从而去除自回归 rollout 中逐状态解码反馈路径。在四项视觉控制任务上,PPWM 取得最低的长时程预测误差和最高的 CEM 模拟器成功率,CEM 规划速度平均超过自回归 LeWM 基线 3 倍以上。
Recursive Game Creator 是一个面向体验的智能体游戏开发框架,通过 Designer、Builder、Player、Reviewer 四个组件构成递归开发闭环,将游戏原型迭代为可玩性更高的成品。
MINDSET 是一种将对话存为不可变 episode、并通过最小能量状态转移组织成版本化 schema 的记忆控制器,每个新 episode 可强化、取代、拆分或新建 schema。
研究者提出 Adaptive Power Sampling(APS),一种无需训练的 LLM 推理采样方法,按查询动态调整锐化指数,依据答案一致性与模型自奖励的关系在测试时逐查询设定。在 MATH500、HumanEval 和 GPQA 等推理任务上,APS 一致优于固定锐化指数的 power sampling,且无需额外训练。
AnyBottle 提出一种构建紧凑、任务专用概念瓶颈模型(CBM)的方法,仅需冻结骨干网络和无监督概念池(如稀疏自编码器),由黑盒教师模型引导逐轮筛选概念,候选限定在师生分歧区域。
研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
研究者提出柱面测地线流匹配(cylindrical geodesic flow matching),用于成对心血管波形的准周期生理信号变换。该方法用相位—振幅柱面上的闭式测地线替代流匹配中的标准仿射路径,消除插值时的振幅与瞬时频率失真,并将每个训练对转化为稠密的速度监督。
AssemState 是一个零样本家具装配框架,通过锚点引导的边界装配状态将手册页面分解为单部件操作并恢复装配树,再用迭代后状态反馈精修引导 SE(3) 位姿更新与修正,并通过仿真释放测试验证物理合理性。
研究者提出 EMHO,一种在具身模型冻结的前提下,通过分析执行轨迹与历史 Harness 记录来自我迭代优化 Harness 的框架,并配套 EMHO-Merge 以用单套 Harness 支持多子任务。在 EmbodiedBench 的导航与操作任务上,EMHO 持续提升 Qwen 9B 和 27B 的任务成功率。
开源工具包 Transect 发布,基于 Inspect Scout 构建,用于分析长周期 LLM 智能体评测记录。它通过可复用的评测族配置指定任务上下文与行为词汇,将事件、token 用量、子智能体活动和模型生成的行为标签对齐到统一的回合时间线上,支持标签溯源与数据表导出。
一篇 arXiv 综述提出面向海事系统的可解释故障预测与预防概念架构,将数据采集、时间序列预测、异常检测、风险评估、决策与可解释 AI 整合为闭环框架,以支持自主或人在回路的纠正措施。文章结合该架构回顾相关海事研究的方法、优势与局限,并指出不确定性、鲁棒性、模型泛化、可解释性、海事数据集稀缺及部署等挑战与未来方向。
针对黑盒 LLM 个性化中用户专属评分头导致参数量随用户数线性增长的问题,研究者提出 Mixture-of-Facets(MoF)框架,将用户偏好建模为共享潜在偏好分面的组合,通过历史条件路由在共享分面头上实现个性化。MoF 无需额外参数更新即可泛化到训练中未见的用户,在多种个性化任务上取得更强性能,同时保持更可扩展、更参数高效的设计。该工作已被 EMNLP 2026 接收。
研究团队完成了庞加莱猜想的 AI 辅助 Lean 4 形式化,项目起步时几何分析方向可复用的形式化基础设施十分有限。他们用数学家编写的证明蓝图配合明确的里程碑陈述来组织工作,使多个智能体可并行推进,并让数学家能定位阻塞点、给出有效数学指导。该工作分析了这一流程背后的人工介入与组织选择,为未来形式化项目提供了可复用基础设施的起点。
MedZERO 是一个面向开放式医学推理的自进化框架,由负责生成前沿医学题目选项的 Examiner 和借助外部知识工具进行多轮循证推理的 Reasoner 组成,并采用受控知识积累机制维护临时探索知识与精选持久知识。
SCOPE 用语言模型规划算子、符号引擎执行数值、编译器渲染证明,在 218 题测试集上以 135M 主干模型通过 191/218(87.6%)。相比之下,7B 的 DeepSeek-Prover-V1.5-RL 仅通过 18/218,且消耗 27.5 倍 token 与 37.5 倍耗时;DeepSeek-Prover-V2-7B 在双向对偶测试集上通过为零。
针对预训练表格基础模型(TFM)是否采用固定权重解释上下文学习,研究者提出两种仅依赖标准化标签预测的认证方法,可排除固定权重预测和独立非线性标签变换之和两种解释。在评估的五个公开 TFM 上,认证结果显示改变一个上下文标签会改变其他标签对预测的影响,即"联合处理",且该行为随训练出现,注意力分数承载了大部分测得的交互。
针对 O-LoRA 等正交投影方法在 LLM 持续学习中引发的"正交性困境",研究者提出免回放方法 CoDe-LoRA,将学习过程解耦为通用知识巩固与任务专属知识分离,并借助自适应零空间投影与语义路由平衡知识积累和任务适配。在四个骨干模型和三个持续学习基准上,CoDe-LoRA 取得最佳平均准确率,论文已被 EMNLP 2026 主会接收,代码已开源。
zkLLMPoT 是一个零知识框架,通过前向评估而非验证优化轨迹来证明训练后检查点的审计属性,认证成本与训练迭代次数无关。该框架分两阶段:训练方固定架构并提交权重,审计方选择挑战序列后,训练方证明模型在这些序列上的目标值。在四类模型家族上,1.1-1.5B 参数模型证明耗时 41-59 秒,13B 模型为 131 秒,序列长度 512 时验证时间低于半秒。
研究者提出 MASC,一个结合构念引导生成、协作精炼、一致性验证与基于记忆修订的多智能体自校准框架,用于心理咨询中保持客户角色扮演的心理一致性。团队同时发布 CRPC-Bench 基准,包含 38 个动机式访谈客户画像及人格与情绪标注,覆盖会话级画像、大五人格与轮次级心理状态、沟通行为和情绪表达。实验显示 MASC 在画像、人格、接受度与轮次级一致性上均优于现有方法,异构配置整体表现最强。
LeanPlan 是首个用 LLM 生成启发式函数并对其可采纳性进行机器校验、从而找到最优规划的系统。它通过智能体循环借助规划器反馈迭代改进领域专用启发式函数及其可采纳性证明,并在 Lean 4 中实现启发式、证明与高效规划器。
研究者提出 Sensor-Language-Action(SLA)建模框架,以语言作为感知与行动之间的语义接口,将多模态传感器观测、自然语言和动作统一在一个模型中。
研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。
研究发现,上下文先验在提升神经到语言解码候选分数的同时,会让残留错误变得更自信。在 MEG-MASC 上,区分修复与残留错误的 AUROC 从初始排名 2-3 时的 0.70 降至排名 21-50 时的 0.39,而排名 20 之后的错误占融合后全部错误的 46.6%。分别读取局部与先验分数可改善选择性解码,解码器在 74.5% 的窗口作答(原为 56.7%),92% 的输出集仍包含正确候选。
研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则或策略更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。
LogiKEy 方法论以经典高阶逻辑(HOL)作为通用元逻辑,将经典与非经典对象逻辑通过语义嵌入编码,使 Isabelle/HOL 等单一证明助手成为学生学习、实验和比较多种逻辑的统一环境。
研究者提出 Local-First Heuristic Evolution(LFHE),一种表示驱动的重连框架,其候选发现与打分仅使用 ego-neighborhood 和 friend-of-friend(FoF)信息,用于去中心化学习中的有界局部拓扑搜索。
研究用107组镁合金挤压条件(14种合金)的数据,比较传统晶粒与织构统计、预训练图像编码器视觉嵌入和晶粒网络图神经网络三种描述符,反推合金成分与工艺参数。5折交叉验证下,传统描述符对留出条件识别正确合金的准确率为65%,而随机猜最常见合金仅17%,学习嵌入低于30%;微观结构可将温度误差较仅用成分大致减半。
研究者提出 Predicting Intention of Partner(PIP),用 Joint-view VAE 将双方局部观测的并集蒸馏为仅凭自身观测即可获得的伙伴表征,并用伙伴状态信念网络从交互历史推断伙伴的隐藏位置与行为倾向。
研究者提出 Test-Time Agent Evolution 方法,通过 Test-Time Memory Evolution 从既往案例检索可复用经验并适配当前事实与程序语境,再经 Rubric-Aligned Collaboration 按行为与程序要求校验修正各角色行动,实现跨角色协同决策。
ChartBmkAgent 能从稀疏的错误分类规范出发,通过中央 harness 治理多个专用智能体,构建完整的 Chart QA 诊断样本,并要求每个阶段提供与原始错误类别对齐的证据。
研究者推出 DSV-Mem 基准,用于评估 MLLM 智能体的密集有状态视觉记忆,包含专家审核场景和 1000 道题,覆盖 Current State、Past State、Derived State、Change History、Conflict/Refusal 五类。
研究提出多智能体系统的"执行一致性"定义,通过状态使用、信息交接和最终状态一致性等职责判断任务是否被满足。受控移除回执、动作依赖等证据后,82.4% 的对立标签对无法区分,恢复后 97.9% 可分离。基于 CAVERT 框架从日志提取关系并应用该标准,在全部 12 个基准执行器设置中诊断表现优于契约提示 LLM 和规则基线,并在四个环境中优于规则引导恢复。
QRAKEN 是一个免训练、本体无关的神经符号流水线,通过离线蒸馏生成的 TTQL(含多跳模式、条件频率与路径条件字面量示例)引导 LLM 生成 SPARQL 查询。
POLAR 是一个面向小型工具调用智能体的护栏框架,通过结构化双层本体评估动作可逆性,为每个动作生成分级可逆性分数,未达阈值的调用会在执行前被剪枝。在 τ²-bench 上对六种智能体模型评测,POLAR 使其中四个模型在 airline 域的平均任务奖励提升 0.11 至 0.18 分,但十八个模型—领域组合中仅八个整体改善,retail 域及更强模型常出现回退。
研究提出 Self-Retrospection Distillation(SRD),将智能体完成轨迹后的事后经验蒸馏为同一策略在交互前的预见预测,该预见仅作训练目标、推理时无需显式生成。
研究者推出 SPEEDRUNBENCH,一个覆盖 9 款游戏、评估前沿 LLM 智能体策略形成能力的基准,要求智能体反复改进策略、反思表现并长程推理,以不断超越自己和他人。实验显示,前沿智能体在简单平台跳跃游戏中接近人类世界纪录,但在更长、更复杂的游戏上受实际预算限制仍落后于人类。该基准因几乎总存在更快的通关时间而具备抗饱和特性。