DAEDALUS:用自生成任务引导 AI 智能体记忆
DAEDALUS 提出一种无需既有任务或 oracle 验证器、从自生成练习中引导可复用智能体记忆的方法,由生成任务的 explorer 与尝试任务的 solver 配对,将 solver 反复验证成功的启发式规则沉淀为记忆库。
DAEDALUS 提出一种无需既有任务或 oracle 验证器、从自生成练习中引导可复用智能体记忆的方法,由生成任务的 explorer 与尝试任务的 solver 配对,将 solver 反复验证成功的启发式规则沉淀为记忆库。
一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。
研究者为完整十英雄 MOBA(206 个单位、每 tick 全英雄行动、单局最长 6,000 tick)学习结构化多智能体世界模型,仅用 1,400-tick 自由推演想象回合训练策略,再在真实对局中评测。
HMED(Hindsight Meta-Experience Distillation)通过从同一恢复的发现状态重新执行原版与修订版 Meta-Skills,在共享条件下观察修订带来的变化,并将每次对比蒸馏为可复用的 Meta-Experience。
研究提出 PAIR 流水线构建用户条件化应用状态,并推出 RePAIR 训练方法,从跨用户子目标结果差异中学习以提升可靠性。在六款智能体上,用户条件化 UI 中任务成功率下降 6.98 至 15.4 个百分点,涉及用户个人内容时差距扩大至 8.77 至 22.0 个百分点。RePAIR 在未见用户上将整体 Task SR 提升 9.42 个百分点。
研究者提出 Confidence Reasoning Graphs(CRG),一种推理时框架,仅凭单条轨迹即可估计 LLM 智能体完成任务的成功概率,无需模型内部信号或训练数据。CRG 将任务声明分解为基于轨迹证据的子声明,逐项估计置信度后再聚合为整体置信度。在三个智能体基准、三个骨干模型和三个智能体框架上,CRG 的置信度校准与风险感知决策均优于口头表达、采样和白盒代理基线。
SIGMA 是一套数据生成与训练流程,仅凭一份描述模型期望行为的 Model Spec,让模型自身充当任务设计智能体生成对齐困境场景,并通过监督微调与基于 rubric 的强化学习(模型自身作为奖励模型)实现对齐自我改进。
研究者提出 Continuous Memory Machine(CMM),一种在 Continuous Thought Machine(CTM)基础上构建的循环架构,用矩阵值的短期与长期记忆状态承担不同功能,并由 Transformer 联合更新两个记忆存储,实现双向读写。
研究提出信息论分解,将输入歧义、表征损失与读出失配分离,并构建可恢复视图证明完美一致与联合各向同性高斯性可同时与零目标信息共存。基于此提出非自回归框架 CANOPE,在 40,000 条验证序列上,latent-agreement(PL0)与 token-grounded(PL2)池化排名几乎相同,但位置 Recall@1 分别为 13.5% 和 98.8%。
研究将区域多步海表温度(SST)预报建模为条件数值生成,用历史 SST 与异常序列、日期对齐的环境记录和静态海洋知识构成文本上下文,并通过图神经网络生成连续的空间前缀注入 LLM 输入。在南海 SST 预报的十个预测步上,完整配置取得对比方法中最佳 MAE 和 R²。配套的规则模块将预测趋势与环境因子方向匹配知识条目,返回带来源的事后上下文解释。
研究团队提出个性化全量化多目标膳食规划问题(MDP),并开发营养智能体 ShanLiangRen。该系统将饮食规格、营养数据、用户属性与自然语言需求转化为个性化约束规划实例,通过精确检索增强生成缩小候选食材与食谱范围,再由 LLM 在确定性营养计算和约束校验反馈下按 Pareto 原则迭代优化方案。系统输出含明确食材与分量的全量化餐食计划及营养合规报告,已以微信小程序形式上线。
研究者提出"自参照社会偏好"方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测轨迹,从自身视角评估对方结果,再接入标准社会偏好机制。在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中,智能体无需观察他人奖励即可学会合作,甚至在独立学习失败的环境中也能实现合作,且收益分配常比能获取真实奖励的智能体更公平。
WorkflowOps 是一个多智能体工作流编排框架,能从历史工作流中学习智能体协作先验,并按需扩展智能体池以覆盖新能力需求。它通过转移概率矩阵引导 DAG 工作流构建,并用分层语义匹配策略将 LLM 路由调用减少超 80%。在代码、数学与问答混合测试集上,其端到端通过率优于近期工作流构建基线,在结构化可分解任务上提升最大。
RA-MoWE 通过工作流亲和度嵌入对查询聚类,并据此生成可复用的专家工作流。每个嵌入记录一组固定参考工作流对查询的解决效果,从而揭示推理策略上的相似性;嵌入编码器可直接从查询文本预测该嵌入,让新查询无需先执行参考工作流即可选用专家工作流。
DHCG 框架通过 Planner、Worker、Generator 三个模块,从零逐步构建动态分层协作图,并支持提前终止或按需扩展。在代码生成、数学推理等基准上,其平均性能较单智能体基线提升 13.06 分,优于静态与动态 MAS 基线 2.77-8.02 分。该框架还引入动作感知偏好优化训练 Planner,并展现出跨 Planner 主干与未见 Worker 模型的泛化能力。
研究者提出 Agentic SemS,一个面向 AI-RAN 的闭环语义感知框架,通过 profile 条件化因果 Transformer 和 key-value caching 在通信可行配置集内动态控制感知。
STEPGATE 是一种不确定性感知的步骤级交接框架,对本地小语言模型的每个动作打分,将困难步骤选择性升级到更强模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%。
ThinkFuse 是一种免训练的测试时融合框架,通过对比片段级不确定性与轨迹级不确定性趋势来识别不稳定推理点,并将辅助推理路径融合进主模型轨迹。在数学与知识密集型推理基准上,它优于现有基线,跨模型组合均有稳定提升,且主模型更小时仍保持稳健。该方法所需融合触发次数更少、生成 token 更少,代码已开源,论文被 EMNLP 2026 Findings 接收。
一项针对 Llama-3.1-8B-Instruct 的 96,600 条提示词实验显示,当财务信息从 8 项事实减至零时,财务相同但身份不同的两个角色获得的股票配置建议平均差距从 4.78 个百分点升至 10.34 个百分点,比值达 2.16。身份在全披露时仅解释 5% 的配置差异,无披露时升至 96%。无事实时模型还会在理由中引用从未告知的收入、债务和储蓄,且这些虚构财务对大家庭更常转为不利。
一项被 NeurIPS 2026 接收的研究首次系统考察了大语言模型(LLM)中的错觉模式感知,发现 LLM 常比人类更易在随机数据中推断出有意义关联。模型倾向于将频繁出现的正面属性过度关联到多数群体或大型组织,并从模糊事件中构建因果叙事。研究基于稀疏自编码器(SAE)的特征可解释性框架,揭示整体频率感知与分析性认知取向与这类错觉的涌现相关。
OOPMAS 是一个免训练框架,能在单个查询粒度上同时生成智能体集合与协调工作流,智能体以面向对象类定义表示,工作流则表达为可执行 main 函数。在覆盖代码、数学与问答的混合任务基准上,OOPMAS 达到 89.6% 准确率,超出最强基线 18.1 个百分点;跨四个 LLM 基座的模型替换研究显示性能一致扩展,最强模型下达到 92.4%。
针对长时程具身任务中目标不在视野内、状态随前序任务改变的问题,研究者提出 Attacca,用与执行环境解耦的目标图像训练视觉目标条件策略,并通过上下文解耦目标采样、目标掩码预测头和 Search/Approach/Interact 行为阶段条件化来学习当前视角的密集定位。
一项针对三层智能体架构的测量显示,将长上下文推理分解到多个协作智能体可将单次查询的峰值 KV cache 降至 14.3 MiB,而单次推理和检索增强基线分别为 35.5 和 35.3 MiB。
研究对比 Llama-3.1-8B-Instruct 与 Qwen2.5-7B-Instruct 的 8-bit 和 4-bit 量化版本在 20 个确定性工具任务、5 种提示词下的故障恢复表现,发现 8-bit 与 4-bit 的恢复差异会随提示词和评测目标改变方向。
研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。
研究者推出 ST-Bench,用于检验 LLM 多智能体系统(MAS)在真实科学数据分析中是否优于单智能体。该基准含 100 个源自地球科学研究的数据科学任务,扩展为 2,067 条查询,在 GPT-5 上评测五种 MAS 生成方法。十种 MAS 配置中九种超过最便宜的单智能体基线,最强配置综合得分接近其三倍,但推理时间约为四倍;更经济的方案以不到两倍成本获得大部分收益。
研究者提出 VisualNoiseQA,一个面向噪声视觉反馈下主动推理的基准:纯文本 LLM 需通过迭代查询一个固定的现成 VLM(视为随机视觉传感器)来解答 VQA 问题,每次查询多次采样并以自一致性给出经验不确定性信号,供推理器决定下一步问什么、何时停止。
PERSIST 是一个面向多会话、多说话人语音对话的持久记忆系统,显式建模 Who、What、When,通过 3W 联合打分机制结合语义内容、声学说话人身份与时间状态检索跨会话历史。
研究者提出"隐式负候选发现"方法,用符号规则编码用户行为模式,按支持度、信息量和产品相关性打分排序,再由 LLM 结合业务目标与领域知识解读规则,最终报告融合统计证据与 LLM 解读。在工业 B2B 场景和五个公开推荐数据集上,该方法候选质量精度高于所评估基线,符号选择使工业任务下游测试 PR-AUC 较随机选择提升 12.5%(每正样本四个负样本)。
AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。
研究提出注入真值协议并设置随机准入对照组,检验统计准入闸门是否真正携带信息。在合成与真实校准面板上,闸门在弱信号下能消除虚假发现,但将采纳率压至1–7%,信号强时则毫无增益;基于绝对收益而非超额收益计算的准则会静默拒绝所有候选,包括真实信号。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
EIO-Agents 是一个面向可互操作 AI 智能体评估的开放规范,由语义层 EIO 与记录系统 PER 两层构成。EIO 通过类型化证据、版本化行为谓词、证据契约、声明、见证规则、证明状态与可计算推导,支撑指标、发现、控制及 PASS、REVIEW、BLOCK 决策;PER 则以内容寻址方式保存单次评估的证据到决策链,可重新推导、解释与验证。
研究发现,大语言模型中大规模激活的出现由 spike FFN 输入嵌入中的单个通道控制,该通道位置对特定 LLM 固定,被命名为 massive activation gating channel(MAGC)。
研究将 LLM 多智能体系统(MAS)的防御组织为五项原则并实现为 DEFER1,包含 28 项检查的级联,能拦截的拦截、其余交给四人评审团。在四个领域的独立测试中,攻击成功率从约 30.0% 降至约 3.0%,78% 被拦截的攻击由确定性检查处理。安全运营领域仅四分之一提案会到达评审团,但风险评分审批门会错误放行多数攻击提案、却只放行少数合法提案。
研究采用心理学 Relational Match-to-Sample(RMTS)范式并结合机制分析,在 GPT、Claude、Gemini 及 Qwen3.5、Gemma-4、InternVL3 上发现能力层级、模型规模、场景物体数量和逐物体刺激噪声四项因素共同推动 VLM 呈现类人"关系转换"轨迹。
研究者提出一种用于下棋的符号子策略模型,借助归纳逻辑编程系统 PAL 学习到的模式,将国际象棋战术的领域知识引入模型以提升可解释性。团队提出一种散度指标,将模型与随机基线对比,得到一组能给出接近人类初学者棋力的战术。他们还提出通过为现成引擎增补该模型的计算评估方案。
研究者提出一种类似人类认知的方法,训练 RL 智能体将学到的策略与策略网络合成为基于对局动作序列的可执行程序,并自动学习这类程序来下国际象棋和求解网格环境任务。实验显示,学到的策略能产生有效动作,且可从对局数据中学习。
研究提出"实验性模型类修正"框架,让发现策略同时提出结构编辑和诊断实验,以检验该编辑是否必要。在 400 个受控动力学环境中,联合策略以 32 次真实实验预算达到 89.5% 精确恢复率,较最强匹配基线提升 10.0 个百分点,且所需实验与候选拟合更少。当真实机制超出编辑语法时,该方法在 88% 的情况下检测到库不足,误支持率为 5.5%。
研究评估了一种"先探索后提交"协议:由大语言模型提出假设、程序化规划器采集测量数据,再用新提示词从固定观测中合成最终定律。