Agentic Semantic Sensing:面向资源自适应 AI-RAN 的闭环语义感知框架
研究者提出 Agentic SemS,一个面向 AI-RAN 的闭环语义感知框架,通过 profile 条件化因果 Transformer 和 key-value caching 在通信可行配置集内动态控制感知。
研究者提出 Agentic SemS,一个面向 AI-RAN 的闭环语义感知框架,通过 profile 条件化因果 Transformer 和 key-value caching 在通信可行配置集内动态控制感知。
STEPGATE 是一种不确定性感知的步骤级交接框架,对本地小语言模型的每个动作打分,将困难步骤选择性升级到更强模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%。
ThinkFuse 是一种免训练的测试时融合框架,通过对比片段级不确定性与轨迹级不确定性趋势来识别不稳定推理点,并将辅助推理路径融合进主模型轨迹。在数学与知识密集型推理基准上,它优于现有基线,跨模型组合均有稳定提升,且主模型更小时仍保持稳健。该方法所需融合触发次数更少、生成 token 更少,代码已开源,论文被 EMNLP 2026 Findings 接收。
一项针对 Llama-3.1-8B-Instruct 的 96,600 条提示词实验显示,当财务信息从 8 项事实减至零时,财务相同但身份不同的两个角色获得的股票配置建议平均差距从 4.78 个百分点升至 10.34 个百分点,比值达 2.16。身份在全披露时仅解释 5% 的配置差异,无披露时升至 96%。无事实时模型还会在理由中引用从未告知的收入、债务和储蓄,且这些虚构财务对大家庭更常转为不利。
一项被 NeurIPS 2026 接收的研究首次系统考察了大语言模型(LLM)中的错觉模式感知,发现 LLM 常比人类更易在随机数据中推断出有意义关联。模型倾向于将频繁出现的正面属性过度关联到多数群体或大型组织,并从模糊事件中构建因果叙事。研究基于稀疏自编码器(SAE)的特征可解释性框架,揭示整体频率感知与分析性认知取向与这类错觉的涌现相关。
OOPMAS 是一个免训练框架,能在单个查询粒度上同时生成智能体集合与协调工作流,智能体以面向对象类定义表示,工作流则表达为可执行 main 函数。在覆盖代码、数学与问答的混合任务基准上,OOPMAS 达到 89.6% 准确率,超出最强基线 18.1 个百分点;跨四个 LLM 基座的模型替换研究显示性能一致扩展,最强模型下达到 92.4%。
针对长时程具身任务中目标不在视野内、状态随前序任务改变的问题,研究者提出 Attacca,用与执行环境解耦的目标图像训练视觉目标条件策略,并通过上下文解耦目标采样、目标掩码预测头和 Search/Approach/Interact 行为阶段条件化来学习当前视角的密集定位。
一项针对三层智能体架构的测量显示,将长上下文推理分解到多个协作智能体可将单次查询的峰值 KV cache 降至 14.3 MiB,而单次推理和检索增强基线分别为 35.5 和 35.3 MiB。
研究对比 Llama-3.1-8B-Instruct 与 Qwen2.5-7B-Instruct 的 8-bit 和 4-bit 量化版本在 20 个确定性工具任务、5 种提示词下的故障恢复表现,发现 8-bit 与 4-bit 的恢复差异会随提示词和评测目标改变方向。
研究者发布开放电信 AI 资源 OTel,包含面向检索、重排序、指令微调与安全/拒答的衍生电信数据集,以及 30 个全参数后训练基线,覆盖 10 个嵌入模型、3 个重排序器和 17 个语言模型。截至 2026 年 5 月 3 日,相关模型下载量超 1600 万次。后训练后嵌入检索达 93.1% NDCG@10,重排序达 0.947 MRR@10,语言模型正确率达 87.8%。
研究者推出 ST-Bench,用于检验 LLM 多智能体系统(MAS)在真实科学数据分析中是否优于单智能体。该基准含 100 个源自地球科学研究的数据科学任务,扩展为 2,067 条查询,在 GPT-5 上评测五种 MAS 生成方法。十种 MAS 配置中九种超过最便宜的单智能体基线,最强配置综合得分接近其三倍,但推理时间约为四倍;更经济的方案以不到两倍成本获得大部分收益。
研究者提出 VisualNoiseQA,一个面向噪声视觉反馈下主动推理的基准:纯文本 LLM 需通过迭代查询一个固定的现成 VLM(视为随机视觉传感器)来解答 VQA 问题,每次查询多次采样并以自一致性给出经验不确定性信号,供推理器决定下一步问什么、何时停止。
PERSIST 是一个面向多会话、多说话人语音对话的持久记忆系统,显式建模 Who、What、When,通过 3W 联合打分机制结合语义内容、声学说话人身份与时间状态检索跨会话历史。
研究者提出"隐式负候选发现"方法,用符号规则编码用户行为模式,按支持度、信息量和产品相关性打分排序,再由 LLM 结合业务目标与领域知识解读规则,最终报告融合统计证据与 LLM 解读。在工业 B2B 场景和五个公开推荐数据集上,该方法候选质量精度高于所评估基线,符号选择使工业任务下游测试 PR-AUC 较随机选择提升 12.5%(每正样本四个负样本)。
AgentMemGate 是一种写入时门控机制,可将提取的陈述分类为推测、已完成事件、更正或其他,阻止未确认的计划进入记忆存储。在 147 组对话的留出集上,Mem0 和 Graphiti 分别将 35.2% 和 27.3% 的未决计划断言为当前状态;AgentMemGate 在核心基准上将污染从 87.5% 降至零,任务准确率从 65% 提升至 95%。
研究提出注入真值协议并设置随机准入对照组,检验统计准入闸门是否真正携带信息。在合成与真实校准面板上,闸门在弱信号下能消除虚假发现,但将采纳率压至1–7%,信号强时则毫无增益;基于绝对收益而非超额收益计算的准则会静默拒绝所有候选,包括真实信号。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
EIO-Agents 是一个面向可互操作 AI 智能体评估的开放规范,由语义层 EIO 与记录系统 PER 两层构成。EIO 通过类型化证据、版本化行为谓词、证据契约、声明、见证规则、证明状态与可计算推导,支撑指标、发现、控制及 PASS、REVIEW、BLOCK 决策;PER 则以内容寻址方式保存单次评估的证据到决策链,可重新推导、解释与验证。
研究发现,大语言模型中大规模激活的出现由 spike FFN 输入嵌入中的单个通道控制,该通道位置对特定 LLM 固定,被命名为 massive activation gating channel(MAGC)。
研究将 LLM 多智能体系统(MAS)的防御组织为五项原则并实现为 DEFER1,包含 28 项检查的级联,能拦截的拦截、其余交给四人评审团。在四个领域的独立测试中,攻击成功率从约 30.0% 降至约 3.0%,78% 被拦截的攻击由确定性检查处理。安全运营领域仅四分之一提案会到达评审团,但风险评分审批门会错误放行多数攻击提案、却只放行少数合法提案。
研究采用心理学 Relational Match-to-Sample(RMTS)范式并结合机制分析,在 GPT、Claude、Gemini 及 Qwen3.5、Gemma-4、InternVL3 上发现能力层级、模型规模、场景物体数量和逐物体刺激噪声四项因素共同推动 VLM 呈现类人"关系转换"轨迹。
研究者提出一种用于下棋的符号子策略模型,借助归纳逻辑编程系统 PAL 学习到的模式,将国际象棋战术的领域知识引入模型以提升可解释性。团队提出一种散度指标,将模型与随机基线对比,得到一组能给出接近人类初学者棋力的战术。他们还提出通过为现成引擎增补该模型的计算评估方案。
研究者提出一种类似人类认知的方法,训练 RL 智能体将学到的策略与策略网络合成为基于对局动作序列的可执行程序,并自动学习这类程序来下国际象棋和求解网格环境任务。实验显示,学到的策略能产生有效动作,且可从对局数据中学习。
研究提出"实验性模型类修正"框架,让发现策略同时提出结构编辑和诊断实验,以检验该编辑是否必要。在 400 个受控动力学环境中,联合策略以 32 次真实实验预算达到 89.5% 精确恢复率,较最强匹配基线提升 10.0 个百分点,且所需实验与候选拟合更少。当真实机制超出编辑语法时,该方法在 88% 的情况下检测到库不足,误支持率为 5.5%。
研究评估了一种"先探索后提交"协议:由大语言模型提出假设、程序化规划器采集测量数据,再用新提示词从固定观测中合成最终定律。
研究者推出 BioStudyBench,用 25 个长周期分析任务评估 AI 智能体能否仅凭公开数据复现 2026 年 7 至 9 月发表的生物医学研究结论,这些研究均晚于被测模型的知识截止时间。
VALSE 是一种按样本、非连续的层跳过方法,用轻量难度估计器从前几层为每个输入打分,再通过逐层门控选择性跳过冗余层,包括任意中间层而保留更深层,只为每个输入激活必要深度。论文同时给出期望 FLOPs 闭式公式、跳层模型函数空间为全层函数空间真子集的证明,以及与 MoE 架构的结构对偶关系,可行性已在原型规模初步验证。
SUTURE 提出一种基于 rollout 组结构的视频时序定位验证方法,将验证条件建立在整组 rollout 上,并证明其可精确分解为标准 IoU 项与由 rollout 组决定的协方差修正项。在五个时序定位 benchmark 上,SUTURE 在所有报告的 IoU 阈值下均提升定位性能,其训练策略在推理轨迹中也表现出更少的视频起点锚定。
研究提出 LSC-DPO,从损失几何视角将 DPO 损失中的 sigmoid 因子视为刻画目标局部敏感度的学习信号,并动态将其调节至目标区间。在 AlpacaEval 2、MT-Bench 和 Anthropic-HH 上,LSC-DPO 持续优于 DPO 及强偏好优化基线。研究还发现不同系数初始化会产生不同的瞬态学习信号轨迹,据此推导出信号预算补偿规则,显著降低跨初始化的性能波动。
研究提出"个人智能体中介推荐"范式:平台推荐器用本地信息排序候选集,个人 LLM 智能体借助用户授权的跨平台历史对排序进行中介,生成最终 top-K 列表。为此推出 MediateRec 基准,并给出 Personal Attribution Mediation Optimization(PAMO)训练方法,通过反事实遮蔽跨平台历史来估计个人中介支持度。
一项基于3D Mitochondria Shape Library光学显微镜数据的实证研究显示,占用体积比参考网格体积平均高3.665%,尽管组内相关系数达0.994。
研究者发布 LOGIC,一个用于航空航天电气设计变更影响分析的 LLM 基准与评估框架,包含 168 个场景(144 个选择案例、24 个弃答案例),让本地部署模型先在确定性候选变更清单中完成意图定位,再经类型化电气追溯图传播。
研究提出交错参与(SP)下的多智能体强化学习设定,即部分智能体先行动并留下对后续智能体有用的信息,形成跨时间、跨智能体的学习依赖。为此提出训练期增强方法 SPL,通过前瞻性获取监督训练早期智能体、以结果监督训练后续接收方。在 60 组 MPE/RWARE 骨干设置对比中,SPL 每次任务完成度均更高,平均提升 14.1%,并扩展至八智能体团队和 Isaac Lab 的 UAV-UGV 环境。
ProbeGuard 是一个认证弃答框架,通过追踪共识形成过程而非仅看最终一致性来判断医疗 LLM 是否应弃答。在 MedQA 上,13.4% 的一致投票是错误的,过程信号将正确与错误共识的区分度从随机水平提升至 0.696 AUROC。该认证规则能以 9.0% 的观测选择性风险回答六成一致层问题,积累域内校准数据后可覆盖九成。
RouteFlow 将可合成分子设计重构为在连续合成路线隐空间中的搜索,每个隐向量可映射回完整合成路线,从本质上保证可合成性。该框架采用奖励引导的流匹配作为采样器,并引入循环一致性机制稳定微调,防止优化偏离真实合成路线流形。在 Therapeutic Data Commons 的 16 项优化任务中,RouteFlow 在可合成性感知基线中取得最佳样本效率、最高合成可及性与最高逆合成成功率。
DeOrch 将多智能体编排中的规划与具体 worker 选择解耦:两阶段规划器先在不依赖 worker 信息的情况下分解任务,再借助池内无 worker 身份的匹配度反馈选择协作操作,从而实现分解与协作的条件化信用分配。
一项系统性研究考察了 LLM 在广告相关性判断中的公平性,测试对象为 GPT-4o 和专为相关性预测训练的 Qwen-7B。研究发现,改变广告主身份或输入语言会改变两个模型的相关性评估,部分人口统计比较还显示出与性别和职业刻板印象一致的模式。研究进一步考察了推理和训练阶段的缓解措施,其效果取决于广告主信息是否与查询相关以及训练数据中广告主标签的分布。
研究团队提出 GroundAct,将物理实体作为 grounding 单元,用轻量 reference token 保持每个被选实体的连续状态可被符号推理寻址,仅由被引用实体与演化方案的交互来修正规划,形成从推理依据到规划动作的显式路径。GroundAct 在开环与闭环评测中均表现良好,覆盖正常、分布外与安全关键场景,闭环结果进一步验证了仿真驾驶能力。
研究提出 SSU-Bench 数据集,用单项提示词编辑或图像编辑构造配对的安全与不安全图文组合,并在三个视觉语言模型间迁移内部状态以测量安全判定变化。结果显示,针对被改动输入位置的干预在解码器较早层有效,而针对最终输入 token 的干预在较晚层才生效;最终 token 状态的线性读出还能预测模型自身判定(包括错误判定),跨模型对比显示反事实变化模式存在相似性。
研究考察了 11 个不同模型家族与参数规模的 LLM 在信息价值判断上的差异,并构建受控 elicitation 模拟,让不同模型在相同信息空间中使用同一选择规则,从而隔离模型判断对顺序信息搜寻的影响。研究刻画了模型特定偏好所导致的广度-深度行为,并分析了交互历史如何改变对候选信息的评估与选择。项目代码、数据与轨迹文件已公开。