SENSE:状态感知的情绪导航叙事生成引擎
SENSE 是一个状态感知框架,用于生成可玩的分支视觉小说并支持多轨情绪导航。它整合了名为 MIND 的状态化叙事架构、结构分析器和路径感知上下文管理模块,可从少量高层输入生成多条交叉路线,同时保持角色一致性与叙事因果性。基于 LLM 评判、情感指标和视觉评估的结果显示,SENSE 在叙事多样性和素材整合稳健性上优于基线,初步人类试验显示情绪保真度有方向性提升,娱乐性相当。
SENSE 是一个状态感知框架,用于生成可玩的分支视觉小说并支持多轨情绪导航。它整合了名为 MIND 的状态化叙事架构、结构分析器和路径感知上下文管理模块,可从少量高层输入生成多条交叉路线,同时保持角色一致性与叙事因果性。基于 LLM 评判、情感指标和视觉评估的结果显示,SENSE 在叙事多样性和素材整合稳健性上优于基线,初步人类试验显示情绪保真度有方向性提升,娱乐性相当。
SWORD 是一个联合优化多智能体工作流拓扑与自然语言提示词的框架,仅依靠标量任务指标引导,无需领域初始化或任务特定工程。在相同骨干模型的受控对比下,SWORD 相较仅提示词、仅工作流及分阶段优化基线均取得统计显著提升,并在使用更小骨干模型、更少训练数据和每数据集 4–6 美元 API 成本的情况下,准确率超过最强的已发表领域专用基线。
研究发现,安全对齐但被植入后门的教师模型可通过 on-policy distillation(OPD)将隐藏恶意行为传给原本干净的学生模型,3% 投毒率下攻击成功率(ASR)最高达 70%。
研究团队推出 SMART 系统,并构建了关节感知仿真平台 SMART-Sim,合成出包含超 100 万条演示、覆盖 44 种原子任务类型、5 种机器人配置和 2,507 个关节物体的 SMART-Data 数据集。基于该数据预训练的 VLA 模型在仿真基准上表现有竞争力,并实现零样本 sim-to-real 迁移,在真实世界关节物体操作任务中展现出可扩展性能。
研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。
研究者提出免训练的 KV cache 驱逐方法 LORE-KV,通过从冻结目标模型采样短自回归续写、用其响应侧 query 状态估计 prompt token 效用,把固定预算的未来感知驱逐建模为分布估计。
研究者提出 Stateless Language Agents(SLAs),核心是"有状态搜索、无状态智能体":智能体不跨调用保留对话,由 harness 持有研究状态并为每次调用重建角色专属上下文。
研究提出线性适应度子空间(LFS)假设,认为突变引起的残基级表示变化中存在一组紧凑的、测定特异的方向,使适应度变化可从少量标注变体中线性获取。基于此提出的子空间引导进化搜索(SGES)在 10 个核心 ProteinGym 测定、87 个扩展静态验证测定和 18 个测定预算搜索评估中,适应度预测与搜索效率均优于零样本 PLM 及近期 ML 引导的蛋白质优化基线。
研究提出选择性情感层微调框架 SALFT,用于视频 Vision Transformer 的玩家唤醒度识别,通过层参数 L2-norm 变化筛选微调层,仅更新约 8% 参数(减少超 92%)。
研究者提出将潜在空间扰动建模为对世界模型所学潜在动力学的扰动,通过动力学感知相似度度量与分布外检测构建合理潜在动力学集合,并用共形预测校准不确定性集,再以博弈论优化联合求解鲁棒动作与最坏情况扰动。在 Franka 机械臂硬件实验中,该方法使安全过滤失败率降低 70%、基于采样的策略引导失败率降低 54%。
研究者提出循环回环 Transformer(RLT),将层拆分为并行因果编码器与循环解码器,解码器每步融合编码器输出与上一 token 的最终解码状态,使计算路径随序列长度增长而单 token 成本固定。
研究团队在 GraphCast 上训练稀疏自编码器(SAE),发现该模型将大气河强度(以 IVT 衡量)作为稳定的内部变量进行计算,尽管 IVT 既非输入也非预测目标。
OpenSplatGraph 是一个统一框架,可直接从在线高斯开放词汇语义地图构建持久 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件下的物体提取。提取的物体实例关联持久图节点,支持属性与关系跨观测和查询增量更新,兼顾语言引导的物体定位与结构化关系推理。该工作已被 ACCV 2026 接收,在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的表现。
互补特征域(CFD)理论指出,Shannon 信息保留并不意味着预测贡献系统被保留:可逆表示变换可在目标信息不变的情况下改变受限决策族下的预测贡献。研究用 CFD 贡献缺陷量化受控重编码下的上下文贡献变化,并证明在有界 Lipschitz 效用下,每个上下文贡献缺陷受相应联盟不相容性之和约束。
研究者提出描述 GFlowNets 混合的通用理论框架,分为连续索引(CI)与离散索引(DI)两类。
研究者提出 Physics-Guided Visual Prompting(PG-VP),一种即插即用多模态感知模块,让冻结的 VLA 模型通过叠加随帧移动的虚拟障碍物绕开 RGB 相机不可见的辐射与热源,无需重新训练。
研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器开发。
研究者提出数据中心化框架 GRADE(GRadient-Aligned Data-centric rEcipe),通过状态感知采样器持续准入与多任务梯度场对齐的样本,并用自校准步级门控拒绝接近饱和时可能造成破坏性覆盖的更新。在三种当前代骨干模型和七个异构指令数据集上,GRADE 在准确率与鲁棒性上优于强数据选择和 PEFT 稳定化基线,是唯一在每个架构上都稳定优于标准 LoRA 的方法。
研究提出用基础模型(FM)提升多智能体强化学习(MARL)在无线随机接入(RA)网络优化中的效率,设计了基于共识的去中心化 MARL 架构下的 FM 辅助 actor-critic 算法。收敛性分析表明,该算法在局部奖励交换与非线性价值函数近似下,达到与传统 MARL 相同的收敛阶数。数值结果显示该方法显著提升了 RA 网络优化的 MARL 速度。
研究用多个不同基础模型构建异构社交网络模拟,发现智能体获得的互动量更多取决于其基础模型而非被分配的人格。当混合的模型数量增加时,基础模型的吸引或排斥效应显著增强,暗示网络动态在大规模下可能收敛于基础模型效应。内容中介分析显示基础模型跨语境具有可预测性,且模型的词汇模式与互动最大化风格存在关联。
研究者提出 LADE,通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,并借助 tokenizer 映射与 kNN 判别实现模型无关的越狱攻击防御。该方法在多种 LLM 和基准上降低了攻击成功率,同时保持有竞争力的安全-效用权衡。
研究发现有害合规 SFT 会在 LLM 检查点更新空间中留下连续、与目标相关的排序痕迹,检查点级坐标 s_H 在四个 7-8B 基座模型上与有害目标组成的 Spearman 相关性达 0.986-0.992,且该排序在更大规模模型上依然保持。
Jarvis 是一款能实时参与多人对话的主动式语音智能体,基于事先共享的文档跟进讨论,仅在群体遗漏或说错事实且数轮内未自我纠正时出声干预。它由小型开源权重模型驱动,结合确定性检查,并将每条论断锚定到原文句子。在 CHI-180-proactive 数据集上,Jarvis 对多数干预事件判断正确,且在群体自行解决问题时 97% 的情况下保持沉默;23 人实时研究验证了这一趋势。
多智能体共享成本预算时,统一 Lagrange 乘子只能约束总量、无法决定惩罚如何在各智能体间分摊,为此研究者提出 Lagrangian Responsibility Allocation(LiRA),通过有限训练周期内优化社会福利来学习每个智能体对公共乘子的分摊比例。
研究推导出功耗轨迹无法排除的最大隐藏算力占比 β 的闭式解:在 NVIDIA A100 GPU 上最坏情况 β = 1.16,对抗性等能量策略至少可隐藏 β = 0.41 的算力,说明仅靠模拟功耗测量对算力的约束很弱。若验证方能在观测工况下重新执行申报的工作,β 最多可降至 0.059。
研究者提出一种组合 Thompson 采样(CTS)变体:用 LLM 查询一次臂的分区,经 RBF 核转换为正定相关矩阵 Σ,每轮后验样本按 Σ 采样,而 Beta 后验仍只用真实奖励更新,让 LLM 影响采样器的移动方式而非其信念。
ElasticFit 是一个 VLM 引导的贴合感知 3D 物体插入框架,通过场景锚定的结构化拟合线索,将 VLM 推理转化为显式 3D 约束,支持刚性放置、等比缩放和弹性贴合三种适配模式。在固定资产基线对比中,其空间关系成功率从 50.8% 提升至 69.7%,支撑成功率从 48.3% 提升至 91.7%。该工作已被 NeurIPS 2026 接收。
AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。
针对纵向研究中预测精度与参与者负担的矛盾,研究者提出一种树蒸馏方法,从基于神经网络的 Longitudinal Active Feature Acquisition(LAFA)网络中学习可解释策略。该方法在模拟实验和预测每日饮酒量的 EMA 实证数据集上验证,均能在精度损失极小的前提下显著减少每次采集的条目数量。
研究者提出 BeFOND,一种无编码器的稀疏编码模型,将推理与字典学习统一为共享变分自由能上的自然梯度流,具备闭式推理与学习动态。在合成数据上,BeFOND 提升了字典恢复与稀有特征检测能力,且随叠加程度增加对 amortized 基线的优势扩大;在语言模型激活上,它以更少训练数据超越预训练参考 SAE,特征质量随字典宽度持续提升。
研究者提出深度联合模型 DeepAJM,无需参数假设即可同时建模纵向与生存结局,并通过可部分解释的关联结构将纵向过程与生存风险相连。该模型在心血管疾病 EHR 队列、原发性胆汁性肝硬化(PBC2)数据集和模拟数据集上,与经典参数联合模型、TransformerJM、DA-LSTM 及基于 Cox 的生存模型对比,在 C-index、时间依赖 AUROC 和 AUPRC 上均取得最佳区分度。
WildMatch 提出一种仅用身份标签的弱监督方法,将预训练关键点匹配器适配到野生动物重识别任务,无需关键点级或几何对应标注。该方法用预训练匹配器挖掘图像对,从身份一致性导出弱正负监督,对比微调匹配网络以增强同身份对应、抑制异身份对应。在多个开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。
研究者发布 SEMAADB 数据集与基准,包含 3,000 个工程上下文和 15,000 张图,每个上下文含 Requirement、Block Definition、Activity、State Machine、Sequence 五个相互关联的 SysML 视图,其中 100 个上下文经人工核验构成测试集。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。
针对蛋白质-分子虚拟筛选,研究者提出因果建模方法 CausalBind,通过 V-structure 因果模型和 Heckman 式选择形式化稀疏交互先验,并证明在结构稀疏条件下交互概念可识别。
研究者发布 TC3-VQA 数据集,用于将伤情视觉观察与战术战伤救治(TC3)临床指南相连接。该数据集由公开教学与实战视频及权威 TC3 文档构建,含 581 个条目、11 个概念和 1,860 个问题,覆盖干预识别、教义、临床推理、流程指导及视觉信息不足时的拒答。
研究者推出 Logbook,一个面向小时级音频理解的基准,录音时长从 10 分钟到 6 天,要求系统在给定连续音频和事件标签词表下输出无间隙的分段、标签与描述。团队对比了 52 个端到端与级联系统,并消融微调、上下文长度和推理预算,发现任务可解但最佳系统仍低于人类参考水平,过度分段普遍存在,微调可部分缓解,端到端系统通常优于级联系统但随上下文变长而退化。
研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。