LADE:利用暗知识中的模型无关潜在安全信号防护 LLM
研究者提出 LADE,通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,并借助 tokenizer 映射与 kNN 判别实现模型无关的越狱攻击防御。该方法在多种 LLM 和基准上降低了攻击成功率,同时保持有竞争力的安全-效用权衡。
研究者提出 LADE,通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,并借助 tokenizer 映射与 kNN 判别实现模型无关的越狱攻击防御。该方法在多种 LLM 和基准上降低了攻击成功率,同时保持有竞争力的安全-效用权衡。
研究发现有害合规 SFT 会在 LLM 检查点更新空间中留下连续、与目标相关的排序痕迹,检查点级坐标 s_H 在四个 7-8B 基座模型上与有害目标组成的 Spearman 相关性达 0.986-0.992,且该排序在更大规模模型上依然保持。
Jarvis 是一款能实时参与多人对话的主动式语音智能体,基于事先共享的文档跟进讨论,仅在群体遗漏或说错事实且数轮内未自我纠正时出声干预。它由小型开源权重模型驱动,结合确定性检查,并将每条论断锚定到原文句子。在 CHI-180-proactive 数据集上,Jarvis 对多数干预事件判断正确,且在群体自行解决问题时 97% 的情况下保持沉默;23 人实时研究验证了这一趋势。
多智能体共享成本预算时,统一 Lagrange 乘子只能约束总量、无法决定惩罚如何在各智能体间分摊,为此研究者提出 Lagrangian Responsibility Allocation(LiRA),通过有限训练周期内优化社会福利来学习每个智能体对公共乘子的分摊比例。
研究推导出功耗轨迹无法排除的最大隐藏算力占比 β 的闭式解:在 NVIDIA A100 GPU 上最坏情况 β = 1.16,对抗性等能量策略至少可隐藏 β = 0.41 的算力,说明仅靠模拟功耗测量对算力的约束很弱。若验证方能在观测工况下重新执行申报的工作,β 最多可降至 0.059。
研究者提出一种组合 Thompson 采样(CTS)变体:用 LLM 查询一次臂的分区,经 RBF 核转换为正定相关矩阵 Σ,每轮后验样本按 Σ 采样,而 Beta 后验仍只用真实奖励更新,让 LLM 影响采样器的移动方式而非其信念。
ElasticFit 是一个 VLM 引导的贴合感知 3D 物体插入框架,通过场景锚定的结构化拟合线索,将 VLM 推理转化为显式 3D 约束,支持刚性放置、等比缩放和弹性贴合三种适配模式。在固定资产基线对比中,其空间关系成功率从 50.8% 提升至 69.7%,支撑成功率从 48.3% 提升至 91.7%。该工作已被 NeurIPS 2026 接收。
AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。
针对纵向研究中预测精度与参与者负担的矛盾,研究者提出一种树蒸馏方法,从基于神经网络的 Longitudinal Active Feature Acquisition(LAFA)网络中学习可解释策略。该方法在模拟实验和预测每日饮酒量的 EMA 实证数据集上验证,均能在精度损失极小的前提下显著减少每次采集的条目数量。
研究者提出 BeFOND,一种无编码器的稀疏编码模型,将推理与字典学习统一为共享变分自由能上的自然梯度流,具备闭式推理与学习动态。在合成数据上,BeFOND 提升了字典恢复与稀有特征检测能力,且随叠加程度增加对 amortized 基线的优势扩大;在语言模型激活上,它以更少训练数据超越预训练参考 SAE,特征质量随字典宽度持续提升。
研究者提出深度联合模型 DeepAJM,无需参数假设即可同时建模纵向与生存结局,并通过可部分解释的关联结构将纵向过程与生存风险相连。该模型在心血管疾病 EHR 队列、原发性胆汁性肝硬化(PBC2)数据集和模拟数据集上,与经典参数联合模型、TransformerJM、DA-LSTM 及基于 Cox 的生存模型对比,在 C-index、时间依赖 AUROC 和 AUPRC 上均取得最佳区分度。
WildMatch 提出一种仅用身份标签的弱监督方法,将预训练关键点匹配器适配到野生动物重识别任务,无需关键点级或几何对应标注。该方法用预训练匹配器挖掘图像对,从身份一致性导出弱正负监督,对比微调匹配网络以增强同身份对应、抑制异身份对应。在多个开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。
研究者发布 SEMAADB 数据集与基准,包含 3,000 个工程上下文和 15,000 张图,每个上下文含 Requirement、Block Definition、Activity、State Machine、Sequence 五个相互关联的 SysML 视图,其中 100 个上下文经人工核验构成测试集。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。
针对蛋白质-分子虚拟筛选,研究者提出因果建模方法 CausalBind,通过 V-structure 因果模型和 Heckman 式选择形式化稀疏交互先验,并证明在结构稀疏条件下交互概念可识别。
研究者发布 TC3-VQA 数据集,用于将伤情视觉观察与战术战伤救治(TC3)临床指南相连接。该数据集由公开教学与实战视频及权威 TC3 文档构建,含 581 个条目、11 个概念和 1,860 个问题,覆盖干预识别、教义、临床推理、流程指导及视觉信息不足时的拒答。
研究者推出 Logbook,一个面向小时级音频理解的基准,录音时长从 10 分钟到 6 天,要求系统在给定连续音频和事件标签词表下输出无间隙的分段、标签与描述。团队对比了 52 个端到端与级联系统,并消融微调、上下文长度和推理预算,发现任务可解但最佳系统仍低于人类参考水平,过度分段普遍存在,微调可部分缓解,端到端系统通常优于级联系统但随上下文变长而退化。
研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。
时间序列基础模型(TSFM)常用的 ReVIN 等仿射缩放方法会在反变换后计算损失,使每条序列的梯度被乘以 b^p,导致高尺度序列主导训练,作者称之为尺度污染训练(ScaleCon)。
CG-CTI 将 CAPEv2 沙箱的实时输出转换为 STIX 2.1,并在知识图谱中与其他关键基础设施传感器数据关联,为每个情报对象附加基于来源、跨源印证和观测持续性的显式置信状态。
POLAR 是一个 LLM 驱动的框架,可将厂商公告、漏洞库和威胁情报中的碎片化证据合成为以威胁为中心的评估。它先拆分重叠事件并将威胁锚定到来源证据,再结合严重性指标与按时间排序的利用信号估算近期被利用概率,并将威胁数据关联到权威修复知识以组织缓解措施。在公开资源收集的真实漏洞证据上,POLAR 在异构事件和零日场景中提升了威胁排序与缓解检索效果。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。
SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
研究者提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整派生(血缘)图,并只在请求者对所有涉及列均有权限时才返回命中,从而阻止经由合法计算结果泄露敏感列。
研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。
TIDE 2.0 是一个 MIT 许可的开源引擎,采用可替换识别器与键控匿名器两阶段设计,支持机构本地部署,替代符以密码学生成且不存储关联表,日期按患者做保持间隔的偏移。
RoboCap 是一个 250g、六摄像头、双 IMU 的帽子式设备,用于在真实环境中采集第一人称操作数据,配套的 Grounded API 提供与设备无关的 3D 算法。该平台在公开基准上取得 SOTA 表现,涵盖多场景 SLAM、第一人称深度估计,以及适配第三方设备的手部追踪。
研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。
研究者提出 FACTRIA 框架,将院校分析(IA)中潜在的偏见因素归为分析流程、院校背景、课程特征和人口统计四类,并以此驱动一个生成式 AI 聊天机器人,在用户分析 IA 时提示其反思这些因素。
一篇立场论文提出 SPEAR 框架,将人机智能体对齐重新定义为持续的交互设计问题,而非部署前的优化问题。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。
研究者发布首个可端到端评估 Croissant 元数据提取的基准,含 602 篇论文,其中 102 篇有人工验证的 gold 标注、500 篇为 LLM 生成的 silver 标注,覆盖 Croissant 完整 schema 及 RAI 字段。
研究提出 EDI 约束的图摘要方法 AURORA,将用户偏好建模为加权属性二部图,用贪心粗化算法在合并用户节点时强制满足公平差距(ΔE)、列表内多样性(ILD)和群体包容三项结构约束。
研究者推出 PlaySuite,一个基于 5K 多款开源视频游戏构建的交互式视觉智能基准,覆盖 Pygame、HTML5、Godot 和 Unity 等引擎。该基准配套统一的闭环交互框架和 Video-LLM-as-a-judge 评测协议,并评测了 14 个近期开源模型。结果显示存在明显的感知-行动差距:模型虽推理能力较强,但在空间定位、动作执行和自我纠错上持续失败。
研究者提出 Perturbed Embedding Vector(PEV)攻击,仅向提示词的嵌入向量表示中加入独立高斯噪声,即可越狱六种不同规模的常见开放权重 LLM,在 JailbreakBench 上对所有模型、所有提示词均生成不安全回复。PEV 无需梯度计算、逐提示优化或修改模型内部权重,取得首次成功攻击的平均算力成本比此前方法低至多一个数量级,每个测试模型上首次越狱通常在一分钟内出现。
研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。