大语言模型在时间抽取任务中的多维泛化能力评估
研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。
研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。
语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。
OctLLM 提出用八叉树占用 token 构成的显式 3D 序列来表示几何,并通过随机清空倒数第二层节点、省略其后代得到更短的 S-Octree,用于位置感知的掩码建模生成与 3D 理解。
研究者提出 Sigma,首个大规模(3B/8B)连续扩散语言模型,基于可操控的低维 ODE/SDE 潜轨迹,按块通过似然优化训练,并利用自回归模型预训练权重热启动。
研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。
FiberGeoText(FGT)是一种视觉语言模型,可将超高分辨率扩散 MRI 重建的浅表白质(SWM)短程纤维束组织为群体级聚类,它联合表征每条纤维束的三维轨迹、皮层解剖上下文与形状,并用预训练 LLM 编码多种脑区划分方案生成的文本化皮层端点信息。
针对 LoRA 在持续学习中出现的"谱可塑性崩溃"问题,研究者提出 MuLoRA,通过历史白化与动量更新的近似极正交化,联合控制低秩空间的容量分配与利用。在五个类增量基准、八种增量设置共 16 项指标中,MuLoRA 在其中 15 项取得最高平均准确率。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
研究用欧洲蝙蝠录音构建自然 IPI 与 50-ms 归一化 IPI 两组数据集,微调 EfficientNet-B0 和 PaSST 后发现 IPI 归一化影响因模型而异:PaSST 准确率从 71% 微降至 70%,EfficientNet 则从 47% 升至 57%,PaSST 两种条件下均优于 EfficientNet。
研究用 Mixture-of-Agents(MoA)方法测量单个 token 实际所需的计算量:由 Qwen、OLMo、R1-distilled 三个模型族共十五个不同规模模型逐 token 复现参考序列,以最小成功模型的推理成本作为该 token 的充分算力。
EviDent-CBCT 提出一种证据瓶颈式框架,用于在报告监督不完整的情况下从牙科 CBCT 生成报告:解剖感知网络将每次扫描映射为离散的牙级、全局及 tooth-IAC 证据记录,再由牙科逻辑一致性投影与确定性渲染器配合图像盲本地语言模型生成报告。
HyMLRaman 混合框架结合深度光谱特征提取、生成模型与经典机器学习分类器,可识别阿莫西林、氯霉素、环丙沙星、四环素、布洛芬、对乙酰氨基酚六种药物化合物。
研究者提出 ReRoute 框架,将事实数据与部分机制知识结合,无需受控干预数据即可对预训练骨干模型进行反事实预测。在气候仿真任务中,面对严重 CO₂ 分布偏移,ReRoute 将聚合气候误差降低 18.2-31.8%,同时保持标准条件下的性能,成本仅为用额外受控模拟数据重训练的很小一部分。该构造的因果识别结果已在 Lean 中完成机器验证。
SDECast 是一个基于 Neural SDE 的连续时间概率天气预报框架,通过扩展 SDE Matching 直接在物理空间学习随机动力学,训练时无需反复进行 SDE 模拟。
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。
针对 Classifier-free guidance(CFG)缺乏显式判据、难以判断引导轨迹是否按预期推进的问题,研究者提出 Spectral Correction Guidance,通过将中间状态频谱与扩散前向过程的解析参考频谱对齐来校正采样偏差。
DeepStratNet 将地震层位追踪从稠密语义分割改为有界坐标回归,模型直接预测每个横向位置处目标层位的时间/深度坐标。该框架由兼容任意预训练视觉骨干的轻量回归头与 LSTM 模块组成,用于建模切片间上下文并生成连续层位面,训练采用 L1 与 L2 损失并结合地质先验正则约束相邻道连续性。
一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
研究者提出 Multilingual Distractor Interference(MDI)评测协议,在 TruthfulQA 和 TriviaQA 上对五个指令微调 LLM 进行 40,000 次评测。
研究提出 gamma-CUBV 统一框架,用累积量包络 gamma(lambda) 控制泛化差距的矩生成函数,将 Hoeffding、Bernstein、依赖感知、PAC-Bayesian 与异构源融合等风险界纳入同一体系。
研究评估了 21 个自然可见图(NVG)拓扑指标,用 SHAP、分组 Permutation Importance、Boruta 和 RFE 四种方法经 Consensus Ranking 整合,在 CICIDS2018 数据集与 CNN 分类器上测试。
针对文本到图像生成的免训练安全防护,研究揭示全局不安全假设存在覆盖度与选择性的权衡:紧凑不安全子空间无法覆盖异构的不安全语义,而更广的聚合会扭曲安全邻近的良性提示词。
针对流匹配模型统计泛化保证不足的问题,研究者推导出学习生成分布的有限样本误差界,以 Wasserstein-p 距离度量(p≥1)。在 n 个 i.i.d. 样本下,当维度 d 超过目标测度的 Wasserstein-p 维度时,学习分布以至少 1-ξ 的概率满足误差上界 n^{-1/d}+n^{-1/(2p)}(log(1/ξ))^{1/(2p)}。
研究以保留概率 p 随机保留边的 ReLU 网络逼近 W^{n,∞}([0,1]^d) 单位球,构造出常数深度、规模为 Õ_{n,d}(p^{-9}ε^{-max{d/n,2}} log(1/δ)) 的网络,并以至少 1-δ 的概率保证一致逼近。
TerrainForge 能从重建的多车驾驶片段中生成以道路几何为核心的反事实场景,其统一道路模型将场景形变与四轮车辆动力学相连,使坡顶、坡谷、减速带和摩擦变化传导至车辆运动、相机视角与车间距。
多模态基准 TasteBench 发布,用于可持续蛋白的感官预测,包含基于 215 种植物基食品、21K+ 人类评估构建的食品级排序任务(935 个同类别排序对)和覆盖 15K 风味分子的分子级味觉分类任务。
研究者提出秩感知投机采样(RASS),一种基于秩感知列表耦合的扩散草稿树验证规则,按提议-目标均值位移对草稿候选排序并采样秩权重,以最小化所选提议与目标分布的总变差。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究系统考察了深度序列模型在时间序列共形预测中的三种用法:条件分位数回归、条件分位数函数估计与局部化共形预测。作者给出理论分析,证明这三种方法在适当假设下均具备渐近条件覆盖率保证,并在真实数据集上验证了其有效性。
研究者用语音语言模型自身完整与部分波形的翻译结果构造 prefix 监督,无需转录文本或人工翻译,即可适配端到端同声传译。在 FLEURS 和 CoVoST2 三个翻译方向上,prefix 训练改善了质量—延迟前沿,置信度阈值提供了最稳定的操作区间;多轮 append-only 解码在低延迟下更强,其提交校准误差整体下降 63–68%,早期 prefix 下降 68–80%。
研究提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。
SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。
研究融合美国 SEC 财务数据与 EPA 设施级温室气体登记数据,用梯度提升架构和 Mondrian Conformal Prediction 构建企业实际排放的算法基线,并据此提出 Conformal-Weighted Continuous Divergence(CWCD)指标,量化企业自报排放与算法基线之间的差距。
研究提出用 O'PRIOR 合成任务生成器构建可验证的归因测试台,每个预训练任务都带有结构机制、缺失、混杂、捷径和分布偏移的显式来源标注。在留出真实任务上,移除归因排名前 5% 的合成任务使平均 ROC-AUC 下降 0.013,随机移除仅下降 0.002±0.004,移除末位任务则提升 0.003。
研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。
MintFlow 是一个免训练的受限采样框架,将约束满足建模为对预训练流轨迹的最小干预,通过伴随公式得到扰动的闭式解,无需迭代优化。该方法还能自适应选择干预时机,在生成视觉与物理系统建模任务中,约束满足效果与 SOTA 受限方法相当,同时更好地保留预训练生成分布。
SatisDive 是一种免训练的推理时方法,通过批次相对奖励阈值区分高低奖励候选,在满足奖励下限的同时保证批次多样性。在 Pick-a-Pic 上,以 FLUX.1-dev 为基座模型、HPSv3 为奖励时,最差候选奖励较 FK steering 提升最高 0.43;以 SANA-1.6B 为基座、ImageReward 为奖励时提升最高 0.70。
研究者将仅作用于查询的低秩适配器 SampoTron 与 Nemotron-3-Embed-1B 模型结合,并按查询与索引语言做确定性路由:跨语言查询走适配器,同语言查询走原编码器。在采样的金融基准上,六个英/芬/瑞方向的 nDCG@10 均值从 0.241 提升至 0.291,相对增益 20.9%,且路由保留了原有同语言性能。