Online Neural Space Time Memory:解耦记忆更新频率的实时动态新视角合成
针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。
针对多视角流视频的在线新视角合成,研究者提出 Online Neural Space Time Memory,将 TTT 的记忆更新与应用解耦:记忆周期性更新、逐帧应用,并用跨视角注意力处理形变。该方法引入辅助 Memory Loss 与 Memory Caching 机制,在动态人体场景中实现分钟级记忆保持,且达到摊销实时速度。
一篇立场论文提出"翻译同构假设"(TIA)在原则上就不成立,即部分概念(如语用标记、敬语、历时分层词汇)的语义结构无法跨语言无损映射。作者用 usage-cloud 框架将概念表示为上下文化嵌入的点集,定义 α-unalignability 为无法同时保持词汇忠实(质心对应)与结构忠实(局部邻域拓扑)。
视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。
一项被 AACL-IJCNLP 2026 接收的研究测试了 SLM 与 LLM 是否具备文字系统(script)知识,即能否让输出文字系统匹配输入,以及能否遵循指定文字系统的指令。测试模型均达到近乎完美的拉丁文字系统保真度(超过 98%),并能高频遵循文字系统指令,但 LLM 在非标准文字系统组合上得分高于 SLM。
针对粤语歌词创作中旋律与声调需紧密对齐的问题,研究者提出 ARIA 框架,可直接从带字符级时间戳的演唱录音生成粤语歌词。该框架先用 TRATE 从演唱音频预测 0243 声调序列,再用 DRA-TCLG 结合检索增强的词汇引导生成流畅歌词,并构建了大规模对齐的音频-粤拼-0243 数据集。
研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。
研究者推出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测基准 ProactiveCoachBench 及微调 VLM 与自适应引导系统,在 phase、step、action 三个层级提供分层引导。
自动手语翻译(SLT)已进入消费产品,但尚无公开系统将 SLT 与儿童安全防护工具联合评估,主流已部署 SLT 模型也未在 18 岁以下手语者上训练或正式评测。否定、角色、保密、紧急或求助等翻译错误可能在不影响流畅度的情况下改变安全判定。论文提出一套由聋人群体参与部署前审计框架,含失败分类、场景模板、四种比较条件和四项结果指标,计划以 Auslan 为首个案例。
EMODE 是一个情感感知语音语言模型,核心是动态副语义专家(DPSE),将连续语音特征拆分为语义与副语言两条路径并动态路由、融合后再接入语言模型。它采用语义预热、副语言激活、联合精调三阶段课程训练,配合 OEG、SAA 与 GDR 引导。在 SER 测试、共情回复评测及新建双语 MEPA 基准上,EMODE 改善了词汇保真与情感敏感度的平衡。
研究提出一种面向MIMO信道的多阶段端到端图像语义通信系统,基于自适应MoE Swin Transformer块,通过动态专家门控机制联合评估实时CSI与图像patch语义内容来计算路由概率,仅激活相关专家子集。仿真结果显示,该方法在保持传输效率的同时,重建质量较现有方法显著提升。
研究者提出 Mask Fine-Tuning(MFT),一种不修改骨干权重的视觉语言模型适配方法,通过学习掩码选择性路由预训练连接中的信息,动态发现更对齐下游目标的子网络。实验显示 MFT 在多个视觉语言基准上持续优于 Full Fine-Tuning(FFT)和 Parameter-Efficient Fine-Tuning(PEFT),且不增加知识、不改变部署架构。
研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。
研究发现多模态几何对齐分数对模态退化的响应并非由扰动幅度主导,位移幅度最多只能解释15%的样本外方差。基于Gram行列式的闭式一阶展开,作者提出方向性几何响应(DGR),在MSR-VTT(N=878)和DiDeMo(N=980)上取得0.838-0.969的样本外R²和0.864-0.963的匹配幅度排序准确率。DGR依赖已观测的退化状态位移,属于解释性量而非部署时预测器。
DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。
研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。
RefRoute 通过紧凑残差条件与条件/注意力路由,降低多参考图像生成的参考 token 数量与注意力开销。在 ManyRef100 基准上,其 Weighted-Ref-VIEScore 达 36.06,FLUX.2-Klein-9B 为 8.88;16 个参考下,50 步与 4 步配置分别较对应 FLUX 基线提速 18.3 倍和 14.2 倍。
NASA 喷气推进实验室的 CETUS 研究对比了 DINOv2、DOFA、CROMA 与经典图像特征及未训练 ViT 在 USGS Cassini SAR 镶嵌图上的土卫六地形分类表现。
研究者提出 STAVE,用两个任务专属向量替代上下文示例,实现冻结大模型的任务适配。一个 readout 向量更新生成答案的 token,一个 context 向量更新其他结构 token 组,二者用带/不带示例的提示词答案标签训练。
SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。
研究者提出身份条件化分数融合框架,无需训练即可为每个底库身份定制融合权重,通过对比身份内一致性与跨身份冒充者提取身份专属画像,并与查询条件化自适应结合。在三个换装行人重识别基准上,该方法一致优于统计、排序和学习类基线,假未识别率最高绝对降低 8.8%。
研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。
混合跨模态注意力网络(HCMAN)通过 Transformer 跨模态注意力机制融合乳腺钼靶图像与结构化临床数据,在埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张钼靶图像上实现 97.8% 准确率、97.2% 敏感度、98.3% 特异度和 0.987 的 AUC,显著优于纯图像基线。
研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。
研究者提出 Mu-DisCoCat,一个面向 DisCoCat 的多模态变分量子学习框架,用于实现组合概念泛化(CoCoGen)。该框架先从单物体图文对学习稳定的物体表示,再固定这些表示学习多物体场景中的关系;经典模拟中使用 Uhlmann 态保真度计算多模态电路表示的重叠,关系 OOD 准确率高于所评估的 CLIP 基线。
研究者提出 CARAT,将模型依赖度估计与运行时损坏检测解耦,通过源训练阶段的不对称模态 dropout 课程学习缺失鲁棒的主干网络,并基于窗口输入投影梯度范数导出冻结的依赖度代理。
SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。
研究在 Android in the Wild 上用 LoRA 微调 Qwen2-VL-2B,比较五种向小型 GUI grounding 模型注入动作类型的方式。
研究者提出常曲率切片 Gromov-Wasserstein(CCSGW),一种用于对齐异构常曲率空间上概率分布的散度。该方法首次补全了球面空间基于测地线的一维投影,并将切片 GW 扩展到常曲率空间,在保留内在几何关系的同时避免高计算成本。将其接入图异常检测、图节点分类和多模态学习等混合曲率任务后,各类设置下均取得稳定性能提升。
EVFormer 是一个融合当前 RGB 帧与之前 200 ms 双侧手腕 sEMG 的多模态框架,用于估计 44 个手指与手腕关节角度,通过顺序双向交叉注意力和特征级门控融合实现跨模态信息交互。
一项理论研究为多语言语言模型中层跨语言表示相似性现象提供了理论解释。研究者用共享上层但下层产生式规则不同的概率上下文无关文法生成合成语言,证明贝叶斯最优下一 token 预测器即信念传播(BP),将其消息编码进连续层所得解析预测与在同数据上训练的 Transformer 高度吻合。
研究者推出 3D-DefectBench,用覆盖几何、纹理与提示词遵循的九类细粒度二元缺陷评估 3D 生成,并跨 84 种推理设计对 VLM、相机协议、视觉输入与提示词方案做析因分析。
SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。
研究者提出 SPATIALUNCERTAIN 评测框架,用遮挡造成的证据缺失和透视造成的误导证据两类场景,考察视觉语言模型能否判断当前视角是否可靠。在八个开源与闭源 VLM 上,模型行为并不跟随视觉证据的可靠性:证据消失时不会更谨慎,透视冲突时判断更依赖投影外观而非未变的物理 3D 关系。
研究用反事实图像集考察大型视觉语言模型(LVLM)在不同文化语境下对人物道德、伦理与政治价值的判断,基于 480 万次 LVLM 生成结果,识别出三种可跨多个架构不同模型复现的问卷锚定偏差模式。
针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。
研究提出两种基于提示的解码策略实现实时游戏视频解说生成:固定间隔解码与动态间隔解码,后者根据上一句解说的预估时长调整下一次预测时机,无需微调即可实现停顿感知生成。在日语和英语的赛车与格斗游戏数据集上,动态间隔解码生成的解说在时间与内容上更贴近人类解说。团队同时开源了多语言基准数据集、训练模型与实现代码。
研究者提出跨语言激活引导(CLAS),一种无需训练、在推理时选择性调节神经元激活的干预方法,用于缩小大模型主导语言与非主导语言之间的性能差距。在分类和生成基准上,CLAS 平均提升 2.3%(Acc.)和 3.4%(F1),同时保持高资源语言性能。研究发现有效迁移依赖功能分化而非严格对齐,性能增益与语言聚类分离度提升相关,该方法无需修改模型权重。
Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。
研究者提出 CMCM-DLM,一个模块化框架,可将预训练扩散模型扩展至支持异构分子约束而无需重训主干。该框架用结构控制模块(SCM)在扩散早期引导分子骨架生成,再由性质控制模块(PCM)将生成导向目标化学性质。多数据集实验显示其具备有效的跨模态可控性与较强适应性。
一篇综述系统梳理了基于扩散模型的视频编辑技术,涵盖数学基础、图像域关键方法及按核心技术关联划分的视频编辑方法演化脉络。文章还探讨了基于点的编辑和姿态引导的人体视频编辑等新应用,并引入新基准 V2VBench 进行全面对比,最后总结了现存挑战与未来方向。