VT-MUSE:面向操作任务的多模态统一序列视触觉表征学习框架
研究者提出 VT-MUSE,一个面向视触觉操作任务的多模态统一序列表征学习框架,通过两阶段学习解决视觉与触觉独立编码及忽略接触时序演化的问题。在仿真基准上,VT-MUSE 在所有任务上超越最强基线 11 个百分点,真实世界实验也取得显著提升。
研究者提出 VT-MUSE,一个面向视触觉操作任务的多模态统一序列表征学习框架,通过两阶段学习解决视觉与触觉独立编码及忽略接触时序演化的问题。在仿真基准上,VT-MUSE 在所有任务上超越最强基线 11 个百分点,真实世界实验也取得显著提升。
ChronoWorld 提出"观测—状态—反射"框架,利用时空因果线索与重建先验生成全局一致的自由视角 4D 场景。其 Spatiotemporal Epipolar Causal Attention 机制在生成全程施加多视角对极约束与时间因果性,并配合重建驱动的几何反射管线与 4D 检索策略实现动态自评估与修正。实验显示该方法在时空一致的电影级 4D 场景生成上达到 SOTA。
研究提出 SCAI SCI Gait 数据集,包含 239 名脊髓损伤成人的同步视频、动作捕捉与测力台数据,通过单目矢状面视频拟合参数化人体网格并驱动 OpenSim 模型。
DiDE 是首个面向解耦式 3D 风格化(Disen3D)的免训练框架,可将颜色与纹理独立迁移到生成的 3D 资产上。它利用图像到 3D 模型潜空间中纹理仅占少量风格通道的特性,通过通道划分机制分别处理内容图、纹理参考和颜色参考,并在每个自注意力层无干扰地组合两种风格信号。
一篇综述从场景表示、时序建模、重建流程与优化目标四个维度统一梳理 4D 场景重建方法,涵盖 NeRF 与 3D Gaussian Splatting 等路线。该框架分析了不同设计选择对几何保真度、外观一致性、运动表示与计算效率的影响,并整理了常用数据集与评测指标,指出当前实验实践的局限与开放挑战。相关论文与资源集合持续更新。
研究者提出轨迹对齐字形渲染参考与深度归一化识别器特征监督,解决视频扩散模型难以复现精确笔画结构、易生成乱码字符的问题。同时构建 VTEdit 基准,包含 288 个真实场景片段和 440 条标注文本轨迹,覆盖文本替换与添加任务。实验显示该方法在文本准确率和背景保持上优于图像文本编辑方法、视频编辑方法及商业模型,句子准确率达 0.9408,并在用户研究中获得最高偏好。
研究者提出 Residual Patch Adapter(RPA),一种轻量模块化适配器,利用 ViT 视觉编码器中间层的全部 patch token 进行对齐,在 THINGS-EEG2 上取得被试内 95.4%、跨被试 35.5% 的 Top-1 准确率,在 THINGS-MEG 上分别为 65.2% 和 6.7%,两个数据集均达 SOTA。
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
HARMONY 是一个分层链式思维框架,结合智能体推理与视觉几何基础模型,从单张室内场景图像重建完整 3D 场景。它先校准相机建立语义空间框架,再按墙面元素、独立家具、家具上装饰物的分层顺序放置物体,并用深度优先遍历和反思反馈循环避免误差累积。实验表明 HARMONY 在合成与真实图像上优于所评估的重建基线,与 GPT-6 Astra 的定性对比显示其物体布局更忠实、场景细节保留更好。
RIGOR 是一个面向重力对齐全景视频的大规模三维重建管线,保留冻结的前馈透视骨干网络,将每张全景图当作四视角虚拟装置使用。该装置结构可检测并修复局部不一致预测,通过四视角循环一致性检索回环,并在全局优化前对候选重访进行几何验证,最终以 Sim(3) 位姿图修正旋转、平移与尺度漂移。在施工场地序列上,其轨迹精度与重建几何均优于前馈基线,代码已开源。
研究者提出 Latent-Action-Guided 方法,将帧间变化压缩为 latent actions 并在端到端视频-语言对齐中预测下一帧特征,无需额外空间或运动标注即可提升交互定位与时间方向敏感性。使用无大规模视频预训练的图像编码器时,该方法识别性能与 V-JEPA2/2.1 相当,推理更快且 INT4 精度下降更小。
一项研究在 YOLO-World 框架上提出多模态目标检测模型,用基于注意力的 A2C2f 层替换 YOLOv8 主干中的 C2f 层,以更精确表征小目标局部特征。在 VisDrone 数据集上,该模型精度从 43.0% 提升至 45.1%,召回率从 32.8% 升至 35.0%,mAP@0.5 从 32.5% 提高到 35.2%,mAP@0.5-0.95 从 18.5% 升至 19.9%。
UniPose9D 是一个类别无关的 9D 物体位姿估计统一模型,仅凭实例 mask/ROI 加 RGB-D 或带预测深度的 RGB 图像,即可在无类别标签、CAD 模型、平均形状先验和参考视图的情况下估计旋转、平移与度量尺寸。
研究团队推出诊断基准 SalArt-VQA,包含 950 张图像和 3,681 道人工编写多选题,用于评估 VLM 对 AI 生成图像中显著伪影的细粒度理解。在 20 个 VLM 上测试发现,最强模型伪影检测召回率达 99.37%,但四类伪影问题全部答对的图像仅占 53.26%。该基准已入选 NeurIPS 2026 E&D Track(Oral)。
研究者发布 DB-3DME,一个包含 2,619 个合成 3D 网格及 Geometry 与 Prompt Adherence 人工评分的数据集与基准,用于 3D 网格评测。
研究者推出 FindIt,首个系统评估通用多模态 LLM 可提示定位能力的综合基准,覆盖目标检测、指代表达检测、实例级检测和视频检测四类任务。该基准统一输入、强制输出可解析的边界框并定义透明评测协议,对多种开源与闭源 MLLM 进行评测。结果显示当前模型对输出格式约束高度敏感,即使轻微变化也常难以泛化。
一项 arXiv 研究显示,基于扩散 Transformer 的文本到图像模型通常只依赖文本表示中两个简单方面:相邻 token 合并为词表示,以及由文本编码器位置嵌入刻画的词序。研究者构造了仅编码单词含义与顺序、不含完整提示词上下文信息的"位置标记词袋"嵌入,发现其引导生成的视觉质量与文本保真度与完整文本嵌入相当,说明复杂语言结构的解码实际由图像模型自身完成。
MedHorizon 是一个面向真实场景长上下文医疗视频理解的基准,保留 759 小时完整临床手术视频,并提供 1,253 道基于证据的多选题,平均证据帧仅占 0.166%。评测显示最佳模型准确率仅 41.1%,性能不随帧数增加可靠提升,证据检索与临床解读仍是主要瓶颈。
开源工具 PlotPick 利用视觉语言模型(VLM)从批量科学图表中提取表格数据,并在 ChartX 和 PlotQA 上对来自四家提供商的九款 VLM 与专用图表转表模型 DePlot 进行基准测试。
研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。
针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。
研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。
研究提出 GaussianBlender,一个前馈式文本驱动 3D 风格化框架,可在推理时即时完成编辑。该方法从空间分组的 3D Gaussian 中学习几何与外观解耦的隐空间,再用潜在扩散模型施加文本条件编辑。评估显示其风格化即时、高保真、保持几何且多视角一致,并超越需逐实例测试时优化的方法。
研究提出"视觉编排税"概念,用于衡量智能体 VLM 流水线中语义未变的图像在 API 边界被反复重建的冗余。在 SeeingEye 和 MAMMQA 上审计发现 66.8-75.6% 的视觉证据触碰冗余,且每条查询均超过预设阈值。
一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。
研究提出一种仅用单目图像估计未知航天器位姿的学习型管线,将 Transformer 网络与多状态约束卡尔曼滤波(MSCKF)结合,无需目标形状或惯量先验,也不依赖深度、lidar 或双目。
ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。
研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。
ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。
该研究提出一种面向 3D Gaussian Splatting 的后训练语义提升方法,每次处理一个目标类别,按各 Gaussian 在各视图中的可见度加权,同时累积目标与非目标证据。
SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。
EC-RAG 是一个免训练框架,先将视频切分为语义连贯的片段并链接成保留时序的事件链,再针对查询定位相关事件、聚合语音文本与视觉等多模态证据。它在 Video-MME、MLVU 和 LongVideoBench 上持续优于帧级检索基线,并可即插即用兼容现有 LVLM 主干,无需额外训练或依赖闭源模型。
视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。
针对遥感场景分类,研究者提出 RSJEV,将分类重构为候选类别条件下的多模态判别式决策过程,用 OnePass Decider 直接估计类别概率,省去自回归解码。在 UC Merced、AID、NWPU-RESISC45 三个基准上,RSJEV 性能优于代表性 CNN、Transformer、Mamba、CLIP 和 MLLM 方法,并以仅 0.8B 参数模型显著降低推理成本。代码将公开。
针对 LipSync 伪造视频,研究者提出联合检测与溯源框架 LipDA,利用自然语音中唇动与头部姿态的生物学耦合,通过对比真实与伪造视频的唇部、姿态特征量化二者不一致性,并捕捉各生成模型特有的时序动态与音视频同步模式实现来源溯源。
研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。
研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。
数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。
EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。
一项多模型审计在儿童数据集上测试了 EmoNet、EmotiEffLib、DDAMFN++、OpenFace 3.0、LibreFace 五个 AffectNet 预训练表情模型,发现儿童性能下降与架构无关,且集中在张嘴(被误读为 surprise,与 AU26 下巴张开相关)和南亚裔儿童上。