OpenWAM:面向可组合世界-动作模型的开放框架
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上进行持续预训练。
HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。
研究提出多任务条件生成对抗网络 MT-cGAN,可直接从 qMRI 回波图像合成类 DESS 图像并分割膝关节软骨与半月板。在 361 名受试者共 508 例膝关节 MRI 数据上,其平均 Dice 达 0.84,优于结合迁移学习的 SOTA 条件 GAN(0.82,p<0.001),T1ρ 与 T2 量化变异系数最低,分别为 1.84% 和 1.81%。
研究提出 SCAI SCI Gait 数据集,包含 239 名脊髓损伤成人的同步视频、动作捕捉与测力台数据,通过单目矢状面视频拟合参数化人体网格并驱动 OpenSim 模型。
CNP-Flow 是一个通过流反转学习条件源分布的时间生成流匹配框架,用条件噪声预测器(CNP)为每个时间条件生成各向同性高斯源,替代标准条件流匹配从标准高斯采样的做法。
研究者提出 Residual Patch Adapter(RPA),一种轻量模块化适配器,利用 ViT 视觉编码器中间层的全部 patch token 进行对齐,在 THINGS-EEG2 上取得被试内 95.4%、跨被试 35.5% 的 Top-1 准确率,在 THINGS-MEG 上分别为 65.2% 和 6.7%,两个数据集均达 SOTA。
WeaveAgent 是一个两阶段工具路由智能体,将路由与视觉感知解耦,先训练模型主动发出工具调用,再按查询类型条件执行。对齐 SFT 将外部工具路由从 0% 提升至 80.75%(323/400),GRPO 抑制了 9 次内部误触发且工具选择不变。
研究用 CHASE DB1 全部 28 张图像和两位人类标注,考察视网膜血管分割中阈值选择对评估结果的影响。固定七折协议保持 14 名受试者双眼同折,随机森林与 Extra Trees 对观察者 1 拟合三个随机种子共 42 次。
PointZero 提出以 3D 点轨迹补全作为预训练目标,无需机器人动作标签即可学习可迁移的 3D 动态先验。研究团队构建了包含 290 万合成帧、覆盖可变形、铰接与刚性物体的数据集,并训练出基于 Transformer 的 PointZero,在相同数据上优于此前方法。
Tree-VQ 将预训练扁平 VQ 分词器事后转换为支持任意前缀的渐进式表示,保留原有编码器分配和全部学习到的叶向量。该方法把码本组织为平衡二叉层级,按深度优先顺序传输分支决策,使每个额外分支比特精确细化一个 token,传输可在几乎任意载荷位置截断。
研究评估了四款基于运动的 AI 生成视频检测器,发现其中三款存在明显的预处理与采样偏差,其报告性能很大一部分来自这些偏差。这些检测器高度依赖评测数据集特有的运动模式——AI 生成视频帧间运动通常少于真实视频,在无此偏差的数据集上性能跌至接近随机水平。数据集重平衡和简单空间增强也会导致所有模型性能严重下降,而一款基于频率的检测器在各数据集上保持稳定表现。
研究者发布 DB-3DME,一个包含 2,619 个合成 3D 网格及 Geometry 与 Prompt Adherence 人工评分的数据集与基准,用于 3D 网格评测。
Contrastive-SDXL 是一个基于 SDXL-Turbo 并用 LoRA 微调的日转夜增强框架,用于夜间行人检测。它引入由 DINOv2 编码器引导的 patch-wise 语义对比损失和物体一致性损失,生成图像的 FID 为 22.5。用其合成图像训练的检测器相比仅用白天数据的基线漏检率降低 6-7%,接近真实夜间数据训练的效果。
MedHorizon 是一个面向真实场景长上下文医疗视频理解的基准,保留 759 小时完整临床手术视频,并提供 1,253 道基于证据的多选题,平均证据帧仅占 0.166%。评测显示最佳模型准确率仅 41.1%,性能不随帧数增加可靠提升,证据检索与临床解读仍是主要瓶颈。
开源工具 PlotPick 利用视觉语言模型(VLM)从批量科学图表中提取表格数据,并在 ChartX 和 PlotQA 上对来自四家提供商的九款 VLM 与专用图表转表模型 DePlot 进行基准测试。
研究将主体级机器遗忘用作参与度识别的后处理净化机制:在已训练模型上排序有害主体并做轻量近似遗忘更新,无需完整重训。在 DAiSEE 和 EngageNet 上以 TCCT-Net 为固定平台,K=3 遗忘集设置下分别恢复 oracle 增益的 92.5% 和 89.3%,成本约为重训的四分之一。效果在中等遗忘集规模时最强,依赖主体选择质量与移除机制。
研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。
针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。
研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。
MedVAR 是首个通过自回归训练实现全方位医学图像生成的基础模型,在 40 个数据集共 438,905 张切片上训练,覆盖 CT 和 MRI 的六个解剖区域,生成速度比 100 步扩散基线快 12-19 倍。生成质量随模型规模提升,用其生成图像预训练可将七中心肝细胞癌分割 Dice 从 0.615 提升至 0.632。
研究系统分析了深度伪造检测中的缩放定律,发现检测平均误差随真实图像域数量或伪造生成方法数量增加呈可预测的幂律衰减,类似大语言模型的缩放规律。为此构建了 ScaleDF 数据集,包含来自 51 个数据集的超 580 万张真实图像和 102 种方法生成的超 880 万张伪造图像。该规律可用于预测达到目标性能所需的额外域或方法数量,并以数据为中心应对不断演进的深度伪造技术。
研究者提出一种引导扩散模型解码器,可生成特征与用户指定特征高度匹配的图像,从而精确分析视觉 DNN 的特征空间。该方法无需训练即可分析不同 DNN,且可在单块商用 GPU 上运行,在 CLIP 图像编码器和 ResNet-50 上的实验验证了其有效性。代码与数据已公开。
WareFly-VLA 是一个面向智能仓库的写实无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 个高分辨率 RGB 转换,覆盖目标接近与人员跟随两类任务。
UltraDiff 将可微渲染范式扩展到医学超声,把超声成像建模为以飞行时间门控的路径空间积分,并推导出前向模型及场景参数梯度的 Monte Carlo 估计器。该框架基于 Mitsuba 3 实现,在逆几何估计任务中从球体出发优化 SDF,可从模拟 B 超扫查和真实脊柱体模机器人采集中恢复椎体表面,无需预分割图像即可在 B 超图像上无监督完成,几何精度与当前最优方法相当。
基于 Wan2.2-5B 构建的开放世界-动作模型框架 OpenWAM 发布,通过共享 Mixture-of-Transformers 架构集成动作专家,支持联合、先视频后动作、先动作后视频及解耦四种生成方式。
研究提出一种仅用单目图像估计未知航天器位姿的学习型管线,将 Transformer 网络与多状态约束卡尔曼滤波(MSCKF)结合,无需目标形状或惯量先验,也不依赖深度、lidar 或双目。
ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。
研究者提出一种方法,将 Trellis 2 等以物体为中心的 3D 生成器改造为可处理室内外场景的单图 3D 重建。方法通过按相机距离自适应分块、建立显式 2D-3D 对应关系,并合成约 4,000 个室外场景扩充训练数据。在 Tanks and Temples、ScanNet++ 及真实图像上,该方法在几何精度和感知质量上均优于所有基线。
ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。
研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。
该研究提出一种面向 3D Gaussian Splatting 的后训练语义提升方法,每次处理一个目标类别,按各 Gaussian 在各视图中的可见度加权,同时累积目标与非目标证据。
RenderBench 是一个面向渲染到真实(render-to-real)视频迁移的基准,包含 12 个重建的真实场景,覆盖大规模室内环境与第一人称视角,含静态和动态设置。
研究者提出 Reserve-Guided Elicitation(RGE)框架,将预训练模型中稀疏的、对来源敏感的内部组件视为“取证储备”,通过 Forensic Lens(F-lens)定位储备位点与方向,并仅在这些位点插入 Forensic Reserve Adapters(FRA)。
研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。
HuC-VideoMAE 提出一种人体中心掩码方案,利用身体关键点和人体边界框区域,在合成人体运动数据集上自监督预训练视频 Transformer。
研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。
研究者提出 ConnectomeX 与 FlyVision,一种保留 ON/OFF 并行处理、循环计算和群体图交互的可训练架构。
研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。
针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。