Con-DSO:为 RGB-D 直接稀疏里程计学习短时一致性先验
Con-DSO 是一个一致性感知的 RGB-D 直接稀疏里程计框架,用双分支一致性网络在相邻 RGB-D 帧对上预测像素级光度与几何不确定性,并将其转化为成对质量以指导支撑像素选择,再跨帧融合为关键帧跟踪的质量先验。
Con-DSO 是一个一致性感知的 RGB-D 直接稀疏里程计框架,用双分支一致性网络在相邻 RGB-D 帧对上预测像素级光度与几何不确定性,并将其转化为成对质量以指导支撑像素选择,再跨帧融合为关键帧跟踪的质量先验。
Contrastive-SDXL 是一个基于 SDXL-Turbo 并用 LoRA 微调的日转夜增强框架,用于夜间行人检测。它引入由 DINOv2 编码器引导的 patch-wise 语义对比损失和物体一致性损失,生成图像的 FID 为 22.5。用其合成图像训练的检测器相比仅用白天数据的基线漏检率降低 6-7%,接近真实夜间数据训练的效果。
MedHorizon 是一个面向真实场景长上下文医疗视频理解的基准,保留 759 小时完整临床手术视频,并提供 1,253 道基于证据的多选题,平均证据帧仅占 0.166%。评测显示最佳模型准确率仅 41.1%,性能不随帧数增加可靠提升,证据检索与临床解读仍是主要瓶颈。
开源工具 PlotPick 利用视觉语言模型(VLM)从批量科学图表中提取表格数据,并在 ChartX 和 PlotQA 上对来自四家提供商的九款 VLM 与专用图表转表模型 DePlot 进行基准测试。
研究将主体级机器遗忘用作参与度识别的后处理净化机制:在已训练模型上排序有害主体并做轻量近似遗忘更新,无需完整重训。在 DAiSEE 和 EngageNet 上以 TCCT-Net 为固定平台,K=3 遗忘集设置下分别恢复 oracle 增益的 92.5% 和 89.3%,成本约为重训的四分之一。效果在中等遗忘集规模时最强,依赖主体选择质量与移除机制。
研究者提出物理信息重建框架 RetinaDiff,用于视网膜时序激光散斑对比成像(tLSCI),仅需少量帧即可实现运动鲁棒重建。该方法先用相位相关配准稳定原始散斑序列,再以运动校正后的对比度先验引导条件扩散模型完成逆重建。
研究者提出一种数据集级、物体中心的监督方案,在 3D Gaussian Splatting(3DGS)中学习物体表示。该方法基于预训练的 slot attention 模块 GOCL,学习场景无关的物体 codebook,为跨视角、跨场景提供一致的身份锚定表示,无需额外 mask 前/后处理或多视角对齐,也无需逐场景微调或重训练。
针对 3D CT 报告生成中病理覆盖不全的问题,研究提出自适应增强框架 AdaRAG-CT,通过受控检索引入补充文本信息并在生成时选择性整合。研究发现对比式 3D CT 嵌入存在严重维度集中,512 维中仅约 2 个有效维度,且扩大语言模型规模无改善。在 CT-RATE 基准上,AdaRAG-CT 将 Clinical F1 从 0.420(CT-Agent)提升至 0.480。
研究者发布 Cultural Counterfactuals,一个包含近 60k 张反事实图像的高质量合成数据集,用于测量大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。该数据集借助图像编辑模型将不同人群置入真实文化场景,构建同一人在多种文化语境下的反事实图像组,从而精确量化文化语境差异对 LVLM 输出的影响。
MedVAR 是首个通过自回归训练实现全方位医学图像生成的基础模型,在 40 个数据集共 438,905 张切片上训练,覆盖 CT 和 MRI 的六个解剖区域,生成速度比 100 步扩散基线快 12-19 倍。生成质量随模型规模提升,用其生成图像预训练可将七中心肝细胞癌分割 Dice 从 0.615 提升至 0.632。
研究者提出 REPA-G(Representation-Aligned Guidance),一种在推理阶段利用自监督模型对齐表征进行条件控制的框架,无需额外训练即可引导扩散模型去噪过程。该方法支持从单 patch 匹配到全局图像特征 token 的多粒度控制,并可扩展至多概念组合,在 ImageNet 和 COCO 上生成高质量且多样的结果。
研究提出 GaussianBlender,一个前馈式文本驱动 3D 风格化框架,可在推理时即时完成编辑。该方法从空间分组的 3D Gaussian 中学习几何与外观解耦的隐空间,再用潜在扩散模型施加文本条件编辑。评估显示其风格化即时、高保真、保持几何且多视角一致,并超越需逐实例测试时优化的方法。
研究系统分析了深度伪造检测中的缩放定律,发现检测平均误差随真实图像域数量或伪造生成方法数量增加呈可预测的幂律衰减,类似大语言模型的缩放规律。为此构建了 ScaleDF 数据集,包含来自 51 个数据集的超 580 万张真实图像和 102 种方法生成的超 880 万张伪造图像。该规律可用于预测达到目标性能所需的额外域或方法数量,并以数据为中心应对不断演进的深度伪造技术。
研究者提出一种引导扩散模型解码器,可生成特征与用户指定特征高度匹配的图像,从而精确分析视觉 DNN 的特征空间。该方法无需训练即可分析不同 DNN,且可在单块商用 GPU 上运行,在 CLIP 图像编码器和 ResNet-50 上的实验验证了其有效性。代码与数据已公开。
研究者发现,被遗忘的扩散模型概念会在 token 嵌入空间中留下可解释的线性残差,据此提出越狱攻击 SubAttack 与防御机制 SubDefense。
研究者将 ControlNet + IP-Adapter 风格化管线中两个全局条件权重提升为逐位置空间图,在单次生成中实现内容与风格的局部、分轴控制。由于两个权重作用于不相交通路,独立调节可覆盖从自由重生成到身份保持的 2x2 修图组合,且编辑被限制在指定区域。
WareFly-VLA 是一个面向智能仓库的写实无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 个高分辨率 RGB 转换,覆盖目标接近与人员跟随两类任务。
研究提出"视觉编排税"概念,用于衡量智能体 VLM 流水线中语义未变的图像在 API 边界被反复重建的冗余。在 SeeingEye 和 MAMMQA 上审计发现 66.8-75.6% 的视觉证据触碰冗余,且每条查询均超过预设阈值。
一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
UltraDiff 将可微渲染范式扩展到医学超声,把超声成像建模为以飞行时间门控的路径空间积分,并推导出前向模型及场景参数梯度的 Monte Carlo 估计器。该框架基于 Mitsuba 3 实现,在逆几何估计任务中从球体出发优化 SDF,可从模拟 B 超扫查和真实脊柱体模机器人采集中恢复椎体表面,无需预分割图像即可在 B 超图像上无监督完成,几何精度与当前最优方法相当。
基于 Wan2.2-5B 构建的开放世界-动作模型框架 OpenWAM 发布,通过共享 Mixture-of-Transformers 架构集成动作专家,支持联合、先视频后动作、先动作后视频及解耦四种生成方式。
研究提出一种仅用单目图像估计未知航天器位姿的学习型管线,将 Transformer 网络与多状态约束卡尔曼滤波(MSCKF)结合,无需目标形状或惯量先验,也不依赖深度、lidar 或双目。
ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。
研究者推出 World Models' Last Exam in Physics,一个基于测量的视频世界模型物理一致性基准,涵盖力学、光学、流体、热学与相变、电磁学和表面张力共 40 项受控任务。在 8 个视频生成模型、1,280 段视频上的实验显示物理不一致普遍存在,最佳模型总分仅 57.76(满分 100)。该评测器在任务内排名和两两比较中与人类判断的一致度均高于直接的视觉语言模型基线。
研究者提出一种方法,将 Trellis 2 等以物体为中心的 3D 生成器改造为可处理室内外场景的单图 3D 重建。方法通过按相机距离自适应分块、建立显式 2D-3D 对应关系,并合成约 4,000 个室外场景扩充训练数据。在 Tanks and Temples、ScanNet++ 及真实图像上,该方法在几何精度和感知质量上均优于所有基线。
ALIVE 是一个让插入物体与源视频内容产生连贯交互的视频编辑框架,仅需编辑后的首帧和一条只命名新增物体的指令。团队构建了 35,800 对编辑数据,并训练 VLM 预测交互引导。在两个基准上,无 VLM 引导时 ALIVE 的 Overall 指标分别比最强基线提升 43.9% 和 4.4%,VLM 预测引导可再提升 ALIVE-interaction 分数 0.95 分。
CtrlCache 是一个免训练的控制感知缓存框架,通过动作感知调度与刷新策略,将视频块标记为初始、过渡、转向或稳态,并在选定的去噪步骤复用 Transformer 残差,同时用频率混合历史先验引导利用低频结构。
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。
该研究提出一种面向 3D Gaussian Splatting 的后训练语义提升方法,每次处理一个目标类别,按各 Gaussian 在各视图中的可见度加权,同时累积目标与非目标证据。
SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。
RenderBench 是一个面向渲染到真实(render-to-real)视频迁移的基准,包含 12 个重建的真实场景,覆盖大规模室内环境与第一人称视角,含静态和动态设置。
EC-RAG 是一个免训练框架,先将视频切分为语义连贯的片段并链接成保留时序的事件链,再针对查询定位相关事件、聚合语音文本与视觉等多模态证据。它在 Video-MME、MLVU 和 LongVideoBench 上持续优于帧级检索基线,并可即插即用兼容现有 LVLM 主干,无需额外训练或依赖闭源模型。
PDB(Point-Based Deformation Blending)是一种网格无关的面部动画重定向方法,从源中性表情对预测一组形变控制点,并从目标中性网格计算混合权重,权重每个目标只算一次、可跨帧复用。
FocusGate 是一种带门控的无注视先验集成方法,成员可弃权:逐帧门控读取散焦图的三个形状统计量,只选取估计器平均高于随机的帧,被拒帧精确退化为基线。在电影、体育和网页视频上,门控融合显著为正,无条件融合在体育上有害、在网页上无效。
视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。
研究者提出 Reserve-Guided Elicitation(RGE)框架,将预训练模型中稀疏的、对来源敏感的内部组件视为“取证储备”,通过 Forensic Lens(F-lens)定位储备位点与方向,并仅在这些位点插入 Forensic Reserve Adapters(FRA)。
研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。
Sparse2comm 是一个带宽高效且鲁棒的协同 3D 目标检测框架,将不可靠协同视为对退化协同特征的渐进式修复。它通过稀疏特征编码以随机掩码采样的前景特征实现超低带宽通信与丢包恢复,再用延迟感知对齐补偿延迟消息、自校准融合估计残余空间偏移。