跳到正文
今天10月7日周三1231 条
  1. arXiv cs.CV27

    BASA:面向快速高分辨率视觉生成的后端无关稀疏注意力

    研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。

  2. arXiv cs.CV22

    基于 Patch 的高光谱图像分类中的数据泄漏:量化空间重叠的影响

    研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。

  3. arXiv cs.CV27

    SpaTime:面向时空推理的流式视觉语言模型

    SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。

  4. arXiv cs.CV22

    视频多选评测中的帧相位与选项顺序:Stable Scores, Unstable Answers

    视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。

  5. arXiv cs.CV22

    基于基础模型引导扩散的 LiDAR 分辨率恢复

    研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。

  6. arXiv cs.CV22

    RSJEV:用多模态大语言模型做判别式遥感场景分类

    针对遥感场景分类,研究者提出 RSJEV,将分类重构为候选类别条件下的多模态判别式决策过程,用 OnePass Decider 直接估计类别概率,省去自回归解码。在 UC Merced、AID、NWPU-RESISC45 三个基准上,RSJEV 性能优于代表性 CNN、Transformer、Mamba、CLIP 和 MLLM 方法,并以仅 0.8B 参数模型显著降低推理成本。代码将公开。

  7. arXiv cs.CV17

    基于解剖感知隐式神经表示的可变形 CT-超声配准

    研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。

  8. arXiv cs.CV22

    BFG:面向隐私友好 AIoT 的图像比特流细粒度理解基础模型

    研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。

  9. arXiv cs.CV22

    UP-MOPD:多教师在线策略蒸馏中的更新投影

    针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。

  10. arXiv cs.CV17

    用 Stevens 幂律检验 GPT-5.5 的图像可视化读取能力

    研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。

  11. arXiv cs.CV22

    数字孪生驱动的 Real2Sim2Real:通过配对驾驶场景重建实现模拟器条件生成

    数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。

  12. arXiv cs.CV12

    EventNet:用 2D 关键点检测乒乓球视频事件

    EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。

  13. arXiv cs.CV31

    TSRN-RTVD:实时视频去模糊系统

    TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。

  14. arXiv cs.CV17

    RACE-FPP:面向条纹投影轮廓术的鲁棒 AI 辅助标定增强方法

    诺丁汉大学团队提出 RACE-FPP,将深度学习角点检测融入条纹投影轮廓术(FPP)标准标定流程,并显式分析定位误差在整条标定链中的传播。在干净与退化图像混合数据集上,相机重投影误差从 1.237 像素降至 0.259 像素,投影仪重投影误差降低约 50%,重建工件的几何精度也优于传统流程。

  15. arXiv cs.CV15

    View Matters:关键帧引导的文本驱动 3D Gaussian 编辑框架

    View Matters 是一个视图重要性感知的文本驱动 3D Gaussian 编辑框架,通过关键帧重要性估计(KIE)识别可靠视图,再经关键帧引导编辑(KGE)将编辑信号非对称传播至非关键帧,并用重要性感知优化(IAO)在 3DGS 优化中保持该偏好。在 23 组场景-提示词对上,其平均 CLIP 文本-图像相似度达 0.2822、方向相似度达 0.2564,编辑耗时四分钟。

  16. arXiv cs.CV22

    M3SunAgent:面向度量深度估计与3D视觉定位的单目3D空间理解智能体

    研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。

  17. arXiv cs.CV22

    DensiTok:让前馈 3D Gaussian Splatting 看到比输入更多的视角

    DensiTok 是一个可插拔模块,能直接加密预训练前馈 3DGS 模型的内部几何 token,让冻结的主干网络表现得像观测到远多于输入的视角。它把 token 压缩到紧凑隐空间,以相机几何为条件用单步 flow-matching 补全未观测视角的隐变量,再解码回 token 供原重建头使用,无需图像合成或额外编码器。

  18. arXiv cs.CV19

    MoRE:用奖励专家混合框架改进基于语言的轨迹预测

    MoRE(Mixture of Reward Experts)通过强化学习将五个冻结的数值预测器的坐标级先验迁移到预训练语言轨迹预测器中,专家预测转为奖励并经不确定性加权共识融合。在 ETH-UCY 上,ADE 从 0.22 降至 0.20 m,FDE 从 0.32 降至 0.29 m;相对基础策略,ADE 在 SDD 上下降 17.9%、在 NBA 上下降 12.7%,且未增加推理内存或延迟。