BASA:面向快速高分辨率视觉生成的后端无关稀疏注意力
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
研究发现,基于 Patch 的高光谱图像分类中,从同一图像随机划分训练测试集会导致空间 Patch 重叠,造成数据泄漏并虚高分类性能。在 Pavia University 数据集上,3D-CNN 随机采样下总体精度达 96.17%,改用非随机空间采样后骤降至 55.20%,ViT 和 2D-CNN 分别下降 40.71 和 38.81 个百分点。
该研究提出一种面向 3D Gaussian Splatting 的后训练语义提升方法,每次处理一个目标类别,按各 Gaussian 在各视图中的可见度加权,同时累积目标与非目标证据。
SpaTime 是一种流式视觉语言模型,在每一帧将因果几何 token 融合进语言模型,仅依赖已观测帧进行时空推理。它提出响应时间损失,把逐帧响应概率映射为可微的期望响应时间,并惩罚其与真实帧的距离。在流式基准 StreamVSTI-Bench 上,SpaTime 总体准确率达 49.2%,平均响应时间误差较最强流式基线降低 66%。
RenderBench 是一个面向渲染到真实(render-to-real)视频迁移的基准,包含 12 个重建的真实场景,覆盖大规模室内环境与第一人称视角,含静态和动态设置。
EC-RAG 是一个免训练框架,先将视频切分为语义连贯的片段并链接成保留时序的事件链,再针对查询定位相关事件、聚合语音文本与视觉等多模态证据。它在 Video-MME、MLVU 和 LongVideoBench 上持续优于帧级检索基线,并可即插即用兼容现有 LVLM 主干,无需额外训练或依赖闭源模型。
PDB(Point-Based Deformation Blending)是一种网格无关的面部动画重定向方法,从源中性表情对预测一组形变控制点,并从目标中性网格计算混合权重,权重每个目标只算一次、可跨帧复用。
FocusGate 是一种带门控的无注视先验集成方法,成员可弃权:逐帧门控读取散焦图的三个形状统计量,只选取估计器平均高于随机的帧,被拒帧精确退化为基线。在电影、体育和网页视频上,门控融合显著为正,无条件融合在体育上有害、在网页上无效。
视频语言模型的多选题评测通常只报告均匀网格的采样率,却忽略相位参数。仅相差半步相位的两个采样器会让 23.6% 的题目答案不同,而得分差距在 1 分以内;在两个家族的四个版本中,仅改变相位会改变约五分之一的答案。PHASEFUSION 解码三个偏移网格并平均选项后验,在准确率与 32 帧单次推理相当的前提下,将半步相位偏移导致的答案变化从 18.2% 降至 10.1%。
研究者提出 Reserve-Guided Elicitation(RGE)框架,将预训练模型中稀疏的、对来源敏感的内部组件视为“取证储备”,通过 Forensic Lens(F-lens)定位储备位点与方向,并仅在这些位点插入 Forensic Reserve Adapters(FRA)。
研究用预训练 Stable Diffusion 作为骨干,结合 2D 基础模型的伪深度目标微调 LiDAR 条件深度模型,训练时按不同 beam 预算随机抽稀 LiDAR 条件。在 nuScenes 上对物理留出的真实 beam 评估,4-beam 输入下 δ1.25 准确率达 66.8%,而散点插值仅 45.1%,稀疏场景优势最大。类别分层误差显示平面最先恢复,深度不连续物体最早退化。
Sparse2comm 是一个带宽高效且鲁棒的协同 3D 目标检测框架,将不可靠协同视为对退化协同特征的渐进式修复。它通过稀疏特征编码以随机掩码采样的前景特征实现超低带宽通信与丢包恢复,再用延迟感知对齐补偿延迟消息、自校准融合估计残余空间偏移。
针对遥感场景分类,研究者提出 RSJEV,将分类重构为候选类别条件下的多模态判别式决策过程,用 OnePass Decider 直接估计类别概率,省去自回归解码。在 UC Merced、AID、NWPU-RESISC45 三个基准上,RSJEV 性能优于代表性 CNN、Transformer、Mamba、CLIP 和 MLLM 方法,并以仅 0.8B 参数模型显著降低推理成本。代码将公开。
研究者提出自适应神经细胞自动机(aNCA)架构,用可变形卷积动态调整感知野,在网格类数据上迭代推理 2D 空间关系。在公开基准上,该方法求解数独、迷宫最短路径等图像谜题取得 SOTA 且可理解的结果,并具备较强泛化能力。
HuC-VideoMAE 提出一种人体中心掩码方案,利用身体关键点和人体边界框区域,在合成人体运动数据集上自监督预训练视频 Transformer。
研究提出一种可变形 CT-超声配准框架,利用 CT 的 HU 值近似组织刚度作为空间变化正则化,并结合探针接触区位移先验与扇形几何正则项,通过 SIREN 逐帧优化、以归一化梯度场(NGF)训练。该方法在刚性初始化基础上将配准精度提升 17%,优于经典可变形基线,且保持近乎零的拓扑折叠。
研究者提出 ConnectomeX 与 FlyVision,一种保留 ON/OFF 并行处理、循环计算和群体图交互的可训练架构。
针对 LipSync 伪造视频,研究者提出联合检测与溯源框架 LipDA,利用自然语音中唇动与头部姿态的生物学耦合,通过对比真实与伪造视频的唇部、姿态特征量化二者不一致性,并捕捉各生成模型特有的时序动态与音视频同步模式实现来源溯源。
研究者提出比特流细粒度生成器 BFG,可直接从编码图像字节序列完成细粒度分类与语义描述生成,无需将图像完整解码到像素域,从而减少处理流程中的视觉暴露。BFG 由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,并配套构建了含完好与多种损坏类型及严重程度的大规模数据集 CFU-D。
针对多教师在线策略蒸馏中梯度冲突问题,研究者提出 UP-MOPD,让原始混合梯度先更新优化器状态并生成候选位移,再对违反约束的候选做欧氏距离最近的可行投影。在医学与通用领域实验中,UP-MOPD 训练后期 IFEval-loose 准确率比原始 M-OPD 提升 2.96 分,八项指标平均 60.03,高于梯度投影的 59.00 和更新拒绝的 59.15。
UniCounting 提出固定词表、无需图像查询的多类别计数方法,仅输入 RGB 图像即可输出完整的类别—计数向量。它用冻结的 SAM 2.1 生成掩码、DINOv2 与 OpenCLIP 提供关系与类别特征,仅训练一个 3,267 参数的类别共享关系头预测同实例亲和度。
研究将 Stevens 幂律用于测量 AI 模型读取可视化的固有能力,并以 GPT-5.5 为对象开展试点:模型不看图例,先估计参考图形的量级,再相对参考估计后续同类型图形的量级。该评估覆盖 12 种视觉变量,使算法模型读取视觉编码的过程可测量、可与人类感知比较,并被 IEEE VIS 2026 的 VISxGenAI workshop 接收。
PolarScale 是一个将辐射尺度作为显式预测与评估目标的 RGB-to-Stokes 基准,基于现有三色全 Stokes 测量,要求模型预测归一化 Stokes 分量、AoLP/DoLP/DoCP 及每场景尺度。
数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。
一项持续学习研究在 YOLOMG(基于 YOLOv5 的热红外检测器)上顺序训练 Anti-UAV-RGBT、Anti-UAV410 和 CST Anti-UAV 三个反无人机基准,朴素微调在 CST 上对第一阶段上限的遗忘度量 FM 为 -0.605,相当于 90% 能力损失。
EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。
一项多模型审计在儿童数据集上测试了 EmoNet、EmotiEffLib、DDAMFN++、OpenFace 3.0、LibreFace 五个 AffectNet 预训练表情模型,发现儿童性能下降与架构无关,且集中在张嘴(被误读为 surprise,与 AU26 下巴张开相关)和南亚裔儿童上。
TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。
诺丁汉大学团队提出 RACE-FPP,将深度学习角点检测融入条纹投影轮廓术(FPP)标准标定流程,并显式分析定位误差在整条标定链中的传播。在干净与退化图像混合数据集上,相机重投影误差从 1.237 像素降至 0.259 像素,投影仪重投影误差降低约 50%,重建工件的几何精度也优于传统流程。
MacJEPA 是一种缺失模态鲁棒的音视频识别模型,将第一视角模态缺失重新定义为未剪辑多事件视频中时间局部的传感器中断,并通过窗口级模态 dropout 模拟训练。
PIE-PS 是一个从原始事件流和已知光照重建稠密表面法线的学习框架,通过将同一像素相邻两个事件与其光照方向配对构建 Physical Irradiance Events(PIEs),其 PIEF 特征无需未知对比度阈值。
View Matters 是一个视图重要性感知的文本驱动 3D Gaussian 编辑框架,通过关键帧重要性估计(KIE)识别可靠视图,再经关键帧引导编辑(KGE)将编辑信号非对称传播至非关键帧,并用重要性感知优化(IAO)在 3DGS 优化中保持该偏好。在 23 组场景-提示词对上,其平均 CLIP 文本-图像相似度达 0.2822、方向相似度达 0.2564,编辑耗时四分钟。
研究团队提出一种基于 Transformer 的重建框架,将冻结及参数高效微调的 CLIP、BiomedCLIP、DINOv2 视觉编码器用作心脏 MRI 加速重建的先验。
研究团队构建了 SkinLex,一个整合 SkinCon、DermaCon-IN、MM-Skin 和 PASSION 四个公开数据集、涵盖 48 种临床形态学属性、共 20,411 条记录的统一数据集。
研究提出相位速度蒸馏(PVD),将生成过程分为粗、细两个阶段,各用一个半尺寸专家模型建模平均速度,累计计算量仅相当于一次完整骨干前向。
PhysTacGen 是一个视觉到光学触觉图像生成框架,通过融合材料感知描述与几何条件来合成触觉图像。
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
EmbodiedSmith 是一个通过递归自我改进(RSI)实现可扩展具身数据生成的框架,将资产、场景与任务生成统一到一条支持自主创建和语言驱动定制的流水线中。
DensiTok 是一个可插拔模块,能直接加密预训练前馈 3DGS 模型的内部几何 token,让冻结的主干网络表现得像观测到远多于输入的视角。它把 token 压缩到紧凑隐空间,以相机几何为条件用单步 flow-matching 补全未观测视角的隐变量,再解码回 token 供原重建头使用,无需图像合成或额外编码器。
MoRE(Mixture of Reward Experts)通过强化学习将五个冻结的数值预测器的坐标级先验迁移到预训练语言轨迹预测器中,专家预测转为奖励并经不确定性加权共识融合。在 ETH-UCY 上,ADE 从 0.22 降至 0.20 m,FDE 从 0.32 降至 0.29 m;相对基础策略,ADE 在 SDD 上下降 17.9%、在 NBA 上下降 12.7%,且未增加推理内存或延迟。