EventNet:用 2D 关键点检测乒乓球视频事件
EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。
EventNet 用两阶段流程检测乒乓球视频中的球拍触球事件:先提取双方上半身姿态、球桌角点和球心的 2D 关键点,再由 transformer 编码器为每帧预测距前后两次触球的时间。该方法在 Latte-MV 数据集上取得 91.16% 的 F1 分数和 0.42 帧的平均偏差,在 TTHQ 数据集上为 73.08% / 1.16。
一项多模型审计在儿童数据集上测试了 EmoNet、EmotiEffLib、DDAMFN++、OpenFace 3.0、LibreFace 五个 AffectNet 预训练表情模型,发现儿童性能下降与架构无关,且集中在张嘴(被误读为 surprise,与 AU26 下巴张开相关)和南亚裔儿童上。
MacJEPA 是一种缺失模态鲁棒的音视频识别模型,将第一视角模态缺失重新定义为未剪辑多事件视频中时间局部的传感器中断,并通过窗口级模态 dropout 模拟训练。
PIE-PS 是一个从原始事件流和已知光照重建稠密表面法线的学习框架,通过将同一像素相邻两个事件与其光照方向配对构建 Physical Irradiance Events(PIEs),其 PIEF 特征无需未知对比度阈值。
研究团队构建了 SkinLex,一个整合 SkinCon、DermaCon-IN、MM-Skin 和 PASSION 四个公开数据集、涵盖 48 种临床形态学属性、共 20,411 条记录的统一数据集。
PhysTacGen 是一个视觉到光学触觉图像生成框架,通过融合材料感知描述与几何条件来合成触觉图像。
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
DensiTok 是一个可插拔模块,能直接加密预训练前馈 3DGS 模型的内部几何 token,让冻结的主干网络表现得像观测到远多于输入的视角。它把 token 压缩到紧凑隐空间,以相机几何为条件用单步 flow-matching 补全未观测视角的隐变量,再解码回 token 供原重建头使用,无需图像合成或额外编码器。
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
TF-PRVR 是首个免训练的部分相关视频检索(PRVR)框架,利用冻结的视觉-语言特征构建视频专属的层次化表示。它通过频率多尺度分析自适应划分时序边界,并构建统一多尺度图传播查询相关性,配合 moment-aware 评分策略聚合跨尺度结果。无需任务特定训练即可避免数据集过拟合,在视觉与时序特征各异的数据集上表现一致。
研究提出无监督长尾适配(ULTA)新场景,发现现有视觉语言模型适配方法在长尾分布下头部类别性能急剧下降,与监督长尾学习中尾部类别受损的现象相反。为此提出 MARS 模型,通过 Boundary-Preserving Alignment 和 Margin-aware Self-Refinement 缓解头部类别边界侵蚀并修正尾部与易混淆类别。
CueRator 是一个通过智能体搜索决策规则来适配冻结对比式多模态编码器的框架,在 OV-AVEBench 上将总平均分从 57.8 提升至 60.2,未见类别性能从 55.8 提升至 59.9,并将已见-未见差距从 7.1 缩小至 1.2。
研究者提出 Foveated Compression,将全分辨率图像编码一次,用原生分辨率与压缩分辨率视觉 token 混合表示,并训练行为自蒸馏的 Foveated Merger 与轻量 Foveated Selector 从九个空间单元中选一个保留原生分辨率。
针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。
研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。
AIMS 是一种可扩展的新视角合成框架,通过最远点采样选取固定数量的空间分布锚点视角,并用轻量级可学习集成器将邻近观测融合为增强锚点表示,使可用观测数量与全局合成模型处理的视角数解耦。
LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。
研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。
研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。
研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。
Artemis 是一个几何驱动的多智能体驾驶世界模型,通过从多智能体观测重建显式 3D 世界地图来统一各智能体的 3D 状态,提升跨视角一致性。其 GeoAdapter 模块可将动作引导生成的前景-背景控制图注入扩散 Transformer,并能区分非智能体的无控动态。
WiSPER 是一个两阶段框架,将姿态感知的预测式预训练与条件残差流精修结合,用于 WiFi CSI 多人 3D 姿态估计,训练需配对 CSI 与姿态标注,推理仅需 CSI。
DTFormer 是一个三模态(RGB-D-Text)语义分割框架,通过 Text-guided Semantic Alignment Module(TSAM)将文本线索编码为语义原型,并在编码器和解码器多层显式对齐 RGB-D 多模态特征,从而对表示学习施加语义正则。
研究者提出 State-Aware Interaction MIL,一种弱监督方法,保留各生物标志物特异的组织学表征并建模其交互,同时监督完整的四态分子配置。
研究者发布 SynAM-E,首个面向金属增材制造熔池监测的公开多源仿真事件相机基准,包含来自 8 家机构 15 个来源的 85 个物理校准事件分片,并提供公开基线与固定跨机器评测划分。
BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。
针对视觉语言模型测试时自适应中全局表示的背景偏置与基于熵的缓存准入不可靠问题,研究者提出 RADC,通过语义前景缓存从 CLIP 表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存。RADC 采用高斯风险准入将多视图表示建模为对角高斯分布,结合类间分离度与特征不确定性筛选可靠的缓存候选。在跨域与分布外基准上,RADC 取得了一致的 SOTA 表现。
研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。
研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。
研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。
研究者微调多语言编码器搭配仿射跨度标注头,在 35 种语言的前沿模型标注数据上训练,在 7 种语言 1,283 条人工金标测试段上取得最佳 redaction F1 88.8,远超 GLiNER2 的 69.1、Microsoft Presidio 的 57.3 和 OpenAI Privacy Filter 微调的 35.8。
研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。
研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。
研究者提出双向基准 GapEval,用于量化统一多模态模型(UMM)理解与生成能力之间的差距,每道题均可用图像和文本两种模态作答,实现双向推理与跨模态一致性的对称评估。实验显示,不同架构的 UMM 在两个方向上普遍存在持续差距,表明当前模型仅实现表层统一,而非深层认知融合。从知识操作角度的实证研究进一步发现,UMM 内部知识往往彼此割裂,跨模态的能力涌现与知识并不同步。
研究发现 EmoNet-Face-HQ 细粒度情绪识别基准的失败源于答案读取方式而非模型感知能力:改用 logits 逐类二分类读取后,11 个开源 VLM 全部超过专家一致性锚点(κ_w=0.507-0.586),其中 3 个显著优于微调模型 EIF(Small κ_w=0.551,Large κ_w=0.534)。
HINTT 团队提交第二届 MLC-SLM 挑战赛的系统,比较了级联与统一两种多语言说话人属性 ASR 方案。最终提交采用级联流水线,由微调后的 DiariZen 说话人分离模型、微调后的 Qwen3-ASR 模型和基于 LLM 的生成式纠错组成;同时用相同官方数据微调 VibeVoice-ASR 作为统一模型对比。
研究将物体从冻结的 V-JEPA 2 预测器中隐藏,发现其预测对静止物体仅部分保留、对容器内物体完全丢失,运动物体在 0.3 秒内即消失(V-JEPA 自带 tube mask 下为 0.5 秒,ViT-H 在 90% 掩码率下可保留至 1.1 秒)。
GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 较基准系统降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:携带音素信息的视觉表征,以及注入视觉证据而非缩放音频特征的融合方式。在携带音素的编码器下,注入相比掩码在 -10 dB 下带来 4.0-9.3 dB 的有效 SNR 增益。
研究提出一种统一的自回归扩散图生成模型,联合学习结构与特征,从观测到的垂直平面自底向上构建任意层级深度的完整3D场景图(3DSG)。该方法在合成场景、真实建筑平面图和机器人传感器数据等3DSG数据集上持续超越所有基于学习和随机的基线,并在最大层级和真实单层数据上超越可获取目标图尺寸的one-shot模型。