SALM:通过结构感知隐空间掩码建模解锁 CLIP 细粒度感知能力
研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。
研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。
PhysLDM 是一种面向体积形变动力学的一次性仿真潜在扩散范式,核心是整体式时空 VAE,在米级场景实现约 2.48 mm 重建精度和最高 78 倍 token 压缩。实验发现复杂形变动力学常呈混沌特性,确定性回归易产生非物理平均值,而扩散模型能更好建模其分布。该模型仅用运动学数据在 Objaverse 规模数据集上训练,即可零样本泛化到 GSO 和 Toys4K 等 OOD 数据集。
AIMS 是一种可扩展的新视角合成框架,通过最远点采样选取固定数量的空间分布锚点视角,并用轻量级可学习集成器将邻近观测融合为增强锚点表示,使可用观测数量与全局合成模型处理的视角数解耦。
LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。
针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。
研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。
GeoWM 是一种几何世界模型,可直接预测指定未来时刻的场景几何,无需递归 rollout。它利用几何基础模型将观测 RGB 帧转为几何历史,再通过 flow-matching transformer 预测未来几何,并用轻量相机运动预测器估计未来视角。
SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。
研究者提出免训练框架 HGSS(Hierarchically Grounded Semantic Surgery),通过层级跨度定位与动态属性绑定,在不更新模型权重的前提下实现组合式概念擦除。
研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。
研究提出一种基于计算机视觉的深度学习方法,用于在板球比赛中实时检测非法投球动作。系统从投球视频中提取肩部帧和出手帧,分析两帧间投球手臂角度变化,若角度差超过预设阈值(如 15 度)则判定为疑似非法投球。团队构建了包含 11 名男性投手、62 段视频的数据集,系统取得较高真阳性率,但数据集以右手常规动作为主,仍需在更多样环境和更大数据集上验证。
研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。
研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。
这篇综述对植物病害检测的视觉与深度学习方法进行了批判性分析,重点聚焦数据集问题,并基于采集场景、可获取性、植物多样性、病害构成、类别结构与失衡程度建立了分类体系。
研究团队为巴基斯坦旁遮普构建了结合 Random Forest、XGBoost、支持向量回归与 Ridge 堆叠集成、并搭配 MobileNetV2 叶片健康分类器的作物产量预测原型,部署为带 SHAP 解释的 Web 应用。
Artemis 是一个几何驱动的多智能体驾驶世界模型,通过从多智能体观测重建显式 3D 世界地图来统一各智能体的 3D 状态,提升跨视角一致性。其 GeoAdapter 模块可将动作引导生成的前景-背景控制图注入扩散 Transformer,并能区分非智能体的无控动态。
WiSPER 是一个两阶段框架,将姿态感知的预测式预训练与条件残差流精修结合,用于 WiFi CSI 多人 3D 姿态估计,训练需配对 CSI 与姿态标注,推理仅需 CSI。
DTFormer 是一个三模态(RGB-D-Text)语义分割框架,通过 Text-guided Semantic Alignment Module(TSAM)将文本线索编码为语义原型,并在编码器和解码器多层显式对齐 RGB-D 多模态特征,从而对表示学习施加语义正则。
研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。
研究者提出 State-Aware Interaction MIL,一种弱监督方法,保留各生物标志物特异的组织学表征并建模其交互,同时监督完整的四态分子配置。
研究者发布 SynAM-E,首个面向金属增材制造熔池监测的公开多源仿真事件相机基准,包含来自 8 家机构 15 个来源的 85 个物理校准事件分片,并提供公开基线与固定跨机器评测划分。
BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。
DistScene 是一个从单张图像生成组合式 3D 场景的框架,将环境作为显式场景组件与物体联合建模,以提供物体摆放的几何上下文。
针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。
UniPro 是一个统一的多模式医学图像分割模型,通过传播机制把 2D 分割扩展到 3D 体数据,在单一基于切片的框架内同时支持语义分割、上下文分割、交互式分割和基于传播的分割。
针对视觉语言模型测试时自适应中全局表示的背景偏置与基于熵的缓存准入不可靠问题,研究者提出 RADC,通过语义前景缓存从 CLIP 表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存。RADC 采用高斯风险准入将多视图表示建模为对角高斯分布,结合类间分离度与特征不确定性筛选可靠的缓存候选。在跨域与分布外基准上,RADC 取得了一致的 SOTA 表现。
研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。
一项案例研究评估了混合 4/8-bit 量化(平均每参数 6 bit 和 7 bit)的 Qwen2-Audio-7B-Instruct,在 508 条英译德 FLEURS 语音和 512 条 RAVDESS 情感片段上,两种分配的 BLEU 和 chrF 与 FP16 的差异区间均包含零。
研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。
研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。
研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。
研究团队扩展 F5-TTS,提出一种无需 Lombard 专用训练数据的可控 TTS 系统,可零样本合成 Lombard 风格语音。该方法通过可学习的风格嵌入并用 PCA 分析其隐空间,找到与 Lombard 属性相关的方向,从而对发声力度和清晰度实现可解释控制。实验显示该方法在保持说话人身份与自然度的同时提升了噪声环境下的可懂度,并可泛化到未见过的说话人。
针对现有 LLM 推荐方法忽视或难以建模用户-物品高阶交互的问题,研究者提出 ELMRec,通过增强 whole-word embeddings 让 LLM 无需图预训练即可理解图结构交互,并针对 LLM 更依赖用户早期交互而非近期交互的现象加入重排序方案。ELMRec 在直接推荐和序列推荐上均优于 SOTA 方法,该论文已被 EMNLP 2024 Main 接收。
DivLM 是一个面向 LLM 创意短篇故事生成的后训练框架,通过持续预训练加权重残差恢复指令跟随能力,再用自定义复合奖励的强化学习,在体裁、语气、风格和命名实体四个维度上提升多样性。在两个 LLM 系列上的实验显示,其多样性指标平均提升超过 9%,同时保持指令跟随、整体回复质量和与人类输出的相似度。
研究者构建了 Wikidata Search Traces 数据集,包含 10,235 条单实体与多跳问题的求解轨迹,以及生成这些轨迹的递归语言模型(RLM)harness。
研究将 TypeSafe 宣传的 "System One" 模型 JEV 与 GPT-6 Luna、Qwen3.8-27B 及已发表研究中的人类编码员在七项政治学复现任务上对比,发现 JEV 准确率与两款 LLM 相当或接近。
研究者提出一套用 LLM 从大规模社交媒体语料中归纳式抽取并编目"主张"(claims)的流水线,并应用于 2020 年美国大选和 2022 年 FIFA 世界杯两个 Twitter 数据集。团队通过人工标注样本衡量召回率与精确率、开展消融实验并做定性错误分析,同时给出各数据集得到的主张目录。
研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。
针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。