跳到正文
今天10月7日周三1100 条
  1. arXiv cs.CV22

    PhysLDM:面向高保真形变仿真的潜在扩散模型

    PhysLDM 是一种面向体积形变动力学的一次性仿真潜在扩散范式,核心是整体式时空 VAE,在米级场景实现约 2.48 mm 重建精度和最高 78 倍 token 压缩。实验发现复杂形变动力学常呈混沌特性,确定性回归易产生非物理平均值,而扩散模型能更好建模其分布。该模型仅用运动学数据在 Objaverse 规模数据集上训练,即可零样本泛化到 GSO 和 Toys4K 等 OOD 数据集。

  2. arXiv cs.CV23

    LARK:低成本、高精度、抗遮挡的卡尔曼滤波辅助图像引导手术跟踪系统

    LARK 是一套基于消费级 RGB 硬件与多视角冗余融合的多相机光学跟踪系统,在五相机与自适应卡尔曼滤波下,加工网格上的点定位中位目标配准误差为 0.64 mm,轨迹跟踪为 0.73 mm。相机子集实验显示,可用视角减少时自适应位姿融合精度平缓下降。其跟踪硬件成本低于 1,000 美元,硬件设计与软件已公开,数据集同步开放。

  3. arXiv cs.CV24

    SRIM:面向恶意编辑的尺度鲁棒图像免疫保护扰动方法

    针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。

  4. arXiv cs.CV22

    视觉语言模型微调中的语义能力获取与特化

    研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。

  5. arXiv cs.CV18

    SimCortex v2:近乎零碰撞与自交的联合皮层表面重建

    SimCortex v2 是一个从 T1 加权 MRI 同时重建左右脑 WM 与 pial 表面的深度学习框架,在 14 个队列 560 例(13 个训练中未见)上平均对称表面距离 0.253 mm,与最强基线持平。92.14% 的病例未检测到表面间碰撞,自交比例 0.044% 为学习类方法中最低,而所有基线在每个病例中均至少产生一次碰撞。源代码、配置、预训练权重、预处理数据与评测划分已公开。

  6. arXiv cs.CV22

    LAO-X:无需人工标注即可定位 X 光安检扫描中的任意物体

    研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。

  7. arXiv cs.CV12

    基于深度学习的板球非法投球动作检测

    研究提出一种基于计算机视觉的深度学习方法,用于在板球比赛中实时检测非法投球动作。系统从投球视频中提取肩部帧和出手帧,分析两帧间投球手臂角度变化,若角度差超过预设阈值(如 15 度)则判定为疑似非法投球。团队构建了包含 11 名男性投手、62 段视频的数据集,系统取得较高真阳性率,但数据集以右手常规动作为主,仍需在更多样环境和更大数据集上验证。

  8. arXiv cs.CV22

    CALR:通过 Render-of-Thought 压缩实现连续锚定潜在推理

    研究者提出连续锚定潜在推理方法 CALR,通过信息均衡压缩生成参考潜在状态,将答案监督经由中间状态传递,并用推导级语义锚定约束解码内容。在五个数学推理基准上,CALR 在同等预算下比同类连续潜在推理方法提升 26.0 个百分点,其潜在状态既能支撑答案预测,也携带问题特定的中间推理。

  9. arXiv cs.CV22

    R2RI:面向机器人间交互的多视角事件与 RGB 数据集

    研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。

  10. arXiv cs.CV24

    MoonGS:用图像对鲁棒深度特征实现月表高质量高斯泼溅重建

    MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅需两张输入图像即可单次前向预测像素对齐的高斯图元,无需逐场景优化。在 LuSNAR 基准和弱纹理 MoonBlender 数据集上,其 PSNR 比 SOTA 前馈 NeRF/3DGS 基线高 +4.9 dB、SSIM 高 +0.29、LPIPS 低 40%,并保持亚秒级推理。代码与数据集已公开。

  11. arXiv cs.CV12

    面向可泛化小样本类增量学习:学习筛选你生成的数据

    研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。

  12. arXiv cs.CV24

    BoT-Feedback:用生物力学证据为多模态推理提供依据,实现可解释的人体动作反馈

    BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。

  13. arXiv cs.CV24

    超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型

    针对文本到图像模型中概念激活轨迹偏离直线的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,KANSteer 比线性引导更贴合激活轨迹,对中间属性的遍历也更平滑。

  14. arXiv cs.CV17

    RADC:面向视觉语言测试时自适应的风险感知双缓存方法

    针对视觉语言模型测试时自适应中全局表示的背景偏置与基于熵的缓存准入不可靠问题,研究者提出 RADC,通过语义前景缓存从 CLIP 表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存。RADC 采用高斯风险准入将多视图表示建模为对角高斯分布,结合类间分离度与特征不确定性筛选可靠的缓存候选。在跨域与分布外基准上,RADC 取得了一致的 SOTA 表现。

  15. arXiv cs.CV39

    医学图像对齐评估成为前沿多模态模型通用视觉推理测试:GPT-6 准确率超 85%

    研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。

  16. arXiv cs.CL24

    语音语言模型能否像人类一样听音辨形?SLM 声音象征感知对齐研究

    研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。

  17. arXiv cs.CL22

    用跨语言迁移矩阵量化副语言语音任务中的语言依赖

    研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。

  18. arXiv cs.CL29

    AVMeme Exam:面向 LLM 语境与文化理解的多模态多语言多文化基准

    研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。

  19. arXiv cs.CL23

    基于可控风格嵌入的零样本 Lombard 语音合成

    研究团队扩展 F5-TTS,提出一种无需 Lombard 专用训练数据的可控 TTS 系统,可零样本合成 Lombard 风格语音。该方法通过可学习的风格嵌入并用 PCA 分析其隐空间,找到与 Lombard 属性相关的方向,从而对发声力度和清晰度实现可解释控制。实验显示该方法在保持说话人身份与自然度的同时提升了噪声环境下的可懂度,并可泛化到未见过的说话人。

  20. arXiv cs.CL22

    ELMRec:增强 LLM 推荐模型的高阶交互感知

    针对现有 LLM 推荐方法忽视或难以建模用户-物品高阶交互的问题,研究者提出 ELMRec,通过增强 whole-word embeddings 让 LLM 无需图预训练即可理解图结构交互,并针对 LLM 更依赖用户早期交互而非近期交互的现象加入重排序方案。ELMRec 在直接推荐和序列推荐上均优于 SOTA 方法,该论文已被 EMNLP 2024 Main 接收。

  21. arXiv cs.CL24

    DivLM:提升 LLM 短篇故事生成多样性的后训练框架

    DivLM 是一个面向 LLM 创意短篇故事生成的后训练框架,通过持续预训练加权重残差恢复指令跟随能力,再用自定义复合奖励的强化学习,在体裁、语气、风格和命名实体四个维度上提升多样性。在两个 LLM 系列上的实验显示,其多样性指标平均提升超过 9%,同时保持指令跟随、整体回复质量和与人类输出的相似度。

  22. arXiv cs.CL22

    用 LLM 从大规模社交媒体语料中归纳式抽取主张

    研究者提出一套用 LLM 从大规模社交媒体语料中归纳式抽取并编目"主张"(claims)的流水线,并应用于 2020 年美国大选和 2022 年 FIFA 世界杯两个 Twitter 数据集。团队通过人工标注样本衡量召回率与精确率、开展消融实验并做定性错误分析,同时给出各数据集得到的主张目录。

  23. arXiv cs.CL22

    LLM 在不完美表格上的问答错误研究:错误发现与处理机制

    研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。

  24. arXiv cs.CL22

    GAMA:面向 schema-as-code 生物医学命名实体识别的指南增强多智能体框架

    针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。