跳到正文
今天10月7日周三547 条
  1. arXiv cs.CV22

    数字孪生驱动的 Real2Sim2Real:通过配对驾驶场景重建实现模拟器条件生成

    数字孪生驱动的 Real2Sim2Real 流程(DT-R2S2R)可在数字孪生覆盖区域内替代目标区域真实数据。该方法通过地理参考数字孪生重建驾驶片段(DT-R2S),以几何对齐的模拟器渲染结果作为扩散模型条件,得到 DT-S2R 模型,无需目标图像即可合成逼真驾驶图像。

  2. arXiv cs.CV29

    CCDF:面向真实监控场景深伪检测的基准数据集

    研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。

  3. arXiv cs.CV17

    从实验室到道路:评估驾驶场景下可穿戴眼动追踪的注视精度

    一项真实道路驾驶研究对可穿戴眼动追踪的注视精度进行了量化,41 个有效场景中驾驶员注视车牌,平均注视误差为 4.58 度。应用室内录制的偏移量校正后,误差降至 1.10 度,全部 41 个场景均有改善。由于该偏移量在不同场次间存在变化,可靠的 BEV 监督可能需要在线重校准和依赖条件的注视不确定性估计。

  4. arXiv cs.CV15

    VFSSKep 数据集与 S³KL 框架:面向视频荧光吞咽研究的结构感知关键点定位

    研究团队发布 VFSSKep 数据集并提出 S³KL 结构感知半监督关键点定位框架,将标注扩展至软腭并纳入大规模无标注数据。S³KL 通过结构感知学习与块混洗的结构表示一致性学习克服空间偏置,仅用 25% 标注数据即超越 100% 标注的全监督学习,达到半监督 SOTA。代码与数据将公开,成果已被 ICME 2026 Oral 接收。

  5. arXiv cs.CV12

    AM²ES:面向生存预测的锚点驱动多模态多尺度专家选择框架

    针对病理全切片图像与转录组数据融合中语义错位和空间异质性问题,研究者提出锚点驱动的多模态多尺度专家选择框架 AM²ES。其 AMF 模块用可学习语义锚点对齐转录组特征与多尺度病理表征,H-MoE 模块则先做尺度内专家过滤、再做跨尺度层级路由。在多个 TCGA 癌症队列上,AM²ES 取得 SOTA 性能,并可可视化分子通路如何驱动跨组织尺度的专家路由决策。

  6. arXiv cs.CV22

    SALM:通过结构感知隐空间掩码建模解锁 CLIP 细粒度感知能力

    研究者提出 SALM,一种基于结构感知隐空间掩码建模的无监督嵌入对齐框架,无需任何图文对即可增强 CLIP 的细粒度感知能力。SALM 通过双矩阵对齐策略显式校准样本内空间相关性与激活强度,并设计隐空间掩码建模机制隐式聚合细粒度结构;基于 CLIP 浅层特征具备强空间观测能力的发现,进一步扩展出高效自蒸馏范式 SALM-Self。

  7. arXiv cs.CV22

    PhysLDM:面向高保真形变仿真的潜在扩散模型

    PhysLDM 是一种面向体积形变动力学的一次性仿真潜在扩散范式,核心是整体式时空 VAE,在米级场景实现约 2.48 mm 重建精度和最高 78 倍 token 压缩。实验发现复杂形变动力学常呈混沌特性,确定性回归易产生非物理平均值,而扩散模型能更好建模其分布。该模型仅用运动学数据在 Objaverse 规模数据集上训练,即可零样本泛化到 GSO 和 Toys4K 等 OOD 数据集。

  8. arXiv cs.CV22

    视觉语言模型微调中的语义能力获取与特化

    研究追踪视觉语言模型微调过程中的语义能力轨迹,发现微调可在预训练基础上获得新的语义能力,且不同能力在不同阶段达到峰值。在 DFN、MetaCLIP 和 OpenAI CLIP 六种预训练骨干上,结构化语义路由(SSR)配合随机名称分支 dropout 显著提升无名称属性画像检索。按目标类名检索选出的 checkpoint 未必对应可迁移的语义最优,持续优化可能削弱此前获得的可迁移语义能力。

  9. arXiv cs.CV22

    LAO-X:无需人工标注即可定位 X 光安检扫描中的任意物体

    研究者提出自监督适配框架 LAO-X,无需任何人工标注即可在 X 光安检扫描中定位任意物体。该方法通过显著性引导的物体挖掘与吸收度域的物理合成生成图像—标注对,并用遮挡控制的课程策略微调 SAM2 定位器。在六个 X 光基准上,LAO-X 在高度杂乱场景中较 SAM2 及 X 光专用基线提升 2% 至 23% mAP。

  10. arXiv cs.CV22

    R2RI:面向机器人间交互的多视角事件与 RGB 数据集

    研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。

  11. arXiv cs.CV12

    面向可泛化小样本类增量学习:学习筛选你生成的数据

    研究提出可泛化小样本类增量学习(G-FSCIL)设定,即基类会话本身仅有少量类别。方法用冻结的潜在扩散模型构建类特定合成候选池,并学习兼顾语义一致性与视觉多样性的知识筛选策略,将其蒸馏为可迁移的选择策略在基类会话后复用。配合合成信息原型初始化与双向边界校准,该方法在实验中持续优于现有 FSCIL 基线,减少遗忘并改善新旧类平衡。

  12. arXiv cs.CV24

    BoT-Feedback:用生物力学证据为多模态推理提供依据,实现可解释的人体动作反馈

    BoT-Feedback 框架通过将 MLLM 推理建立在结构化生物力学证据上,提升人体动作反馈生成质量。其核心 Biomechanics of Thought(BoT)四阶段推理框架,配合即插即用的 Biomechanical Data Parser(BDP)与专家-学生动作时序对齐策略,并引入含配对师生视频、3D 骨架与专家标注的 BiomAF 基准。

  13. arXiv cs.CL22

    用跨语言迁移矩阵量化副语言语音任务中的语言依赖

    研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。

  14. arXiv cs.CL24

    DivLM:提升 LLM 短篇故事生成多样性的后训练框架

    DivLM 是一个面向 LLM 创意短篇故事生成的后训练框架,通过持续预训练加权重残差恢复指令跟随能力,再用自定义复合奖励的强化学习,在体裁、语气、风格和命名实体四个维度上提升多样性。在两个 LLM 系列上的实验显示,其多样性指标平均提升超过 9%,同时保持指令跟随、整体回复质量和与人类输出的相似度。

  15. arXiv cs.CL22

    用 LLM 从大规模社交媒体语料中归纳式抽取主张

    研究者提出一套用 LLM 从大规模社交媒体语料中归纳式抽取并编目"主张"(claims)的流水线,并应用于 2020 年美国大选和 2022 年 FIFA 世界杯两个 Twitter 数据集。团队通过人工标注样本衡量召回率与精确率、开展消融实验并做定性错误分析,同时给出各数据集得到的主张目录。

  16. arXiv cs.CL22

    LLM 在不完美表格上的问答错误研究:错误发现与处理机制

    研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。

  17. arXiv cs.CL22

    GAMA:面向 schema-as-code 生物医学命名实体识别的指南增强多智能体框架

    针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。

  18. arXiv cs.CL12

    约鲁巴语轮廓声调标注:一项排版与计算方案

    针对约鲁巴语轮廓声调在正字法中长期难以标注、部分人名拼写甚至因此反转含义的问题,该论文提出采用 caron 和 circumflex 符号在单元音上编码升调和降调。这一做法可追溯至 Olmsted(1951)的约鲁巴语音学研究,并首次使这些声调可通过标准键盘输入和计算文本处理实现。方案已在 WriteYoruba 键盘和 TTSYoruba 语音合成器中落地实现。

  19. arXiv cs.CL22

    测试时扩展与后训练在个体立场预测中为何失效?

    研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。