跳到正文
今天10月7日周三167 条
  1. arXiv cs.LG26

    视觉语言模型中的空间变量绑定双机制

    视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。

  2. arXiv cs.CL22

    语言模型具备文字系统感知能力吗?AACL-IJCNLP 2026 研究测试 SLM 与 LLM 的多文字系统知识

    一项被 AACL-IJCNLP 2026 接收的研究测试了 SLM 与 LLM 是否具备文字系统(script)知识,即能否让输出文字系统匹配输入,以及能否遵循指定文字系统的指令。测试模型均达到近乎完美的拉丁文字系统保真度(超过 98%),并能高频遵循文字系统指令,但 LLM 在非标准文字系统组合上得分高于 SLM。

  3. arXiv cs.CL13

    ARIA:面向粤语歌词创作的声音驱动旋律-声调关系建模

    针对粤语歌词创作中旋律与声调需紧密对齐的问题,研究者提出 ARIA 框架,可直接从带字符级时间戳的演唱录音生成粤语歌词。该框架先用 TRATE 从演唱音频预测 0243 声调序列,再用 DRA-TCLG 结合检索增强的词汇引导生成流畅歌词,并构建了大规模对齐的音频-粤拼-0243 数据集。

  4. arXiv cs.CL25

    读取而非操控:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测

    研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。

  5. arXiv cs.CL22

    儿童手语翻译安全审计:SLT 与儿童安全防护的交叉评估缺失

    自动手语翻译(SLT)已进入消费产品,但尚无公开系统将 SLT 与儿童安全防护工具联合评估,主流已部署 SLT 模型也未在 18 岁以下手语者上训练或正式评测。否定、角色、保密、紧急或求助等翻译错误可能在不影响流畅度的情况下改变安全判定。论文提出一套由聋人群体参与部署前审计框架,含失败分类、场景模板、四种比较条件和四项结果指标,计划以 Auslan 为首个案例。

  6. arXiv cs.CL24

    EMODE:面向情感感知语音语言建模的动态副语义专家

    EMODE 是一个情感感知语音语言模型,核心是动态副语义专家(DPSE),将连续语音特征拆分为语义与副语言两条路径并动态路由、融合后再接入语言模型。它采用语义预热、副语言激活、联合精调三阶段课程训练,配合 OEG、SAA 与 GDR 引导。在 SER 测试、共情回复评测及新建双语 MEPA 基准上,EMODE 改善了词汇保真与情感敏感度的平衡。

  7. arXiv cs.LG13

    基于混合专家机制的自适应无线图像语义通信

    研究提出一种面向MIMO信道的多阶段端到端图像语义通信系统,基于自适应MoE Swin Transformer块,通过动态专家门控机制联合评估实时CSI与图像patch语义内容来计算路由概率,仅激活相关专家子集。仿真结果显示,该方法在保持传输效率的同时,重建质量较现有方法显著提升。

  8. arXiv cs.LG17

    重新思考微调:Mask Fine-Tuning 无需改动权重即可释放视觉语言模型隐藏能力

    研究者提出 Mask Fine-Tuning(MFT),一种不修改骨干权重的视觉语言模型适配方法,通过学习掩码选择性路由预训练连接中的信息,动态发现更对齐下游目标的子网络。实验显示 MFT 在多个视觉语言基准上持续优于 Full Fine-Tuning(FFT)和 Parameter-Efficient Fine-Tuning(PEFT),且不增加知识、不改变部署架构。

  9. arXiv cs.LG22

    冻结的 VideoLLM 是否已编码证据就绪信号?Readiness Gating 提升回答时机准确率

    研究发现冻结的 VideoLLM 已线性编码"证据就绪"信号,在 7 个模型的字节级相同评测中 AUROC 达 0.733-0.905,且该信号随问题变化而反转(66.1% 配对),在错误回答中仍保持 0.722。基于此提出的 Readiness Gating 回答时机策略在相同视频时长下最高提升准确率 +9.75 个百分点,计算开销可忽略。

  10. arXiv cs.LG17

    多模态几何表示中的方向依赖响应:超越扰动幅度

    研究发现多模态几何对齐分数对模态退化的响应并非由扰动幅度主导,位移幅度最多只能解释15%的样本外方差。基于Gram行列式的闭式一阶展开,作者提出方向性几何响应(DGR),在MSR-VTT(N=878)和DiDeMo(N=980)上取得0.838-0.969的样本外R²和0.864-0.963的匹配幅度排序准确率。DGR依赖已观测的退化状态位移,属于解释性量而非部署时预测器。

  11. arXiv cs.LG22

    DIPrune:面向高效多模态语言模型的双重要性任务感知 token 剪枝

    DIPrune 是一种无需训练的多模态大语言模型 token 剪枝框架,通过基于排序的双重要性评分机制,联合优化层内静态特征显著性与层间动态语义演化。该方法将剪枝重构为最终任务损失失真最小化问题,并揭示了一个此前被忽视的跨层梯度项。在 LLaVA 和 Qwen-VL 上的实验表明,DIPrune 持续取得 SOTA 结果。

  12. arXiv cs.LG36

    多轮 LLM 的答案侧后门攻击:模型自生成触发词绕过安全拒答

    研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。

  13. arXiv cs.LG24

    SkillFormer:面向音频语言模型的技能分解适配方法

    SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。

  14. arXiv cs.LG13

    Identity-Conditioned Score Fusion:面向开放集行人重识别的身份条件化分数融合

    研究者提出身份条件化分数融合框架,无需训练即可为每个底库身份定制融合权重,通过对比身份内一致性与跨身份冒充者提取身份专属画像,并与查询条件化自适应结合。在三个换装行人重识别基准上,该方法一致优于统计、排序和学习类基线,假未识别率最高绝对降低 8.8%。

  15. arXiv cs.LG22

    语言能保留多少地点信息?零样本语言推理用于跨视角地理定位

    研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。

  16. arXiv cs.LG22

    HCMAN:融合乳腺钼靶与临床数据的混合跨模态注意力网络,用于低资源地区早期乳腺癌检测

    混合跨模态注意力网络(HCMAN)通过 Transformer 跨模态注意力机制融合乳腺钼靶图像与结构化临床数据,在埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张钼靶图像上实现 97.8% 准确率、97.2% 敏感度、98.3% 特异度和 0.987 的 AUC,显著优于纯图像基线。

  17. arXiv cs.LG31

    VAE 潜在空间中的颜色对齐及其应用:从 SD1.5 到 FLUX.2 的跨模型颜色子空间研究

    研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。

  18. arXiv cs.LG20

    Mu-DisCoCat:面向量子处理器组合泛化的变分流水线

    研究者提出 Mu-DisCoCat,一个面向 DisCoCat 的多模态变分量子学习框架,用于实现组合概念泛化(CoCoGen)。该框架先从单物体图文对学习稳定的物体表示,再固定这些表示学习多物体场景中的关系;经典模拟中使用 Uhlmann 态保真度计算多模态电路表示的重叠,关系 OOD 准确率高于所评估的 CLIP 基线。

  19. arXiv cs.LG22

    SemARC:通过自适应采集与序列融合实现高效多模态推理

    SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。

  20. arXiv cs.LG15

    面向异构曲率对齐的常曲率切片 Gromov-Wasserstein 方法

    研究者提出常曲率切片 Gromov-Wasserstein(CCSGW),一种用于对齐异构常曲率空间上概率分布的散度。该方法首次补全了球面空间基于测地线的一维投影,并将切片 GW 扩展到常曲率空间,在保留内在几何关系的同时避免高计算成本。将其接入图异常检测、图节点分类和多模态学习等混合曲率任务后,各类设置下均取得稳定性能提升。

  21. arXiv stat.ML24

    语言模型中的柏拉图表示理论:多语言模型跨语言相似性为何在中层达到峰值

    一项理论研究为多语言语言模型中层跨语言表示相似性现象提供了理论解释。研究者用共享上层但下层产生式规则不同的概率上下文无关文法生成合成语言,证明贝叶斯最优下一 token 预测器即信念传播(BP),将其消息编码进连续层所得解析预测与在同数据上训练的 Transformer 高度吻合。

  22. arXiv cs.AI22

    SAE++:级联稀疏自编码器学习多模态 LLM 的多层级视觉概念

    SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。

  23. arXiv cs.AI32

    SPATIALUNCERTAIN:VLM 能否判断何时不该回答空间问题?

    研究者提出 SPATIALUNCERTAIN 评测框架,用遮挡造成的证据缺失和透视造成的误导证据两类场景,考察视觉语言模型能否判断当前视角是否可靠。在八个开源与闭源 VLM 上,模型行为并不跟随视觉证据的可靠性:证据消失时不会更谨慎,透视冲突时判断更依赖投影外观而非未变的物理 3D 关系。

  24. arXiv cs.AI27

    DMAST:双模态多阶段对抗安全训练让多模态 Web Agent 抵御跨模态攻击

    针对多模态 Web Agent 双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并分三阶段协同训练。在 MiniWob++ 上,含视觉组件的攻击效果远超纯文本注入;在分布外任务上 DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%)。

  25. arXiv cs.AI24

    用多模态 LLM 实时生成游戏解说:基于停顿感知的解码方法

    研究提出两种基于提示的解码策略实现实时游戏视频解说生成:固定间隔解码与动态间隔解码,后者根据上一句解说的预估时长调整下一次预测时机,无需微调即可实现停顿感知生成。在日语和英语的赛车与格斗游戏数据集上,动态间隔解码生成的解说在时间与内容上更贴近人类解说。团队同时开源了多语言基准数据集、训练模型与实现代码。

  26. arXiv cs.AI22

    CLAS:面向多语言大模型的跨语言激活引导方法

    研究者提出跨语言激活引导(CLAS),一种无需训练、在推理时选择性调节神经元激活的干预方法,用于缩小大模型主导语言与非主导语言之间的性能差距。在分类和生成基准上,CLAS 平均提升 2.3%(Acc.)和 3.4%(F1),同时保持高资源语言性能。研究发现有效迁移依赖功能分化而非严格对齐,性能增益与语言聚类分离度提升相关,该方法无需修改模型权重。

  27. arXiv cs.AI35

    Speak to a Protein:交互式多模态蛋白质研究 AI 协同科学家

    Speak to a Protein 是一款交互式多模态 AI 协同科学家,可将蛋白质分析转化为对话,检索并整合文献、结构与配体数据,在实时 3D 场景中给出有依据的回答,并支持高亮、标注、操作和查看可视化。该系统还能按需生成并运行代码,以文本和图形解释结果,用于探究结合口袋、构象变化和构效关系。该工具免费开放使用。

  28. arXiv cs.AI22

    CMCM-DLM:用扩散语言模型实现跨模态可控分子生成

    研究者提出 CMCM-DLM,一个模块化框架,可将预训练扩散模型扩展至支持异构分子约束而无需重训主干。该框架用结构控制模块(SCM)在扩散早期引导分子骨架生成,再由性质控制模块(PCM)将生成导向目标化学性质。多数据集实验显示其具备有效的跨模态可控性与较强适应性。

  29. arXiv cs.AI24

    微调 VLM 提升 AI 空间智能:理解 3D 与 2D 旋转

    研究通过微调 Google DeepMind 的 Gemma-4 MoE 模型提升视觉语言模型的空间推理能力,在 2D 和 3D 旋转检测上均取得明显改进。微调后的 Gemma-4 MoE 模型在预测由轴和角度定义的旋转时显著优于微调后的 Gemma-4 通用模型,且无需显式坐标系即可改善 2D 表示的角度估计。研究还发现,可识别物体并未提升角度检测准确率,具有显著线性特征的物体反而表现更好。

  30. arXiv cs.AI22

    用结构化 CoT 提升 AI 空间智能:GPT-5.6 的 3D 旋转可视化与推理

    研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。