跳到正文
今天10月7日周三1232 条
  1. arXiv cs.CV17

    RADC:面向视觉语言测试时自适应的风险感知双缓存方法

    针对视觉语言模型测试时自适应中全局表示的背景偏置与基于熵的缓存准入不可靠问题,研究者提出 RADC,通过语义前景缓存从 CLIP 表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存。RADC 采用高斯风险准入将多视图表示建模为对角高斯分布,结合类间分离度与特征不确定性筛选可靠的缓存候选。在跨域与分布外基准上,RADC 取得了一致的 SOTA 表现。

  2. arXiv cs.CV39

    医学图像对齐评估成为前沿多模态模型通用视觉推理测试:GPT-6 准确率超 85%

    研究用医学图像对齐评估测试前沿多模态大模型的通用视觉推理能力,GPT-6 在几乎所有测试场景中准确率超过 85%,而几个月前发布的模型泛化较差、部分场景仅略高于随机水平。微调后的本地模型可在训练任务上追平甚至超越前沿模型,但迁移到未见场景时效果明显更差。

  3. arXiv cs.CL24

    语音语言模型能否像人类一样听音辨形?SLM 声音象征感知对齐研究

    研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。

  4. arXiv cs.CL22

    用跨语言迁移矩阵量化副语言语音任务中的语言依赖

    研究提出跨语言迁移矩阵(CLTM),用于系统量化给定任务内语言对之间的跨语言交互。基于多语言 HuBERT 编码器,作者在性别识别和说话人验证两项副语言语音任务上分析了微调时供体语言数据对目标语言性能的影响,结果揭示出任务与语言间存在系统性、语言依赖的迁移模式。

  5. arXiv cs.CL29

    AVMeme Exam:面向 LLM 语境与文化理解的多模态多语言多文化基准

    研究者推出 AVMeme Exam,一个由人工整理的千余条互联网标志性声音与视频基准,覆盖语音、歌曲、音乐和音效,每条配独特 Q&A 考察从表层内容到语境、情感、用法与世界知识的理解。对当前 SOTA 多模态大语言模型的系统评测显示,模型在无文本音乐和音效上表现较差,且在语境与文化推理上弱于表层内容理解。该基准已被 COLM 2026 接收。

  6. arXiv cs.CL23

    基于可控风格嵌入的零样本 Lombard 语音合成

    研究团队扩展 F5-TTS,提出一种无需 Lombard 专用训练数据的可控 TTS 系统,可零样本合成 Lombard 风格语音。该方法通过可学习的风格嵌入并用 PCA 分析其隐空间,找到与 Lombard 属性相关的方向,从而对发声力度和清晰度实现可解释控制。实验显示该方法在保持说话人身份与自然度的同时提升了噪声环境下的可懂度,并可泛化到未见过的说话人。

  7. arXiv cs.CL22

    ELMRec:增强 LLM 推荐模型的高阶交互感知

    针对现有 LLM 推荐方法忽视或难以建模用户-物品高阶交互的问题,研究者提出 ELMRec,通过增强 whole-word embeddings 让 LLM 无需图预训练即可理解图结构交互,并针对 LLM 更依赖用户早期交互而非近期交互的现象加入重排序方案。ELMRec 在直接推荐和序列推荐上均优于 SOTA 方法,该论文已被 EMNLP 2024 Main 接收。

  8. arXiv cs.CL24

    DivLM:提升 LLM 短篇故事生成多样性的后训练框架

    DivLM 是一个面向 LLM 创意短篇故事生成的后训练框架,通过持续预训练加权重残差恢复指令跟随能力,再用自定义复合奖励的强化学习,在体裁、语气、风格和命名实体四个维度上提升多样性。在两个 LLM 系列上的实验显示,其多样性指标平均提升超过 9%,同时保持指令跟随、整体回复质量和与人类输出的相似度。

  9. arXiv cs.CL22

    用 LLM 从大规模社交媒体语料中归纳式抽取主张

    研究者提出一套用 LLM 从大规模社交媒体语料中归纳式抽取并编目"主张"(claims)的流水线,并应用于 2020 年美国大选和 2022 年 FIFA 世界杯两个 Twitter 数据集。团队通过人工标注样本衡量召回率与精确率、开展消融实验并做定性错误分析,同时给出各数据集得到的主张目录。

  10. arXiv cs.CL22

    LLM 在不完美表格上的问答错误研究:错误发现与处理机制

    研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。

  11. arXiv cs.CL22

    GAMA:面向 schema-as-code 生物医学命名实体识别的指南增强多智能体框架

    针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。

  12. arXiv cs.CL12

    约鲁巴语轮廓声调标注:一项排版与计算方案

    针对约鲁巴语轮廓声调在正字法中长期难以标注、部分人名拼写甚至因此反转含义的问题,该论文提出采用 caron 和 circumflex 符号在单元音上编码升调和降调。这一做法可追溯至 Olmsted(1951)的约鲁巴语音学研究,并首次使这些声调可通过标准键盘输入和计算文本处理实现。方案已在 WriteYoruba 键盘和 TTSYoruba 语音合成器中落地实现。

  13. arXiv cs.CL22

    测试时扩展与后训练在个体立场预测中为何失效?

    研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。

  14. arXiv cs.CL22

    合成调研验证新框架:LLM 合成受访者应验证后果性行为与表征公平性

    针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。

  15. arXiv cs.CL27

    Dream-RSI:通过演化世界实现递归自我改进

    Dream-RSI 是一个让 AI 智能体递归自我改进探索策略的框架,它把历史发现树当作回放模拟器,在模拟器中"做梦"获得低成本 off-policy 反馈来评估和优化探索策略,无需反复进行昂贵的在线评估。改进后的策略再部署到线上驱动新发现,持续扩充模拟器池形成自我改进循环。在 4 个领域的 9 项任务上,Dream-RSI 取得有竞争力的质量并提升了发现效率。

  16. arXiv cs.CL22

    语音-文本语言模型的生成模态差距如何量化?SLT 2026 研究给出统一评测

    一项被 SLT 2026 接收的研究构建了统一生成式评测套件,在匹配数据分布与生成设置下对比纯语音、纯文本和语音-文本语言模型。结果显示联合语音-文本建模显著提升语义连贯性,但音素级指标变化有限,说话人相似度与预测质量反而更低,情感分布指标则有所改善。相比更大规模的纯语音模型,该语音-文本模型在基于转写的语义连贯性上缩小了大部分规模差距。

  17. arXiv cs.CL22

    WinoQueer-NL:评估荷兰语模型对 LGBTQ+ 群体的偏见

    研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。

  18. arXiv cs.CL18

    频率结构如何影响迭代学习模型中的语言组合性

    迭代学习模型研究发现,当高频含义被赋予更高出现频率时,它们可以像自然语言一样摆脱低频含义所遵循的语法约束。但若频率结构施加在含义向量的组成部分而非完整含义向量上,语言将无法跨代稳定传递,即便最高频元素能被可靠习得。结果表明,频率只有在学习者能整体习得的形式-含义单元上分布时,才能塑造涌现的语言结构。

  19. arXiv cs.CL18

    手语对话中的情感识别:eJSL Dialog 数据集与基准测试

    研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。

  20. arXiv cs.CL32

    行为经济学博弈可预测多智能体 LLM 团队在 AI for Science 任务中的表现

    研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。

  21. arXiv cs.CL22

    法国合成社交媒体情感分析:用 170 万条合成推文训练 600M 参数推理模型

    研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。

  22. arXiv cs.CL32

    GapEval:量化统一多模态模型理解与生成之间的差距

    研究者提出双向基准 GapEval,用于量化统一多模态模型(UMM)理解与生成能力之间的差距,每道题均可用图像和文本两种模态作答,实现双向推理与跨模态一致性的对称评估。实验显示,不同架构的 UMM 在两个方向上普遍存在持续差距,表明当前模型仅实现表层统一,而非深层认知融合。从知识操作角度的实证研究进一步发现,UMM 内部知识往往彼此割裂,跨模态的能力涌现与知识并不同步。

  23. arXiv cs.CL25

    TabiBERT:基于 ModernBERT 的土耳其语大规模基础模型与统一基准 TabiBench

    研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。

  24. arXiv cs.CL34

    Common Corpus:面向 LLM 预训练的最大规模伦理数据集

    Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。

  25. arXiv cs.CL24

    DyaFDB:全双工对话模型的二元评估框架

    研究者提出 DyaFDB,一个在二元设定下评估全双工语音对话模型的框架:两个模型按指定角色直接对话,目标可合作或冲突,双方均由外部裁判离线打分。该框架实例化 4 项任务、140 个场景,记录 7,560 段对话,覆盖 6 种自博弈与交叉配对。实验显示模型行为会持续重塑其对话伙伴,因此每个模型必须同时充当对方的考官与被试,固定 interlocutor 无法胜任。