跳到正文
今天10月7日周三563 条
  1. arXiv cs.CL22

    用 LLM 从大规模社交媒体语料中归纳式抽取主张

    研究者提出一套用 LLM 从大规模社交媒体语料中归纳式抽取并编目"主张"(claims)的流水线,并应用于 2020 年美国大选和 2022 年 FIFA 世界杯两个 Twitter 数据集。团队通过人工标注样本衡量召回率与精确率、开展消融实验并做定性错误分析,同时给出各数据集得到的主张目录。

  2. arXiv cs.CL22

    LLM 在不完美表格上的问答错误研究:错误发现与处理机制

    研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。

  3. arXiv cs.CL22

    GAMA:面向 schema-as-code 生物医学命名实体识别的指南增强多智能体框架

    针对 LLM 做 BioNER 时数据集标注语义不清、自由生成缺乏结构约束的问题,研究者提出指南增强多智能体框架 GAMA,先从标注训练实例归纳并验证标注规则构建指南记忆,再由规划组件生成带理由的 span-type 假设、编码组件转为 schema 约束的实体对象,并经验证模块做双循环精修。在五个常用 BioNER 数据集、多种 LLM 主干上,GAMA 持续优于强 LLM 基线。

  4. arXiv cs.CL12

    约鲁巴语轮廓声调标注:一项排版与计算方案

    针对约鲁巴语轮廓声调在正字法中长期难以标注、部分人名拼写甚至因此反转含义的问题,该论文提出采用 caron 和 circumflex 符号在单元音上编码升调和降调。这一做法可追溯至 Olmsted(1951)的约鲁巴语音学研究,并首次使这些声调可通过标准键盘输入和计算文本处理实现。方案已在 WriteYoruba 键盘和 TTSYoruba 语音合成器中落地实现。

  5. arXiv cs.CL22

    测试时扩展与后训练在个体立场预测中为何失效?

    研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。

  6. arXiv cs.CL22

    合成调研验证新框架:LLM 合成受访者应验证后果性行为与表征公平性

    针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。

  7. arXiv cs.CL22

    WinoQueer-NL:评估荷兰语模型对 LGBTQ+ 群体的偏见

    研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。

  8. arXiv cs.CL18

    手语对话中的情感识别:eJSL Dialog 数据集与基准测试

    研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。

  9. arXiv cs.CL22

    法国合成社交媒体情感分析:用 170 万条合成推文训练 600M 参数推理模型

    研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。

  10. arXiv cs.CL25

    TabiBERT:基于 ModernBERT 的土耳其语大规模基础模型与统一基准 TabiBench

    研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。

  11. arXiv cs.CL34

    Common Corpus:面向 LLM 预训练的最大规模伦理数据集

    Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。

  12. arXiv cs.CL29

    旧事实回归时:重读、回滚与时间记忆的边界

    一项基于 130 个软件修复原子状态转换的研究发现,基于身份的时间记忆在普通转换条件下模型判定准确率达 98.5%,但追加对旧陈述的逐字重读后准确率降至 10.8%,陈旧值比率升至 88.5%。一个拒绝重新激活已退役值的防护机制可将准确率恢复到 97.7%、陈旧值比率降至 0.8%,但无法在没有额外变更溯源的情况下识别合法的回滚。

  13. arXiv cs.CL22

    预测社交媒体信息级联增长:面向人机协同的虚假信息分诊

    研究将虚假信息早期分诊建模为"延续预测"问题:仅凭前30分钟活动预测传播树后续增长。在FibVID数据集352棵测试树上,结合节点数与结构深度熵、时间到达熵的模型将log变换后未来增长的R²从0.307提升至0.323,log-MAE降低2.4%;在97棵高活跃度树上R²从0.248升至0.395,Spearman's ρ从0.394升至0.529。

  14. arXiv cs.LG22

    量子数据加载器利用真实信号共享结构,单电路复用加载多信号

    一种量子原生加载器只需学习数据集的低维描述,即可用一组固定电路加载每个信号。在五个公开数据集的七种视图上,它以相同门成本达到最强结构化加载器的精度,且每个信号所需参数少数倍。预注册盲复现显示,信号规模扩大十六倍时,达到全信号精度十个百分点以内所需的随机子集大小保持稳定,而结构化加载器所需子集持续增长。

  15. arXiv cs.LG22

    量子生成模型研究:收敛的矩匹配损失无法可靠衡量泛化能力

    研究基准测试了13个量子与经典生成模型,在最高30 qubits的基数约束数据集和基因组单核苷酸变异数据集上直接采样。结果显示,将MMD²等矩匹配损失收敛到相同值的模型,对未见有效集的覆盖差异巨大,说明收敛的损失不能可靠衡量泛化能力。"经典训练、量子部署"流程必须通过采样来测量泛化,而这在目标规模下被认为需要量子设备。

  16. arXiv cs.CL26

    跨模型 LLM 共识不等于有效:K-12 数学辅导对话中学生失败模式诊断研究

    一项针对 K-12 数学辅导对话的探索性研究发现,LLM 对五种学生失败模式(不确定性、错误归因、算子选择、概念缺口、程序失误)的分类中,人机一致性仅为中等(kappa = .524-.597),而跨模型一致性显著更高(kappa = .755-.781;alpha = .769)。这表明跨模型共识可能制造正确性的假象,模型间的一致不能替代对推断构念有效性的独立证据。

  17. arXiv cs.CL22

    高风险应急信息中的生成式 AI 翻译

    一项针对地震指令文本英译中、英译西的实验显示,使用话语特定提示词可显著提升生成式 AI 译文的可理解性与可操作性,但译者仍可能不信任这些译文。研究指出人工修订依然必要,既为发现错误,也因这类信息需有人对错误或延误承担责任。

  18. arXiv cs.CL39

    LLM 会把闲聊和背景语音写进病历,干扰临床推理

    研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。

  19. arXiv cs.LG22

    粒子喷流生成的神经缩放定律研究

    研究首次探索粒子喷流生成任务中是否存在缩放定律,成功复现了模型规模缩放的对数缩放行为。研究发现切片 Wasserstein 距离与下一 token 预测验证损失单调相关,表明该损失是物理性能的良好代理指标。数据集规模和计算量的缩放行为明显较弱,作者通过引入可学习窗口概念分析这一现象,认为喷流成分的自回归预测相比语言模型更快饱和。

  20. arXiv cs.LG24

    自监督语音模型发现音系向量算术:[b] = [d] - [t] + [p]

    一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。