跳到正文
今天10月7日周三547 条
  1. arXiv cs.CL22

    合成调研验证新框架:LLM 合成受访者应验证后果性行为与表征公平性

    针对业界和学界用 LLM 驱动的合成受访者替代真人样本的做法,研究者提出一套验证框架,要求每项效度声明明确与人类数据的对应层级,并覆盖 location、dispersion、response process、structure 四项诊断及实验效应对比。框架还要求报告子群体效度,并将分布、程序与承认三个公平维度操作化为可测量指标,最后以电动汽车充电电价为例演示并给出报告清单。

  2. arXiv cs.CL22

    WinoQueer-NL:评估荷兰语模型对 LGBTQ+ 群体的偏见

    研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。

  3. arXiv cs.CL18

    手语对话中的情感识别:eJSL Dialog 数据集与基准测试

    研究者将对话情感识别(ERC)任务引入手语视频分析,并提出基于 STUDIES 语料库脚本构建的 eJSL Dialog 数据集,包含 1,920 个视频样本、480 段对话。在该数据集上的系统基准测试表明,将对话式 ERC 框架扩展到手语对话在当前基准设定下可行,但现有视觉表征在捕捉手语特有的情感线索方面仍存在局限。

  4. arXiv cs.CL22

    法国合成社交媒体情感分析:用 170 万条合成推文训练 600M 参数推理模型

    研究团队用回译与微调模型,从少量种子语料生成 170 万条法语合成推文及合成推理轨迹,训练出 600M 参数、支持英法双语推理的模型,在人工标注评测数据上达到 77-79% 准确率,追平或超过 SOTA 专有 LLM 与专用编码器。该流程在降低标注成本的同时避免暴露敏感用户数据,可迁移至其他场景和语言。

  5. arXiv cs.CL25

    TabiBERT:基于 ModernBERT 的土耳其语大规模基础模型与统一基准 TabiBench

    研究者发布 TabiBERT,一个基于 ModernBERT 架构、从零预训练的土耳其语单语编码器,训练数据为 1 万亿 token,来自 86.58B token 的多领域语料(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8,192 token 上下文,是现有土耳其语 BERT 模型的 16 倍。

  6. arXiv cs.CL34

    Common Corpus:面向 LLM 预训练的最大规模伦理数据集

    Common Corpus 是迄今最大的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,总量约两万亿 token,涵盖从高资源欧洲语言到低资源语言及大量代码数据。研究团队在该数据集上训练了两个小型语言模型,性能与同规模模型相当,表明其适合多语言预训练。该数据集已被 ICLR 2026 接收为 Oral 论文。

  7. arXiv cs.CL29

    旧事实回归时:重读、回滚与时间记忆的边界

    一项基于 130 个软件修复原子状态转换的研究发现,基于身份的时间记忆在普通转换条件下模型判定准确率达 98.5%,但追加对旧陈述的逐字重读后准确率降至 10.8%,陈旧值比率升至 88.5%。一个拒绝重新激活已退役值的防护机制可将准确率恢复到 97.7%、陈旧值比率降至 0.8%,但无法在没有额外变更溯源的情况下识别合法的回滚。

  8. arXiv cs.CL22

    预测社交媒体信息级联增长:面向人机协同的虚假信息分诊

    研究将虚假信息早期分诊建模为"延续预测"问题:仅凭前30分钟活动预测传播树后续增长。在FibVID数据集352棵测试树上,结合节点数与结构深度熵、时间到达熵的模型将log变换后未来增长的R²从0.307提升至0.323,log-MAE降低2.4%;在97棵高活跃度树上R²从0.248升至0.395,Spearman's ρ从0.394升至0.529。

  9. arXiv cs.LG22

    量子数据加载器利用真实信号共享结构,单电路复用加载多信号

    一种量子原生加载器只需学习数据集的低维描述,即可用一组固定电路加载每个信号。在五个公开数据集的七种视图上,它以相同门成本达到最强结构化加载器的精度,且每个信号所需参数少数倍。预注册盲复现显示,信号规模扩大十六倍时,达到全信号精度十个百分点以内所需的随机子集大小保持稳定,而结构化加载器所需子集持续增长。

  10. arXiv cs.LG22

    量子生成模型研究:收敛的矩匹配损失无法可靠衡量泛化能力

    研究基准测试了13个量子与经典生成模型,在最高30 qubits的基数约束数据集和基因组单核苷酸变异数据集上直接采样。结果显示,将MMD²等矩匹配损失收敛到相同值的模型,对未见有效集的覆盖差异巨大,说明收敛的损失不能可靠衡量泛化能力。"经典训练、量子部署"流程必须通过采样来测量泛化,而这在目标规模下被认为需要量子设备。

  11. arXiv cs.CL26

    跨模型 LLM 共识不等于有效:K-12 数学辅导对话中学生失败模式诊断研究

    一项针对 K-12 数学辅导对话的探索性研究发现,LLM 对五种学生失败模式(不确定性、错误归因、算子选择、概念缺口、程序失误)的分类中,人机一致性仅为中等(kappa = .524-.597),而跨模型一致性显著更高(kappa = .755-.781;alpha = .769)。这表明跨模型共识可能制造正确性的假象,模型间的一致不能替代对推断构念有效性的独立证据。

  12. arXiv cs.CL22

    高风险应急信息中的生成式 AI 翻译

    一项针对地震指令文本英译中、英译西的实验显示,使用话语特定提示词可显著提升生成式 AI 译文的可理解性与可操作性,但译者仍可能不信任这些译文。研究指出人工修订依然必要,既为发现错误,也因这类信息需有人对错误或延误承担责任。

  13. arXiv cs.CL39

    LLM 会把闲聊和背景语音写进病历,干扰临床推理

    研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。

  14. arXiv cs.LG22

    粒子喷流生成的神经缩放定律研究

    研究首次探索粒子喷流生成任务中是否存在缩放定律,成功复现了模型规模缩放的对数缩放行为。研究发现切片 Wasserstein 距离与下一 token 预测验证损失单调相关,表明该损失是物理性能的良好代理指标。数据集规模和计算量的缩放行为明显较弱,作者通过引入可学习窗口概念分析这一现象,认为喷流成分的自回归预测相比语言模型更快饱和。

  15. arXiv cs.LG24

    自监督语音模型发现音系向量算术:[b] = [d] - [t] + [p]

    一项覆盖 96 种语言的研究发现,自监督语音模型(S3M)的表示空间中存在对应音系特征的线性方向,且这些音系向量的尺度与对应特征的声学实现程度连续相关。例如 [d] 与 [t] 的差构成清浊向量,将其加到 [p] 上得到 [b],缩放该向量则产生清浊连续谱。这表明 S3M 以音系可解释且可组合的向量编码语音,实现音系向量算术。代码与交互演示已公开。

  16. arXiv cs.CL22

    伪词探针研究:LLM 缺乏人类伪词处理所依赖的亚词汇敏感性

    研究用两个意大利语二选一伪词实验测试五款 LLM,并与人类行为基线对比。当选项含真实词提供的词汇熟悉度线索时,LLM 与人类的一致性更高;在纯伪词条件下则明显低于字符 n-gram 模型 fastText。驱动人类与 fastText 一致的亚词汇余弦相似度线索未能稳定迁移到人类与 LLM 的对齐上,推理 token 消耗也与人类处理难度无稳定关系。

  17. arXiv cs.LG22

    大语言模型用于加密货币交易分析:一项 Bitcoin 案例研究

    研究将 LLM 应用于真实加密货币交易图,以 Bitcoin 为案例,提出三层评估框架及 LLM4TG 图表示格式与 CETraS 采样算法,显著降低 token 需求。实验显示节点级基础信息识别准确率超 98.50%,有效特征获取比例达 95.00%,分类任务 top-3 准确率在少量标注数据下达 72.43% 并附带解释。

  18. arXiv cs.CL26

    预填充决策模型的读出稳定性:零标签预测与推理时算力分配

    受 Jev 模型启发的预填充决策模型单次前向即可为候选菜单打分,成本比同规模生成式语言模型低一到两个数量级。当干预只改变候选菜单而输入文本不变时,其干预后准确率可由缓存的首次前向分布预测,无需标签和第二次前向,在七个模型族、十个数据集上误差在 4.2 分以内。