跳到正文
arXiv cs.CL· Fahmid Shahriar Iqbal, Ritam Dutt, Soumitra Das, Arnav Verma, Sagnik Ray Choudhury·· 1 天前AI 评分18

大语言模型在时间抽取任务中的多维泛化能力评估

Evaluating Multi-Dimensional Generalization of Large Language Models in Temporal Extraction Tasks

AI 导读

研究评估了多个大语言模型在时间与事件表达抽取任务中的泛化能力,覆盖领域迁移、对抗扰动、组合性和长度增加四个维度。结果显示,基础任务表现强通常预示泛化更好,但在大幅分布偏移下这一关系减弱;归纳式提示词在各维度表现最稳定,而规模、架构及演绎、溯因提示策略的收益不均且依赖具体维度。该研究已被 AACL-IJCNLP 2026 Findings 接收。

来源:arXiv cs.CL · arxiv.org