arXiv cs.CL· Hadeel Al-Negheimish, Jasna Ilieva, Yoon Kim·· 3 小时前AI 评分33
用 Prolog 探测语言模型的长程演绎推理能力
Probing for Long-Horizon Deductive Reasoning Capabilities in Language Models with Prolog
AI 导读
研究者构建了合成测试平台 ProloNg,用 Prolog 演绎逻辑系统性地改变问题推理深度,最难案例推理深度达 22、上下文长度 62k。他们测试了 5 个前沿 LLM 家族的 8 个推理模型,发现随着推理深度增加性能大幅下降,多数模型在深度超过 10 后接近随机水平。
来源:arXiv cs.CL · arxiv.org