跳到正文
arXiv cs.CL· Kamile Dementaviciute, Julija Vaitonyte, Tijl De Bie·· 4 小时前AI 评分30

LLM 说服力评估为何难以一致:九种自动化方法在十五个模型上的对比研究

LLM Persuasion Is in the Eye of the Evaluation

AI 导读

研究将九种已发表的自动化说服力评估方法适配到统一设置,在相同的十五个 LLM 上运行,发现各方法排名仅弱相关(平均 Spearman ρ = 0.25)。模型对部分任务拒绝、对另一些不拒绝,会使一致性降低约四分之一,且拒绝主要集中在操纵类任务上;多数理性说服方法能追踪模型的通用能力,而多数操纵方法则不能。

来源:arXiv cs.CL · arxiv.org