跳到正文
arXiv cs.LG· Harry Mayne, Justin Singh Kang, Dewi Gould, Kannan Ramchandran, Adam Mahdi, Noah Y. Siegel·· 6 小时前AI 评分30

LLM 自解释有助于预测模型行为:研究提出 NSG 指标

A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior

AI 导读

研究提出 Normalized Simulatability Gain(NSG)指标,用于衡量 LLM 自解释的忠实性,即解释能否帮助观察者预测模型在相关输入上的行为。

来源:arXiv cs.LG · arxiv.org