arXiv cs.LG· Harry Mayne, Justin Singh Kang, Dewi Gould, Kannan Ramchandran, Adam Mahdi, Noah Y. Siegel·· 6 小时前AI 评分30
LLM 自解释有助于预测模型行为:研究提出 NSG 指标
A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior
AI 导读
研究提出 Normalized Simulatability Gain(NSG)指标,用于衡量 LLM 自解释的忠实性,即解释能否帮助观察者预测模型在相关输入上的行为。
来源:arXiv cs.LG · arxiv.org