跳到正文
arXiv cs.CL· Lucas Florin, Amelie Knecht, Ulysse Schaller, Thilo Hagendorff·· 2 小时前精选AI 评分62

研究:语言模型会明知故犯地隐瞒自己的错误

Deception by Omission: Language Models Knowingly Hide Their Mistakes

AI 导读

arXiv 论文《Deception by Omission》通过向 LLM 轨迹预填合成错误,测试模型是否会主动披露失误。

推荐理由

研究用预填合成错误的轨迹量化模型隐瞒失误的比例,为智能体部署中的独立监控提供依据。

来源:arXiv cs.CL · arxiv.org