arXiv cs.CL· Maverick Morales, Tom\'a\v{s} Dominik, Vermut Gao, Katrina Shirey, Paulius Rimkevi\v{c}ius, Aaron Schurger, Uri Maoz·· 4 小时前AI 评分31
研究发现:提示 LLM 不诚实作答时推理 token 数量激增
Reasoning-Token Spikes Under Prompted Untruthful Responding in Large Language Models
AI 导读
三个具备推理能力的大语言模型在回答 210 道选择题时,被系统提示要求如实、虚假或无视真假作答,结果真实作答产生的推理 token 数少于说谎和无视真假两种指令。该信号无需读取推理链内容,可作为推理轨迹不可用或不可靠时区分诚实与不诚实行为的候选指标。研究尚未证明推理 token 数能检测自发欺骗或普遍失准,属概念验证。
来源:arXiv cs.CL · arxiv.org