arXiv cs.LG· Junwei Quan, Evgenii Opryshko, Rohan Subramani, Igor Gilitschenski·· 3 小时前AI 评分28
RH-Detect:奖励黑客检测的统一基准
RH-Detect: A Unified Benchmark for Reward Hacking Detection
AI 导读
RH-Detect 整合十一个公开数据集中的奖励黑客相关子集,共 92,761 行、六类行为,构建统一 schema 的奖励黑客检测基准。在 5,021 个开放式评测单元上,六个现成语言模型无需额外训练即作检测器,最佳模型池化 AUROC 达 0.962、准确率超 93%;但四个最强模型在 MALT 和 TRACE 两个多轮工具使用数据集上准确率低 10.7-15.9 个百分点。
来源:arXiv cs.LG · arxiv.org