arXiv cs.AI· Gowthamkumar Nandakishore·· 9 小时前AI 评分22
CLM-as-a-Judge:开源对比决策模型 CLM-v0.1-8B 在公开评测基准上接近随机水平
CLM-as-a-Judge: Evaluating an Open Contrastive Decision Model on Public Judge Benchmarks
AI 导读
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。
来源:arXiv cs.AI · arxiv.org