跳到正文
arXiv cs.AI· Gowthamkumar Nandakishore·· 9 小时前AI 评分22

CLM-as-a-Judge:开源对比决策模型 CLM-v0.1-8B 在公开评测基准上接近随机水平

CLM-as-a-Judge: Evaluating an Open Contrastive Decision Model on Public Judge Benchmarks

AI 导读

开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。

来源:arXiv cs.AI · arxiv.org