跳到正文
arXiv cs.AI· Tae-Eun Song·· 9 小时前AI 评分26

跨模型审查何时有效?LLM 验证中的跨模型评审实验

When Does a Second Model Help? Cross-Model Review in LLM Verification

AI 导读

一项受控实验用 30 个工件、150 个植入错误、10 种审查条件和 900 次审查会话,测试了来自两家开发商的三个审查模型。顶级跨模型审查者的 F1 与同模型新会话审查(CCR)无显著差异,但两者发现的错误仅部分重叠(Jaccard 41.2%)。

来源:arXiv cs.AI · arxiv.org