arXiv cs.AI· Tae-Eun Song·· 9 小时前AI 评分26
跨模型审查何时有效?LLM 验证中的跨模型评审实验
When Does a Second Model Help? Cross-Model Review in LLM Verification
AI 导读
一项受控实验用 30 个工件、150 个植入错误、10 种审查条件和 900 次审查会话,测试了来自两家开发商的三个审查模型。顶级跨模型审查者的 F1 与同模型新会话审查(CCR)无显著差异,但两者发现的错误仅部分重叠(Jaccard 41.2%)。
来源:arXiv cs.AI · arxiv.org