arXiv cs.AI· Mohammadreza Sediqin, Shivali Dalmia, Srinivasa Karthikeya Reddy Kovvuri, Abhishek Mukherji·· 9 小时前AI 评分36
为 Agent 评测加上信任层:arXiv 论文提出 Agent Evaluation Trust Layer
A Trust Layer for Agent Evaluation
AI 导读
研究者提出面向 Agent 评测的 Trust Layer,在记录分数旁标注该分数是否可信,核查结果是否有评测评分逻辑支撑、通过答案是否来自可追溯计算、完成声明是否与实际相符、以及重复执行下是否稳定。
来源:arXiv cs.AI · arxiv.org