跳到正文
arXiv cs.AI· Viraj Bagal, Raviraja Ganta, Prabhath Chellingi·· 9 小时前AI 评分29

同一反馈不同答案:前沿模型客户反馈分析中的运行间不稳定性

Same Feedback, Different Answer: Measuring Run-to-Run Instability in Frontier-Model Customer Feedback Analysis

AI 导读

一项研究提出重复运行评估框架,用主题流失率和数量分歧两项指标衡量 AI 智能体处理非结构化数据的可重复性。在 Claude Opus 4.8 与 1000 条记录语料固定条件下,基于分类体系的智能体(TGA)相比原始生成和分层分解将主题流失率降低 86–88%,匹配主题的数量分歧为零。该框架面向客户反馈、财报、法律文档等重复性知识工作场景。

来源:arXiv cs.AI · arxiv.org