arXiv cs.CL· Mengze Hong, Zeyang Lei, Wenbo Shang, Xia Zeng, Xiying Zhao, Qi Zhu, Chen Jason Zhang, Di Jiang, Taiming Fu, Qiongyi Zhou, Qinghe Chang, Fubao Zhang, Chenxuan Ma, Minlong Peng, Jinfeng Huang, Zineng Zhou, Jindou Wu, Muge Qi, Sijun He, Xin Cui, Di Liang, Yuan Hua, Davey Chen·· 3 小时前AI 评分22
UXBench Pro:多轮对话交互中的个性化用户体验基准测试
UXBench Pro: Benchmarking Personalized User Experience in Multi-Turn Dialogue Interactions
AI 导读
UXBench Pro 发布,包含 1000 个来自 12 类任务场景、82 个领域的真实用户交互测试实例,每个实例配有刻画七维行为特征的 FACTORS 用户画像。该基准提出双视角评估范式,结合个性化 User Reward Model(URM)与支持多轮交互的用户模拟器 Sim4Eval,并引入 URMBench 和 USimBench 两个元基准检验评估器还原真实人类偏好与行为的可靠性。
来源:arXiv cs.CL · arxiv.org