跳到正文
arXiv cs.AI· Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy·· 9 小时前AI 评分31

SDR-Arena:大语言模型双方向个性化能力基准测试

Benchmarking the Personalization Capabilities of Large Language Models

AI 导读

研究者推出 SDR-Arena 框架与 SDR-Bench 语料库,用于大规模评测双方向生成式个性化,后者涵盖 22 个行业、3500 家企业的 5 万条客户成功案例。最佳模型 Claude Sonnet 4.6 仅达 55.8% WCS,表明只还原约一半制胜内容,且该瓶颈源于检索而非推理。与专业 SDR 的两项研究显示,仅 48% 生成话术无需编辑即可使用。

来源:arXiv cs.AI · arxiv.org