arXiv cs.CL· Yuyang Zhao, Xuan Liu, HaoYang Shang, Haojian Jin·· 5 小时前AI 评分22
测试时扩展与后训练在个体立场预测中为何失效?
Where Do Test-Time Scaling and Training Fall Short in Individual Stance Prediction?
AI 导读
研究评估了测试时扩展与后训练方法在个体立场预测中的表现,基于包含 500 名 Hacker News 用户、2499 个预测任务的 STANCE-BENCH,识别出错误共识、选择失败、响应过拟合和早期平台四种失效模式。结合候选立场直接评分与历史支持度评估的方法,在 781 任务测试集上用 Qwen3-8B 达到 21.83 Macro F1,高于直接评分的 19.27。
来源:arXiv cs.CL · arxiv.org