跳到正文
热点事件持续更新

研究测出LLM跨州政策召回张冠李戴

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项预注册研究测试了 Claude Sonnet 5.5 和 GPT-5.6 Sol 在回答美国各州 Medicaid 收入资格数值时的表现:固定问法、只改变辖区,在 51 个辖区、3 项数值共 153 个测试项中,两个模型分别有 10 项和 25 项可复现地给出其他州的当前值,且两次独立重复结果相同。 研究由 Jiayu Feng 提交,作者称将公开实验协议、标准答案表和全部模型输出。该设计覆盖 50 个州及哥伦比亚特区。 这意味着模型在州政策问答中可能把另一辖区的现行规定当作本州答案,且这种错误在重复测试中稳定出现,而非随机波动。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    研究测量 LLM 跨州政策召回中的跨辖区替换现象

    研究用固定问法、仅改变辖区的设计,测试 Claude Sonnet 5.5 和 GPT-5.6 Sol 在 51 个美国辖区、3 项 Medicaid 收入资格数值上的表现,两者分别有 10 和 25 项(共 153 项)可复现地给出其他州的当前值。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。