LLM原生心理测量工具揭示25个模型自报-行为差距
热点事件持续更新
LLM原生心理测量工具揭示25个模型自报-行为差距
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Juan Manuel Contreras 发布了一项基于 LLM 特有行为(如过度拒答、主动免责声明)自下而上构建的自我报告心理测量工具,并对来自 17 家开发商的 25 个 LLM 施测 300 道题、每题各 30 次。结果显示,该工具得到 5 个可复现的可靠因子(Tucker φ ≥ .957,α ≥ .930),并据此揭示这些模型存在自我报告与行为之间的差距。 该工具的结构并非套用人类心理测量框架,而是从 LLM 自身行为中归纳得出,因此其因子与差距结论针对的是所测的这 25 个模型。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
LLM 原生心理测量工具揭示 25 个模型存在自我报告与行为差距报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CLLLM 原生心理测量工具揭示 25 个模型存在自我报告与行为差距
一项基于 LLM 特有行为自下而上构建的自我报告工具,对 17 家开发商的 25 个 LLM 施测 300 道题各 30 次,得到 5 个可复现的可靠因子(Tucker φ ≥ .957,α ≥ .930)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。