arXiv cs.CL· Yun-Shao Tsai, Chun-Wei Chen, Chee-En Yu, Yi-Cheng Lin, Hung-yi Lee·· 9 小时前AI 评分24
语音语言模型能否像人类一样听音辨形?SLM 声音象征感知对齐研究
Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models
AI 导读
研究用真实人类语音录音测试语音语言模型(SLM)的声音象征能力,发现 SLM 的听觉判断与人类感知对齐较差,且未能捕捉驱动人类直觉的频谱倾斜等声学线索,开放权重模型也无法可靠地将听到的声音与对应形状关联。视觉-only 对照实验排除了形状感知因素,表明这一弱点源于语音表征方式,感知对齐取决于能否捕捉人类所听的线索,而非更强的视觉能力。
来源:arXiv cs.CL · arxiv.org