跳到正文
arXiv cs.CL· Pulak Kuli·· 4 小时前AI 评分22

Moshi 全双工语音模型的情感引导遵循几何结构而非标签

Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model

AI 导读

研究者在全开源全双工语音语言模型 Moshi 上测试了四种情感的平均差激活引导,该方法每帧仅需少量向量加法且无需重训练。情感可从 Moshi 的残差流中线性解码,但激活引导只能部分实现且不均衡:happy、angry 和 surprise 引导向共享方向,sad 则可被独立引导。三个情感共享的成分无法简单地等量从所有情感中投影剔除。

来源:arXiv cs.CL · arxiv.org