跳到正文
arXiv cs.AI· Ran Li, Lei Chen·· 12 小时前AI 评分33

通过低秩激活引导实现参数高效决策算子

Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering

AI 导读

研究者提出一种通过行为克隆训练的 System-1 决策算子,默认版本仅用 330K 参数即匹配 1.33M 参数的强化学习算子,并将 3,685-token 的推理压缩为 6-token 决策且不损失准确率。

来源:arXiv cs.AI · arxiv.org