arXiv cs.AI· Ran Li, Lei Chen·· 12 小时前AI 评分33
通过低秩激活引导实现参数高效决策算子
Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering
AI 导读
研究者提出一种通过行为克隆训练的 System-1 决策算子,默认版本仅用 330K 参数即匹配 1.33M 参数的强化学习算子,并将 3,685-token 的推理压缩为 6-token 决策且不损失准确率。
来源:arXiv cs.AI · arxiv.org