arXiv cs.AI· Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng Yuan·· 10 小时前AI 评分29
Palette:面向 LLM 按需授权放宽安全对齐的模块化可控高效框架
Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs
AI 导读
针对基础模型"一刀切"安全对齐导致授权专业人员合理请求被拒的问题,研究者提出模块化框架 Palette,通过多目标搜索定位拒绝方向并经轻量适配内化到模型中,从而在授权目标领域选择性放宽拒绝行为、同时保留其他场景的标准安全。
来源:arXiv cs.AI · arxiv.org