跳到正文
arXiv cs.AI· Jinghao Pang, Jitai Hao, Qiang Huang, Zhaochun Ren, Jun Yu·· 11 小时前AI 评分27

SSRFT:将安全对齐重构为安全角色内化的 LLM 安全框架

Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment

AI 导读

研究者提出 SSRFT(Supervised Safe-Role Fine-Tuning),首个将安全对齐重构为"内化预设安全角色"的框架,通过心理测量问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,让模型内化安全价值观而非显式拒绝模式。

来源:arXiv cs.AI · arxiv.org