跳到正文
arXiv cs.AI· Md Asiful Islam, Fahmida Alam, Mihai Surdeanu·· 3 小时前AI 评分24

ARBITER:面向 LLM 护栏的双假设推理框架

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

AI 导读

研究者提出 LLM 护栏框架 ARBITER,采用双假设推理,在做出安全判定前同时考虑提示词的安全与不安全解读,并用多组件监督微调(MC-SFT)按重要性对输出逻辑组件加权。该框架以自生成推理轨迹和 LoRA 参数高效微调替代昂贵的大模型教师蒸馏与全参数微调,在三个安全审核基准上优于现有推理型与非推理型护栏基线,且在域外评测中提升明显,并为不安全判定提供证据短语解释。

来源:arXiv cs.AI · arxiv.org