跳到正文
arXiv cs.CL· Pavan Maddula·· 4 小时前AI 评分24

开放权重大语言模型在非规范输入下的四态安全评估

Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs

AI 导读

研究提出 Adversarial Surface-Form Robustness Dataset(ASRD),包含 7 类表面形式共 2,100 条提示词,对 5 个开放权重语言模型生成 10,500 条回复,并用 Quad-State 评估标准将其分为有害顺从、安全回复、理解失败和不确定四类。

来源:arXiv cs.CL · arxiv.org