跳到正文
arXiv cs.LG· Edward Chen, Yuntao Du·· 3 小时前AI 评分29

用影子模型检测 LLM 蒸馏:Qwen2.5-7B 与 Llama-3.2-3B 初步研究

Poster: A Preliminary Study of LLM Distillation Inference

AI 导读

研究提出"蒸馏推断",通过假设检验判断嫌疑模型是否蒸馏自专有 LLM:蒸馏影子模型学习教师推理轨迹,独立影子模型只学参考答案,审计者据此将嫌疑模型得分转换为校准 p 值。以 Qwen2.5-7B 为教师、Llama-3.2-3B 为嫌疑模型的初步研究中,该检验在 0.02 显著性水平下真阳性率达 1.0,验证了检测蒸馏攻击的可行性。

来源:arXiv cs.LG · arxiv.org