博士论文提出LLM鲁棒性评估与攻击方法
热点事件持续更新
博士论文提出LLM鲁棒性评估与攻击方法
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Narek Maloyan 提交的博士论文提出一套评估和改进大语言模型对对抗性输入序列变化鲁棒性的模型、方法与算法。论文给出的核心工具包括生成式鲁棒性度量 R_stab(f),以及名为 ASA 的自适应进化黑盒攻击方法。 论文称,ASA 对 LLM-as-a-Judge 系统的攻击成功率最高达 73.8%,在开源模型之间的迁移率最高为 62.6%。这些数字来自论文自身的评估,尚待独立验证。
AI 根据报道生成 · 55 分钟前更新
最新进展10月9日 12:00
评估并提升大语言模型对输入序列变化的鲁棒性报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.LG评估并提升大语言模型对输入序列变化的鲁棒性
一篇博士论文提出 R_stab(f) 生成式鲁棒性度量,并开发 ASA 自适应进化黑盒攻击,对 LLM-as-a-Judge 系统攻击成功率最高达 73.8%,开源模型间迁移率最高 62.6%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。