arXiv cs.LG· Diego Alovisetti, Marco Mussi, Alberto Maria Metelli·· 5 小时前AI 评分12
在 Log-Concave 随机效用模型中从人类反馈学习排序
Learning a Ranking from Human Feedback in Log-Concave Random Utility Models
AI 导读
研究在 log-concave 噪声的随机效用模型下,从人类比较反馈中恢复物品排序所需的样本量。反馈分完整排序与仅揭示第一名两种类型,作者为二者建立了最坏情况样本复杂度下界,并提出匹配至对数因子的算法,且无需知道噪声分布、仅需方差上界。结果表明仅知胜者反馈的排序问题本质上更难,其样本复杂度取决于物品集合中的最小获胜概率。
来源:arXiv cs.LG · arxiv.org