arXiv cs.AI· Nishanth Nayakanti, Prasang Gupta, Ashutosh Bilthare, Kevin Paul·· 10 小时前AI 评分29
仅用判决结果后训练小模型:拒绝采样与纯标签训练能否恢复证据?
Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?
AI 导读
研究测量小语言模型仅凭判决结果后训练时的证据恢复能力,在 ContractNLI 上人类证据跨度留至评估阶段。纯标签训练达到准确率 0.896、跨度 F1 0.564,逐字引用率从 0.597 升至 0.729;拒绝采样达到 0.797 和 0.556,逐字引用率升至 0.701。两种方法都能在无人标注证据的情况下改善证据质量,但单一语料单一种子尚无法判定哪种更优。
来源:arXiv cs.AI · arxiv.org