arXiv cs.CV· Nikos Giakoumoglou, Paschalis Giakoumoglou, Andreas Floros, Kleanthis Marios Papadopoulos, Tania Stathaki·· 4 小时前AI 评分17
合成难负样本为何在视觉-语言预训练中有效?SNAP 方法解析
What Makes Synthetic Hard Negatives Work in Vision-Language Pretraining?
AI 导读
研究分析了六种表征空间合成策略在视觉-语言预训练中的迁移,发现跨模态构造会产生过易负样本或拉向查询,模态内构造则混入匹配正样本,同时观察到 logit 尺度饱和问题,固定温度可提升下游性能。
来源:arXiv cs.CV · arxiv.org