决策模型与分类器、语言模型基准评测发布
热点事件持续更新
决策模型与分类器、语言模型基准评测发布
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
一项新发布的基准测试将六个家族的八个 System One 决策模型(含托管模型 Jev)与四个开源生成模型放在同一语义请求下评测,比较它们在自动决策门上的表现。 结果显示:在有标签数据时,微调后的 DeBERTa-v3-large 在几乎所有基准上准确率最高;在无标签场景下,Jev 在流程与意图任务上没有显著对手,但 Gemma-4-31B 在 CLINC-150 上超过它,代价是更高的成本与延迟。 该研究由 Amir Rafe 与 Subasish Das 发布,评测覆盖工作流、意图、情感和社会科学类任务。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
自动化决策门基准测试:System One 决策模型对比训练分类器与大语言模型报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LG自动化决策门基准测试:System One 决策模型对比训练分类器与大语言模型
一项基准测试将六个家族的八个 System One 决策模型(含托管模型 Jev)与四个开源生成模型置于同一语义请求下评测。有标签时微调 DeBERTa-v3-large 在几乎所有基准上准确率最高;无标签时 Jev 在流程与意图任务上无显著对手,Gemma-4-31B 在 CLINC-150 上超过它但成本与延迟更高。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。