跳到正文
热点事件持续更新

决策模型与分类器、语言模型基准评测发布

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

一项新发布的基准测试将六个家族的八个 System One 决策模型(含托管模型 Jev)与四个开源生成模型放在同一语义请求下评测,比较它们在自动决策门上的表现。 结果显示:在有标签数据时,微调后的 DeBERTa-v3-large 在几乎所有基准上准确率最高;在无标签场景下,Jev 在流程与意图任务上没有显著对手,但 Gemma-4-31B 在 CLINC-150 上超过它,代价是更高的成本与延迟。 该研究由 Amir Rafe 与 Subasish Das 发布,评测覆盖工作流、意图、情感和社会科学类任务。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    自动化决策门基准测试:System One 决策模型对比训练分类器与大语言模型

    一项基准测试将六个家族的八个 System One 决策模型(含托管模型 Jev)与四个开源生成模型置于同一语义请求下评测。有标签时微调 DeBERTa-v3-large 在几乎所有基准上准确率最高;无标签时 Jev 在流程与意图任务上无显著对手,Gemma-4-31B 在 CLINC-150 上超过它但成本与延迟更高。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。