跳到正文
热点事件持续更新

新基准BOTTLED评估LLM智能体装瓶能力

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

研究者 Ankit Sonthalia 等提出并发布 BOTTLED 基准,用于评估 LLM 智能体能否在固定时间、算力和 LLM API 预算下,自主处理整个未标注工作负载,方式可以是训练小模型或编写可复用程序,即把通用能力“装瓶”为廉价可复用方案。 在十款模型、三项任务中,强零样本表现并不能可靠转化为强“装瓶”能力:60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    BOTTLED 基准:LLM 智能体能否把通用能力"装瓶"成廉价可复用方案?

    研究者提出 BOTTLED 基准,让 LLM 智能体在固定时间、算力和 API 预算下自主处理整个未标注工作负载,可选择训练小模型或编写可复用程序。在十款模型、三项任务中,强零样本表现并不能可靠转化为强"装瓶"能力,60 次运行中有 48 次低于其零样本性能 95% 置信区间下限,31 次不及同等 token 预算下两种小模型蒸馏基线中较强的一个。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。