跳到正文
热点事件持续更新

研究者推出DataSense-Bench评估AI数据选择能力

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者发布 DataSense-Bench 基准,用数据选择与性能预测任务检验前沿 AI 模型是否具备“数据感”。智能体需为小 LLM 挑选并排序微调训练子集,可查看数据、写代码分析、跑前向推理,但不能训练模型或接触评测任务。 实验显示,智能体的选择收益相对随机选择有限,且无法可靠排序所选子集。Astra 在三次工具使用运行中均找出最佳组,但在三次终端任务中仅一次成功。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.LG
    DataSense-Bench:迈向 AI 科学家第一步的数据感知基准

    研究者推出 DataSense-Bench,用数据选择与性能预测任务检验前沿 AI 模型是否具备"数据感"。智能体需为小 LLM 挑选并排序微调训练子集,可查看数据、写代码分析、跑前向推理,但不能训练模型或接触评测任务。实验显示选择收益相对随机选择有限,智能体无法可靠排序所选子集,Astra 在三次工具使用运行中均找出最佳组,但在三次终端任务中仅一次成功。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。