跳到正文
热点事件持续更新

研究者提出生物医学多模态持续预训练框架

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Guanghao Zhu 等作者提出名为 context-grounded reconstruction 的框架,将 PubMed Central 开放获取(PMC-OA)文献转换为引用连贯的交错序列,并据此构建了 9.63B token 的 PMC-InterCPT 语料,用于医学多模态大模型的持续预训练。 该框架的定位是“source-grounded”,即重建过程以原始文献为依据;作者称其目标是让转换后的序列保持引用连贯性。语料规模为 9.63B token,用途限定为持续预训练。 目前公开信息仅来自作者在 arXiv cs.CL 发布的一手论文,尚未见独立验证或第三方复现结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    PMC-InterCPT:面向生物医学多模态持续预训练的上下文锚定重建

    研究者提出 context-grounded reconstruction 框架,将 PMC-OA 文献重建为引用连贯的交错序列,并据此构建 9.63B token 的 PMC-InterCPT 语料用于医学多模态大模型持续预训练。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。