FD-SCoPE:用可验证、反馈驱动的语言模型回答临床试验证据表问题
FD-SCoPE 是一个语言模型框架,可回答临床试验证据表上的两类问题,并公开查询语句、所选试验与推导规则,还能从专家纠正中学习。
FD-SCoPE 是一个语言模型框架,可回答临床试验证据表上的两类问题,并公开查询语句、所选试验与推导规则,还能从专家纠正中学习。
研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,聚焦 AI、机器学习、自动驾驶、计算机图形、机器人、医疗和高性能计算等领域,每位学生最高可获 6 万美元。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及变电站所在地的纬度与地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预估。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时实验室测试显示不损害生物功能。
推荐理由:DeepMind 把水印从数字内容扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型与连接科学工具、文献和湿实验的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式重排序整合两者互补预测,在盲测中化学家对其单步反应预测的偏好超过此前模型与文献反应。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。
微软发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,均采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 骨干,并以 Apache 2.0 许可开源。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出近零推理成本下的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成并需可验证的数据系统。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。