跳到正文
热点事件持续更新

研究称大语言模型可训练容忍硬件故障

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

一项 arXiv 论文提出,大语言模型可被训练以容忍硬件不可靠性,且容错能力随模型规模增大不降反升,而非随规模下降。作者 Trevor McCourt 等基于约 4 万 GPU 小时的模拟故障数字硬件训练实验得出上述结论。 研究推导出修正的神经缩放定律,称模型学会在“良好”纠错码内计算,其相对开销不随模型增大而增长。作者据此猜想,经适当训练的 LLM 或可形式化容错,在低能耗故障硬件上运行推理有望大幅节能;这是作者的推测,尚未证实。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    大语言模型可被训练容忍硬件故障,规模越大容错性越强

    基于 4 万 GPU 小时的模拟故障数字硬件训练实验,LLM 可被训练以容忍硬件不可靠性,且容错能力随模型规模增长不降反升。研究推导出修正的神经缩放定律,显示模型学会在"良好"纠错码内计算,其相对开销不随模型增大而增长。作者据此猜想经适当训练的 LLM 或可形式化容错,在低能耗故障硬件上运行推理有望大幅节能。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。