研究称大语言模型可训练容忍硬件故障
热点事件持续更新
研究称大语言模型可训练容忍硬件故障
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
一项 arXiv 论文提出,大语言模型可被训练以容忍硬件不可靠性,且容错能力随模型规模增大不降反升,而非随规模下降。作者 Trevor McCourt 等基于约 4 万 GPU 小时的模拟故障数字硬件训练实验得出上述结论。 研究推导出修正的神经缩放定律,称模型学会在“良好”纠错码内计算,其相对开销不随模型增大而增长。作者据此猜想,经适当训练的 LLM 或可形式化容错,在低能耗故障硬件上运行推理有望大幅节能;这是作者的推测,尚未证实。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
大语言模型可被训练容忍硬件故障,规模越大容错性越强报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LG大语言模型可被训练容忍硬件故障,规模越大容错性越强
基于 4 万 GPU 小时的模拟故障数字硬件训练实验,LLM 可被训练以容忍硬件不可靠性,且容错能力随模型规模增长不降反升。研究推导出修正的神经缩放定律,显示模型学会在"良好"纠错码内计算,其相对开销不随模型增大而增长。作者据此猜想经适当训练的 LLM 或可形式化容错,在低能耗故障硬件上运行推理有望大幅节能。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。