arXiv cs.LG· Trevor McCourt, Ila R. Fiete, Isaac L. Chuang·· 6 小时前AI 评分36
大语言模型可被训练容忍硬件故障,规模越大容错性越强
Fault-tolerant foundation models
AI 导读
基于 4 万 GPU 小时的模拟故障数字硬件训练实验,LLM 可被训练以容忍硬件不可靠性,且容错能力随模型规模增长不降反升。研究推导出修正的神经缩放定律,显示模型学会在"良好"纠错码内计算,其相对开销不随模型增大而增长。作者据此猜想经适当训练的 LLM 或可形式化容错,在低能耗故障硬件上运行推理有望大幅节能。
来源:arXiv cs.LG · arxiv.org