国内刊号:11-1777/TP
国际刊号:1000-1239
发布日期:
作者:刘国栋,朱家祺,高梓源,包云岗,王卅,
关键词:深度学习, 神经网络, 分布式训练, 弹性实例, 容错,
随着深度学习模型参数量的不断增加,训练成本也在不断上升.为了减少训练成本,使用云服务厂商提供的弹性实例训练模型成为了一个可行的解决方案.弹性实例的价格仅为正常实例的30%,可以有效降低训练成本.虽然弹性实例价格低廉,但随时都有被回收的风险,对模型训练系统的稳定性提出了新的挑战.为了解决弹性实例场景下的容错问题,现有的工作主要有2类解决方案,分别是基于存盘点的容错和基于冗余性的容错.基于存盘点的方案开销较大,而基于冗余性的方案则对模型的并行策略有一定的限制,导致训练效率并非最优.AdaptDNN是一种自适应可伸缩的大模型分布式训练系统.在弹性实例训练场景,AdaptDNN利用弹性实例宽限期完成训练进度的备份,降低容错开销;并利用“瓶颈消除”思想调整模型并行策略,最大化利用集群可用资源,提升训练效率.实验结果表明,AdaptDNN既能实现低成本容错,又能保证模型训练效率,从而可以在弹性实例场景高效完成模型训练任务,降低模型训练成本.
来源:2025年第12期
《计算机研究与发展》期刊编辑部