摘要
本发明公开了一种能耗感知的分布式深度学习任务调度方法及系统。本发明首先获取待调度深度学习任务的任务特征信息;然后基于任务特征信息,利用预先构建的能耗预测模型,预测深度学习任务在不同GPU数量下并行训练时的能耗,并确定能耗最优的GPU数量;最后根据能耗最优的GPU数量,将深度学习任务调度至具有足够空闲GPU资源的计算节点,并为任务分配对应数量的GPU进行并行训练;在训练过程中,动态调整GPU的功率限制,以优化训练能耗。本发明通过预测分布式深度学习模型能耗最优的GPU数量,并在作业部署之后通过动态调正GPU功率限制的方法有效降低了在GPU服务器集群中训练分布式深度学习模型的整体能耗。