摘要
本公开关于一种基于异构GPU集群的模型训练方法、装置及存储介质,所述方法包括:获取异构GPU集群中每个GPU的硬件指标数据;获取待训练模型中深度学习算法对应的多个操作类型,并测量每个GPU执行每个操作类型对应操作的操作性能数据;获取每个GPU的通信带宽多维特征以及负载状态感知策略;根据每个GPU对应的所述硬件指标数据、所述操作性能数据、所述通信带宽多维特征以及所述负载状态感知策略,构建得到每个GPU的多维操作性能矩阵;根据每个GPU对应的多维操作性能矩阵,为所述待训练模型中每个结构层分配GPU进行模型训练得到目标模型,本公开提高了模型的训练效率,缩短了模型的训练时长。