摘要
本发明提供一种基于算力服务调度的AI模型训练加速方法及系统,涉及算力服务技术领域,首先采集AI模型历史训练过程数据和当前训练任务模型结构特征,构建算力需求预测模型,输入当前任务模型结构特征生成算力资源需求分布序列,涵盖训练各阶段对计算核心数量、内存带宽及数据传输速率的需求变化曲线,接着依据该序列从算力服务集群筛选匹配的算力资源组合方案,调度计算节点执行训练任务,并实时采集实际算力资源消耗数据,最后将实际数据与预测序列比对,生成偏差值并动态调整计算节点启用数量,从而实现了算力需求的精准预测和动态优化调度,提高了算力资源利用率,加速了AI模型训练。