摘要
本申请涉及基于强化学习的任务调度优化方法、装置、设备及介质。所述方法包括:首先通过实时采集系统资源状态数据,经预处理与时间序列分析确定动态环境特征,同时解析任务特性数据,利用优先级排序算法与资源评估模型生成任务优先级序列和资源需求向量。继而采用强化学习算法构建状态空间与动作空间,通过策略迭代与奖励函数优化生成最优任务分配方案,若方案满足资源均衡阈值则执行调度并采集性能指标。最后将实时指标与历史数据融合,通过经验回放与梯度下降更新强化学习模型参数,形成闭环优化的改进调度策略。采用本方法能够实现资源状态与任务需求的精准映射,克服传统静态调度对复杂场景的适应性不足问题。