摘要
本发明公开了一种代收付限流策略模型训练及应用方法、装置、电子设备及存储介质。所述代收付限流策略模型训练方法包括:依据代收付限流策略模型训练所需的目标代收付数据,执行奖励函数定义训练任务;依据所述奖励函数定义训练任务得到的奖励函数,控制所述代收付限流策略模型执行代收付限流策略预测训练任务;依据所述奖励函数定义训练任务以及代收付限流策略预测训练任务,对所述代收付限流策略模型进行参数调整,以得到收敛的代收付限流策略模型。采用本方案,使用深度强化学习算法来构建代收付限流策略模型,自动学习代收付业务交易类型以及代收付企业级别等多维数据,输出适合系统当前状态最优的限流策略。