基于多目标强化学习的自适应拥塞控制方法、设备及介质

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于多目标强化学习的自适应拥塞控制方法、设备及介质
申请号:CN202510963684
申请日期:2025-07-14
公开号:CN120750853A
公开日期:2025-10-03
类型:发明专利
摘要
本发明提出了一种基于多目标强化学习的自适应拥塞控制方法,包括以下步骤:建立延迟动作的多目标马尔可夫决策过程MOMDP:在马尔可夫决策过程中引入偏好空间Ω和偏好函数fΩ;fΩ用于将所选指标偏好w∈Ω转化为指标标量;指标偏好表示指标的权重向量;将拥塞控制问题建模为MOMDP;基于强化学习算法,训练Actor‑Critic网络,经过训练的Actor网络学习出的策略即为智能体的最优控制策略;其中,Actor‑Critic网络以状态和指标偏好作为输入。本发明为双端全效连接迁移过程提供灵活动态的流量控制处理方案,确保端到端网络信息传输的高效性和及时性。本发明还提出了一种终端设备、计算机可读存储介质。
技术关键词
拥塞控制方法 指标 网络 强化学习算法 策略 可读存储介质 参数 终端设备 决策 处理器 更新方法 计算机 基线 因子 批量 存储器 关系 样本 动态