一种基于在线强化学习和GRPO的图像编辑模型训练方法
申请号:CN202511038215
申请日期:2025-07-28
公开号:CN120876294A
公开日期:2025-10-31
类型:发明专利
摘要
本发明涉及一种基于在线强化学习和GRPO的图像编辑模型训练方法,包括以下步骤:S1:采用ODE‑to‑SDE转换技术,将原本确定性的ODE流变为等价的SDE流,使得流匹配模型能够支持强化学习所需的随机采样探索,同时保持原有的边缘分布特性;S2:设置奖励模型方案,S3:基于奖励模型方案,采用无价值网络的策略梯度优化,不断优化图像编辑模型的参数,得到总目标函数。本发明在保证图像编辑质量的前提下,显著提高指令遵循准确性和训练效率。
技术关键词
模型训练方法
大语言模型
策略
在线
编辑
离散化方法
神经网络参数
样本
多模态
指令
噪声
比率
超参数
速度
适配器
定义
图像
视觉