摘要
本发明公开了混合自适应强化微调方法、系统和装置,涉及人工智能技术领域,尤其适用于大语言模型的深度推理任务。针对现有强化学习算法存在的响应级别长度偏差、问题难度级别偏差、探索效率不足及样本利用不充分等问题。本方法包括数据预处理、初始化模型参数和参考策略、生成多个响应、计算奖励、计算并修正优势、更新模型策略、调整采样概率及迭代优化步骤。其中,通过引入长度归一化因子和难度归一化因子修正优势,结合混合裁剪机制和自适应采样策略更新模型,确保所有潜在有用样本被充分利用。本发明有效消除偏差,提升模型推理能力和训练效率,增强长推理任务探索能力,适应多样化任务需求。