摘要
本发明公开了一种大语言模型迭代生成流程优化控制方法及系统,旨在提高复杂生成任务(如创意写作、代码生成)中多轮交互的效率与质量。针对传统单轮生成难以满足多维质量需求且现有迭代反馈方法易出现盲目修改或质量退化的问题,本发明构建了动态的迭代控制框架,通过对任务质量进行多维度建模、对人类反馈进行可靠性评估,并基于信念状态估计与最优动作决策,显著减少无效迭代降低成本、提升生成结果质量。本发明能够在迭代过程中有效避免盲目修改、减少因反馈不可靠导致的错误决策,并通过信念状态估计与最优动作规划和反馈聚合,实现对生成质量的动态优化,从而使LLM在处理复杂任务时输出的内容更加契合用户需求,显著提升最终生成效果。