摘要
本发明公开一种步骤级验证器引导的混合测试时扩展方法,步骤为:向大语言模型LLM输入问题文本,设置搜索路径数、Best‑of‑N采样数、自我完善迭代次数,以过程奖励模型PRM作为步骤级验证器;在蒙特卡洛树中由LLM根据问题和已生成推理步骤生成多个候选步骤;由PRM评估每个候选步骤质量,应用Best‑of‑N方法选出最佳步骤进行下一步优化;根据PRM评分设置条件进行迭代自我完善;按照深度优先的方式扩展树节点,直到包含结束标记的叶节点,得到完整推理路径;采用多数投票或PRM评分从候选路径集合中选出最佳路径作为最终解决方案。本发明可避免早期错误累积至最终答案,降低了“过度思考”导致的计算资源浪费问题。