摘要
本申请公开了一种大模型推理方法、装置、相关设备及计算机程序产品,涉及人工智能领域,本申请先获取待处理问题的问题陈述,而后在大模型基于问题陈述进行链式推理过程中,依据当前推理节点的输入token判断当前节点是否为关键节点,若不是,则对前节点的原始输出token进行压缩处理,基于压缩处理结果推理后续节点。本申请先对推理节点关键与否进行了判定,而后在进行后续推理时压缩非关键推理节点的输出token,减少了后续推理过程所需处理的输入数据量,加快了后续处理速度,有助于优化链式推理,特别是长链式推理的计算效率。