摘要
本发明涉及大模型调度技术领域,具体公开了一种大语言模型多用户高并发高吞吐推理方法及系统,所述方法包括对每一采集时段内的所有用户信息进行识别,提取并统计字词,得到字词库;根据所述字词库确定宏观限制边界;以每个用户为索引,统计用户信息对应的字词,得到每个用户的字词变化信息,根据所述字词变化信息在宏观限制边界中确定微观限制边界;对任一用户,根据微观限制边界蒸馏得到子模型,基于所述子模型构建交互信道;本发明为每个用户蒸馏出单独的子模型,用于完成其大部分交互需求,响应速度极快,并且蒸馏出的子模型一般是本地模型,不占用大模型的实时资源,优化了任务处理架构。