摘要
本申请公开了一种多模态大模型推理方法及设备,属于人工智能领域,用以解决无法对视觉令牌进行有效剪枝的问题,方法包括:对自注意力与跨模态注意力分别进行降序排序,得到自注意力累计和向量与跨模态注意力累计和向量,以构建综合重要性矩阵;以及根据输入图像的令牌选取数量阈值,构建掩膜矩阵;将综合重要性矩阵与掩膜矩阵进行逐元素乘积,得到跨模态选择令牌集合和自注意力选择令牌集合所对应的综合重要性分数;根据综合重要性分数最大化与预设目标函数,优化求解在目标函数为最大值时,满足约束条件下的跨模态选择令牌集合和自注意力选择令牌集合,以对多个视觉令牌进行剪枝。实现了对视觉令牌进行有效剪枝。