摘要
一种基于多模态LLM的图像分割模型,包括:VAE的编码器,用于将输入的与目标图像对应的掩码图像处理成离散的第一视觉token,并输出与第一视觉token对应的第一视觉token索引;多模态的LLM,用于基于输入的图像分割指令和目标图像进行自回归的推理计算,生成与目标图像对应的第二视觉token索引,并将第二视觉token索引进一步输入至VAE的解码器;VAE的解码器,将与第二视觉token索引对应的第二视觉token解码成与目标图像对应的掩码图像;其中,在对图像分割模型进行微调训练的过程中,VAE的模型参数处于冻结状态;对图像分割模型进行微调训练的模型损失包括第一视觉token索引和第二视觉token索引之间的交叉熵损失。