摘要
本公开实施例公开了一种基于视觉编码器组合的多模态图片理解方法及装置,涉及人工智能技术领域,该方法包括:获得多模态图片包括的图像和文本;将图像输入至视觉编码器组合中,获得每个视觉编码器输出的多个图像特征;基于每个视觉编码器输出的多个图像特征,得到至少一个视觉token;以及,使用文本分词器获取文本包括的至少一个文本token;将至少一个视觉token和至少一个文本token输入至视觉token融合器,得到第一视觉token;将第一视觉token和至少一个文本token合并后输入至大语言模型中,获得文本描述信息。本公开实施例采用视觉编码器组合提取足够全面的视觉特征,同时减少了大语言模型的计算量。