摘要
本申请提供一种图文校对方法、装置、设备及可读存储介质。该方法包括:获取待校对图像;确定所述待校对图像对应的文本内容;获取所述文本内容的外部补充信息;确定所述待校对图像、所述文本内容和所述外部补充信息对应的待校对信息;将所述待校对信息输入多模态大语言模型,获取图文校对结果;通过获取待校对图像和待校对图像对应的文本内容,可同时得到待校对图像和文本内容,提高了后续图文校对的信息丰富度,以及通过获取所述文本内容对应的外部补充信息,可利用大量的外部知识来补充模型本身的知识库,进而生成更加准确和具体的文本,结合待校对图像和文本内容,极大提高了图文校对的准确性。