摘要
本发明公开了多模态情感识别方法、装置、电子设备和存储介质。该方法包括:获取用户的文本、视频和音频数据并分别进行特征提取,得到文本特征、音频特征和面部特征;将三个特征输入预先训练好的多模态情感识别模型中,多模态情感识别模型包括第一至第四融合模块及分类模块,利用第一融合模块对音频特征和文本特征进行融合,得到音频文本特征;利用第二融合模块对面部特征和文本特征进行融合,得到面部文本特征;利用第三融合模块对文本特征进行特征增强,得到增强文本特征;利用第四融合模块对音频文本特征、面部文本特征和增强文本特征进行融合,得到多模态特征;利用分类模块对多模态特征进行分类,得到用户的情感分类结果。