摘要
本发明公开了一种多模态情感识别方法及相关设备,通过分层双向多头交叉注意力机制,动态捕捉文本、音频、视觉模态间的互补关系,结合门控网络自适应分配权重,显著提升多模态信息融合的鲁棒性,避免冗余信息干扰,通过双层路由注意力增强单模态表示区分性,解决高维特征冗余;引入改进 Informer 编码器降低计算复杂度,建模全局对话依赖;多模态门控融合模块抑制冗余信息,提高情感识别准确性;样本加权聚焦对比损失缓解类别不平衡,增强对少数类及语义模糊情感样本的识别,本发明解决了现有技术中多模态会话情感识别准确率较低的技术问题,对构建情感对话系统、实现自然人机交互意义重大。