摘要
本发明涉及人工智能技术领域,可应用于具身智能、金融科技及医疗健康等业务场景中,公开了一种动作指令生成与优化方法、装置、设备及介质,包括:采集环境视觉信息、环境音频信息及动作状态信息,处理环境视觉信息和环境音频信息,分别得到视觉特征和音频特征,采用多模态注意力机制对视觉特征、音频特征及动作状态信息进行动态加权融合,生成综合决策特征,将综合决策特征输入决策网络,生成动作指令,执行动作指令并收集环境反馈信息,基于环境反馈信息优化决策网络,生成更新后的决策网络。本发明通过多模态信息的动态融合与统一决策,提升了具身智能系统在复杂环境下的感知、决策与动作协同水平。