摘要
本申请涉及人工智能技术领域,应用于金融科技、医疗健康养老等人机对话交互场景中,可以减轻图形界面下的大模型输出幻觉的概率,确保产生语音播报内容和图形界面展示的内容一致,有效提升用户的体验度。涉及一种基于图形界面的人机对话交互方法、装置、设备和介质,该方法包括:获取多模态数据;将操作视频数据输入预设的UI交互理解模型中进行UI交互理解,得到操作视频数据中的操作行为信息;将多个界面截图数据输入UI交互理解模型中进行UI交互理解,得到图形界面的界面变化信息;将语音数据、操作行为信息以及界面变化信息输入预设的人机对话模型中进行应答处理,得到多模态应答信息;在图形界面上输出多模态应答信息。