摘要
本公开提供了人机交互方法、装置、电子设备和存储介质,涉及人工智能技术领域,尤其涉及计算机视觉、增强现实、大模型、自然语言处理等技术领域。具体实现方案为:在基于视频流中的当前视频帧以及该当前视频帧之的历史视频帧序列,确定在当前视频帧上需要发起主动对话的情况下,通过大模型,根据当前视频帧和历史视频帧序列,生成主动对话内容,并输出主动对话内容。由此,在人机交互的过程中,主动发起主动对话,提升了识别与执行与用户意图相匹配的交互操作,降低了用户的操作复杂度,增强了人机交互的互动性,有效提升了交互的智能化水平,提升了用户体验。