摘要
本申请公开了一种图像生成方法、装置及电子设备,属于计算机视觉与图像处理技术领域。方法包括:将目标建筑的特征信息输入多模态大语言模型,通过多模态大语言模型基于特征信息进行跨模态推理,获取目标建筑的关键环境语义信息;利用关键环境语义信息构建目标建筑的空间体块模型;根据空间体块模型,以及用户选择的目标观察配置,生成目标空间条件控制图;其中,目标空间条件控制图为空间体块模型与目标观察配置对应的视角截图;将关键环境语义信息和目标空间条件控制图输入条件扩散模型,得到目标建筑的与目标观察配置对应的初始视角图像;根据初始视角图像,确定目标建筑的目标视角图像。本申请可以提高图像生成的效果。