一种以交互驱动的多对象内容可控图像生成方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种以交互驱动的多对象内容可控图像生成方法
申请号:CN202510953209
申请日期:2025-07-10
公开号:CN120563986A
公开日期:2025-08-29
类型:发明专利
摘要
一种以交互驱动的多对象内容可控图像生成方法,包括以下步骤:步骤1):获取图像数据以及其对应对象实例的分割与类别标签;步骤2):获取每一个对象实例的图像,并进行处理,得到分割后的对象图像;步骤3),提取每张对象图像的类别、深度、细节特征得到多尺度表征嵌入;步骤4),使用Transformer结构对象交互逻辑关系提取模块获取不同对象间的交互逻辑关系;步骤5),使用隐藏张量空间至文本模态空间多模态映射模块构建提示词控制Token,再结合所得对象类别标签构建提示词文本;步骤6),进行多步加噪与去噪,最终使用变分自编码器还原图像,最终得到对应的内容可控图像。本发明可以进行多对象控制生成且关注多对象间逻辑交互的特点。
技术关键词
图像生成方法 多尺度 标签 细粒度图像分类方法 注意力 编码器 语义 对象交互 图像分割 文本 关系建模 图像生成网络 多模态 数据 序列 自然语言 模块