基于视觉语言模型的无监督图像分类训练方法、系统及介质

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于视觉语言模型的无监督图像分类训练方法、系统及介质
申请号:CN202511096766
申请日期:2025-08-06
公开号:CN120707970A
公开日期:2025-09-26
类型:发明专利
摘要
本发明揭示一种基于视觉语言模型的无监督图像分类训练方法、系统及介质,涉及计算机技术领域,包括以下步骤:建立无人工标注分类标签的训练数据集D和人工专家标注分类标签的测试集;基于视觉语言模型对训练数据集进行零样本推理,获得伪标签;利用多视角一致性策略对伪标签进行筛选,得到第一训练子集Dir;利用分类‑聚类结果一致性策略筛选,得到第二训练子集Dl;采用高置信度交叉监督学习方法,利用第二训练子集Dl和其余的无标注训练子集Du训练图像分类模型;保存训练得到的图像分类模型对测试集中的样本进行测试,技术效果:不需要人工标注并实现高准确率分类,降低噪声标签对模型训练的负面影响,随机混合的方式训练模型,可增强模型的泛化能力。
技术关键词
图像分类训练方法 图像分类网络 训练图像分类模型 标签 监督学习方法 视觉 样本 匈牙利匹配算法 多视角 训练系统 数据 加权损失函数 图像增强技术 聚类 策略 定义 文本编码器 图像编码器