一种基于多模态语义对齐的视频训练数据生成方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种基于多模态语义对齐的视频训练数据生成方法
申请号:
CN202510861137
申请日期:
2025-06-25
公开号:
CN120766057A
公开日期:
2025-10-10
类型:
发明专利
摘要
本发明公开了一种基于多模态语义对齐的视频训练数据生成方法,涉及音视频处理技术领域。具体包括以下步骤:(1)对视频中的音频、图像帧及文本信息进行多模态时间对齐,建立跨模态的时序映射关系;(2)基于所述时间对齐结果进行语义增强处理,提升专业术语的识别准确率;(3)根据语义密度与置信度对训练样本进行动态分级;(4)输出分级的结构化训练数据以适配不同训练阶段。旨在从视频数据源头提升训练数据的质量,避免大量冗余数据的出现和关键节点缺失。
技术关键词
训练数据生成方法
多模态
语义
动态时间窗口
视频
术语
跨模态
文本
训练集
音频
时间偏移量
字幕
阶段
语音
关系
时间同步
时序
密度