一种基于视觉-语言模型的满文档案单词识别方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种基于视觉-语言模型的满文档案单词识别方法
申请号:
CN202511060347
申请日期:
2025-07-30
公开号:
CN120913224A
公开日期:
2025-11-07
类型:
发明专利
摘要
本发明公开了一种基于视觉‑语言模型的满文档案单词识别方法,包括:构建初始特征模块、笔画提取模块、视觉模块、语言模块、模态对齐模块和融合模块;将满文单词图片输入到初始特征提取模块,得到初始图像特征,将特征输入至笔画提取模块、视觉模块中,得到笔画特征和视觉特征,再将视觉特征输入到语言模型中,输出语言特征;将笔画特征、视觉特征和语言特征通过多模态Transformer方法进行融合,通过门控机制控制输出最终的结果;本方法可以有效提高对带有遮盖、污损的满文字符,以及背景干扰大的满文单词的识别精度。
技术关键词
单词识别方法
笔画特征
视觉特征
语言模块
视觉推理
满文单词
多模态
特征提取模块
字符
注意力
对齐模块
图像
序列化特征
节点特征
网络
语义特征
融合多尺度信息