可交互的多模态人工智能数字人自动讲解方法及系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
可交互的多模态人工智能数字人自动讲解方法及系统
申请号:CN202511094278
申请日期:2025-08-06
公开号:CN120596655B
公开日期:2025-10-14
类型:发明专利
摘要
本发明提供可交互的多模态人工智能数字人自动讲解方法及系统,涉及人工智能体数字人技术领域,包括通过将文档转换为结构化文件,利用多模态人工智能模型解析图片序列得到文本内容,采用大语言模型及人工智能体构建讲解文本,并通过人工智能体将音频与数字人及讲解内容合成,并在播放过程中实现交互功能。本发明能够实现传统展示文档通过数字人与用户的实时交互,提高讲解内容理解效率,增强用户体验,适用于教育、展示、展览、文旅等多种场景。
技术关键词
文字转语音模块 人工智能体 音频 语音激活检测 三次样条函数 大语言模型 关节 图片 人声 骨骼运动轨迹 文本段落 人工智能模型 逆运动学 表情模型 位姿误差 语音活动检测 骨骼模型 依存句法树 生成语音