摘要
本申请提供了一种音频生成方法、装置、设备、存储介质及程序产品;方法包括:对输入的描述文本进行多阶段文本识别,得到描述文本对应的至少一个音频事件、每一音频事件对应的时间信息以及与每一音频事件对应的语音文本;对至少一个音频事件、每一音频事件对应的时间信息以及与每一音频事件对应的语音文本进行文本结构化处理,得到结构化提示词;对结构化提示词进行音素级文本编码,得到音素级文本编码向量;基于音素级文本编码向量,生成与描述文本匹配的目标音频。通过本申请,能够实现对描述文本中所描述的事件发生时间区间及语音内容的细粒度可控,提高所生成的目标音频的音频质量。