摘要
本申请公开了一种同传翻译训练数据生成方法、相关设备及程序产品,涉及同声传译技术领域。本申请基于双语字幕音视频数据中的双语字幕信息,获取每一音频片段对应的第一源语言文本和第一目标语言文本,音频片段为双语字幕音视频数据中音频所包含的一个片段;对音频片段进行语音识别,得到音频片段对应的第二源语言文本;按照配置的源语言对齐规则,利用第一源语言文本对第二源语言文本进行对齐,得到源语言对齐文本并筛选源语言对齐文本对应的目标音频片段;基于目标音频片段,及目标音频片段对应的第一目标语言文本,生成同传翻译训练数据。本申请无需人工标注,节省了人工成本,且提高了训练数据获取效率。