本发明涉及智能音乐,尤其涉及一种音频生成方法、装置、设备、存储介质及程序产品。
背景技术:
1、现有智能音频制作方案均是针对单一种类的音频进行生成。如通过将文本转语音和语音转换技术(text-to-speech/voice conversion,tts/vc)等模型生成语音内容,通过音效生成模型生成音效内容,通过音乐生成模型生成音乐内容,各个音频内容采用不同方案或模型进行生成,最后通过将各自生成的内容进行拼凑得到最终音频内容,这样会存在最终生成内容的主题性不统一,音频内容生成效果不符合预期的问题。
技术实现思路
1、本发明的目的在于提供一种音频生成方法、装置、设备、存储介质及程序产品,用于解决采用现有技术生成的音频内容的主题性不统一,音频内容生成效果不符合预期的问题。
2、为了解决上述技术问题,本发明实施例提供一种音频生成方法,该方法包括:
3、获取用户的自然语言对应的文本;
4、基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,所述音频属性描述文本用于表征所述用户的自然语言对应的文本所提示的音频信息;
5、利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据。
6、在一些实施例中,所述基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,包括:
7、对所述用户的自然语言对应的文本进行编码,得到第一编码内容;
8、基于预先创建的多任务多分类头,对所述第一编码内容进行解码,得到每个音频属性对应的预测概率值,其中,每个头具有对应的音频属性;
9、基于每个音频属性对应的预测概率值进行转化处理,得到文本配置格式统一的音频属性描述文本。
10、在一些实施例中,所述基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,包括:
11、将所述用户的自然语言对应的文本输入至文本特征抽取模型,得到文本配置格式统一的音频属性描述文本;
12、其中,所述文本特征抽取模型用于基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本。
13、在一些实施例中,所述方法还包括:
14、获取训练集,所述训练集中每个训练数据包括音频样本、音频样本对应的自然语言描述以及属性标注;
15、将音频样本对应的自然语言描述输入至第一预设模型,得到与所述音频样本相关的每个音频属性对应的预测概率值;其中,所述第一预设模型包括编码器和解码器,所述编码器用于对所述音频样本对应的自然语言描述进行token编码;所述解码器包括预先创建的多任务多分类头,每个头包括全连接层和分类层,用于对编码器输出的编码内容进行分类,得到对应的音频属性的预测概率值;
16、利用第一损失函数,对所述第一预设模型进行训练,得到训练后的文本特征抽取模型;其中,所述第一损失函数由与所述音频样本相关的每个音频属性对应的预测概率值和音频样本对应的属性标注确定。
17、在一些实施例中,所述利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据,包括:
18、对所述音频属性描述文本进行统一编码与映射,得到第二编码内容;
19、对所述第二编码内容进行解码,得到梅尔频谱;
20、根据所述梅尔频谱,生成与所述用户的自然语言对应的文本相关的音频数据。
21、在一些实施例中,所述利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据,包括:
22、将所述音频属性描述文本输入至音频生成模型,得到与所述用户的自然语言对应的文本相关的音频数据。
23、在一些实施例中,所述方法还包括:
24、获取训练集,所述训练集中每个训练数据包括音频样本、音频样本对应的自然语言描述以及属性标注;
25、将所述音频样本对应的属性标注输入至第二预设模型,得到预测的音频数据;
26、利用第二损失函数,对所述第二预设模型进行训练,得到训练后的音频生成模型;其中,所述第二损失函数由所述预测的音频数据和所述音频样本确定。
27、本发明实施例还提供了一种音频生成装置,包括:
28、第一获取模块,用于获取用户的自然语言对应的文本;
29、第一处理模块,用于基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,所述音频属性描述文本用于表征所述用户的自然语言对应的文本所提示的音频信息;
30、音频生成模块,用于利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据。
31、本发明实施例还提供了一种音频生成设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的程序;所述处理器执行所述程序时实现上述的音频生成方法。
32、本发明实施例还提供了一种可读存储介质,其上存储有程序,该程序被处理器执行时实现上述所述的音频生成方法中的步骤。
33、本发明实施例还提供一种计算机程序产品,包括计算机指令,所述计算机指令被处理器执行时实现上述所述的音频生成方法中的步骤。
34、本发明的上述技术方案的有益效果如下:
35、上述方案中,通过获取用户的自然语言对应的文本;然后,基于该用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,所述音频属性描述文本用于表征所述用户的自然语言对应的文本所提示的音频信息;最后,利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据,这样从文本解析层面统一用户输入的文本所对应的待生成音频内容需求,进而利用统一文本配置的音频属性描述文本,能够生成主题性统一的音频内容,生成的音频内容更符合用户预期,且生成质量得到提升。
1.一种音频生成方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,所述基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,包括:
3.根据权利要求1所述的方法,其特征在于,所述基于所述用户的自然语言对应的文本进行属性预测,得到文本配置格式统一的音频属性描述文本,包括:
4.根据权利要求3所述的方法,其特征在于,所述方法还包括:
5.根据权利要求1所述的方法,其特征在于,所述利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据,包括:
6.根据权利要求1所述的方法,其特征在于,所述利用所述音频属性描述文本,生成与所述用户的自然语言对应的文本相关的音频数据,包括:
7.根据权利要求6所述的方法,其特征在于,所述方法还包括:
8.一种音频生成装置,其特征在于,包括:
9.一种音频生成设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的程序;其特征在于,所述处理器执行所述程序时实现如权利要求1至7中任一项所述的音频生成方法。
10.一种可读存储介质,其上存储有程序,其特征在于,该程序被处理器执行时实现如权利要求1至7中任一项所述的音频生成方法中的步骤。
11.一种计算机程序产品,其特征在于,包括计算机指令,所述计算机指令被处理器执行时实现如权利要求1至7中任一项所述的音频生成方法中的步骤。
