本发明涉及一种基于神经编解码器的老挝语细粒度韵律建模方法,属于语音处理。
背景技术:
0、技术背景
1、韵律在语言中涵盖了音节、语调、重音等声音变化的规律和模式,是语音的重要组成部分。在语音合成领域,韵律建模的目标是通过数学模型精确描述语音中的韵律信息,从而实现更为自然流畅的语音合成效果。初期,韵律建模主要依赖于基于规则的方法,通过人工设计规则来表征语音中的韵律信息,尽管这种方法简单易于实现,却面临规则复杂、难以覆盖所有情况等问题。通常有两种方法来学习说话韵律信息:一种使用辅助的分类韵律标签作为框架的条件,另一种模仿参考语音的说话韵律。然而,当使用分类韵律标签时,表达性的多样性受到限制,因为这些模型只能从训练集中生成少量预定义的韵律。而使用参考语音生成特定说话韵律的tts模型可以以无监督的方式训练,并且可推广到域外的说话韵律,但从参考语音中提取的韵律信息可能不易理解或解释,此外,精确选择与用户要求精确匹配的参考语音样本可能具有挑战性。
2、随着数据量的增加和机器学习技术的发展,基于统计的方法逐渐崭露头角,成为韵律建模的主流方向。该方法通过分析大规模语音数据,构建统计模型来准确刻画语音中的韵律信息。常见的统计模型包括隐马尔可夫模型(hmm)和高斯混合模型(gmm)。近年来,随着深度学习技术的迅猛发展,基于深度学习的方法逐渐成为韵律建模的热门研究方向。这一方法通过利用深度神经网络对语音信号进行端到端建模,更为有效地捕捉语音中的非线性特征和长距离依赖关系。特征提取是细粒度韵律建模中至关重要的一环。传统的特征提取方法包括基频、能量、过零率等低阶特征,以及线性预测编码(lpc)、梅尔频率倒谱系数(mfcc)等高阶特征。近年来,一些研究者开始尝试利用深度学习技术进行特征提取,以提高特征的表达能力和鲁棒性。在细粒度韵律模型的设计中,需要考虑多个方面的问题,包括模型结构、损失函数、优化算法等。已经有一些经典的细粒度韵律模型被提出,如deepspeech、tacotron等,这些模型普遍采用深度学习技术,能够取得出色的韵律合成效果,这进一步证明了深度学习在提升语音合成质量和自然度方面的潜力。
3、由于老挝语的语言特性,如声调、韵律和语音节奏,可能需要特殊的考虑和定制模型,以准确地捕捉和再现这些特征,单一说话人的数据集可能无法涵盖所有发音变异,导致模型生成的语音缺乏真实感和表现力。
技术实现思路
1、本发明通过提供一种基于神经编解码器的老挝语细粒度韵律建模方法,对vall-e模型的编解码器架构进行优化,对韵律特征进行细粒度的建模,通过深入分析韵律特征与文本属性之间的关联,并利用先进的深度学习架构来捕捉这些细微的韵律变化,从而合成更加自然和准确的老挝语语音。
2、本发明的技术方案是:本发明提供一种基于神经编解码器的老挝语细粒度韵律建模方法,包括:在vall-e模型基础上,设计了词级韵律编码器模块、风格自适应器模块和神经编解码器模块;其中,所述词级韵律编码器模块,用于捕捉语音中的复杂韵律特征,以生成具有更高层次的语音表示,对语音信号的低频部分进行定量化,并将韵律特征封装于潜在韵律向量中;所述风格自适应器模块用于根据从参考语音音频中提取的韵律信息,调整文本输入的增益和偏置;所述神经编解码器模块,用于将输入音素以及韵律内容提示生成离散的码元。
3、进一步地,所述词级韵律编码器模块为了有效解耦语音信号中的韵律信息采用两级结构,在第一级中,利用单词边界将语音波形压缩成词级隐藏状态,通过卷积操作在语音波形上提取关键的词级韵律提示信息,这有助于将韵律信息与单词边界对齐;而第二级则负责对这些词级隐藏状态进行进一步深度处理,以强化韵律信息的表达;这一双层结构的设计旨在捕捉语音中的复杂韵律特征,以生成具有更高层次的语音表示;
4、经过两级词级韵律编码器的处理,将得到词级的韵律向量序列ze,这些向量代表了语音中的韵律信息;为了确保韵律向量仅包含与说话人和内容无关的韵律信息,引入了向量量化层作为瓶颈,这一策略的目的在于通过限制向量量化的维度,强制模型在韵律信息的表示中进行压缩,从而实现对音色和语音内容的解耦;此外,为了降低解耦的难度,选择仅使用语音波形的低频带作为输入。
5、进一步地,所述风格自适应器模块根据从参考语音音频中提取的韵律信息,调整文本输入的增益和偏置,从单一的语音音频中合成出符合目标说话人韵律的语音。
6、进一步地,所述神经编解码器语言模型中的神经编码模型encodec对音频样本进行编码,编码之后使用神经解码模型decodec重建语音波形。
7、本发明数据的选择及预处理:使用约30小时的老挝语数据集和带有风格提示的aishell3数据集进行模型的训练。
8、对于基于词级向量量化的韵律编码器(词级韵律编码器模块)的构建:为了有效解耦语音信号中的韵律信息,构建了一种基于词级向量量化的韵律编码器,采用两级结构捕捉语音中的韵律变化和模式;
9、对于神经编解码器语言模型的构建:为了使合成的语音更加清晰流畅,通过神经编解码器模型对离散标记中的语音进行建模,能够有效处理离散的音频表示。
10、本发明的有益效果是:
11、本发明通过提供一种基于神经编解码器的老挝语细粒度韵律建模方法,将语音合成视为一项条件语言模型任务,而非连续的信号回归任务,通过输入音素以及韵律内容提示,生成离散的码元,再经过离散扩散模型直接生成语音波形,而不再依赖梅尔频谱图,在应对老挝语这一特殊语言的需求时,引入了韵律编码器和韵律向量预测器,以更精细的方式对语音中的特征进行建模,这样生成的语音更具自然度,使得所提出的方法在老挝语语音合成任务上达到了显著的4.13的mos评分,验证了所提方法在提高老挝语语音合成表现力任务上的有效性。
1.一种基于神经编解码器的老挝语细粒度韵律建模方法,其特征在于:包括:在vall-e模型基础上,设计了词级韵律编码器模块、风格自适应器模块和神经编解码器模块;其中,所述词级韵律编码器模块,用于捕捉语音中的复杂韵律特征,以生成具有更高层次的语音表示,对语音信号的低频部分进行定量化,并将韵律特征封装于潜在韵律向量中;所述风格自适应器模块用于根据从参考语音音频中提取的韵律信息,调整文本输入的增益和偏置;所述神经编解码器模块,用于将输入音素以及韵律内容提示生成离散的码元。
2.根据权利要求1所述基于细粒度韵律建模的端到端老挝语语音合成模型,其特征在于:所述词级韵律编码器模块为了有效解耦语音信号中的韵律信息采用两级结构,在第一级中,利用单词边界将语音波形压缩成词级隐藏状态,通过卷积操作在语音波形上提取关键的词级韵律提示信息,这有助于将韵律信息与单词边界对齐;而第二级则负责对这些词级隐藏状态进行进一步深度处理,以强化韵律信息的表达;这一双层结构的设计旨在捕捉语音中的复杂韵律特征,以生成具有更高层次的语音表示;
3.根据权利要求1所述基于细粒度韵律建模的端到端老挝语语音合成模型,其特征在于:所述风格自适应器模块根据从参考语音音频中提取的韵律信息,调整文本输入的增益和偏置,从单一的语音音频中合成出符合目标说话人韵律的语音。
4.根据权利要求1所述基于神经编解码器的老挝语细粒度韵律建模方法,其特征在于:所述神经编解码器语言模型中的神经编码模型encodec对音频样本进行编码,编码之后使用神经解码模型decodec重建语音波形。
