StyleTTS 2:具有大型语音语言模型的人类级文本到语音转换
StyleTTS 2:人类级文本到语音转换,搭载大型语音语言模型
由于自然和合成语音合成方法的增加,在过去几年中,人工智能行业取得的一个重要成就是有效地合成了文本到语音框架,具有潜在应用于不同行业,包括有声读物、虚拟助手、配音解说等等,并且一些最先进的模式在各种与语音相关的任务中提供了人类水平的性能和效率。然而,尽管它们的表现强劲,但对于任务的改进仍然有进步的空间,这要归功于具有表达力和多样性的语音、为优化零样本文本到语音框架而需要大量训练数据以及适用于OOD或分布之外文本的鲁棒性,这促使开发人员努力研究一种更强大和易于使用的文本到语音框架。
在本文中,我们将讨论StyleTTS-2,这是一个稳健而创新的文本到语音框架,它建立在StyleTTS框架的基础上,旨在向最先进的文本到语音系统迈进一步。StyleTTS2框架将语音风格建模为潜在的随机变量,并使用概率扩散模型来采样这些语音风格或随机变量,从而使StyleTTS2框架能够有效地合成逼真的语音,而无需使用参考音频输入。由于采用了这种方法,与当前最先进的文本到语音框架相比,StyleTTS2框架能够提供更好的结果和高效性,同时还能够利用扩散模型框架提供的多样化语音合成。我们将更详细地讨论StyleTTS2框架,并探讨其架构和方法,同时还将查看框架取得的结果。现在让我们开始吧。
StyleTTS2 文本到语音合成:介绍
StyleTTS2是一个创新的文本到语音合成模型,它采用了构建人类级TTS框架的下一步,它建立在StyleTTS之上,这是一个基于风格的文本到语音生成模型。StyleTTS2框架将语音风格建模为潜在的随机变量,并使用概率扩散模型来采样这些语音风格或随机变量,从而使StyleTTS2框架能够有效地合成逼真的语音,而无需使用参考音频输入。将风格建模为潜在的随机变量是StyleTTS2框架与其前身StyleTTS框架的区别所在,它旨在为输入文本生成最合适的语音风格,而无需参考音频输入,并能够在采用扩散模型提供的多样化语音合成能力的同时实现有效的潜在扩散。此外,StyleTTS2框架还采用了预训练的大规模SLM(Speech Language Model)作为鉴别器,比如WavLM框架,并将其与自己的新颖差分时长建模方法结合起来进行端到端的训练,从而生成增强自然度的语音。由于其所采用的方法,StyleTTS2框架在语音生成任务方面优于当前最先进的框架,并且是用于零样本设置的大规模语音模型预训练中最高效的框架之一。
继续前进,为了提供人类级的文本到语音合成,StyleTTs2框架结合了扩散模型和大规模语音语言模型等现有作品的经验。扩散模型通常用于语音合成任务,因为其具有细粒度的语音控制能力和多样化的语音采样能力。然而,扩散模型不如基于GAN的非迭代框架高效,主要原因是需要迭代地对潜在表示、波形和梅尔频谱图进行采样,以达到所需的语音时长。
另一方面,关于大规模语音语言模型的最新研究表明,它们有能力提高文本到语音生成任务的质量,并且适应说话者。大规模语音语言模型通常将文本输入转换为由预训练的语音语言框架导出的量化或连续表示,用于语音重建任务。然而,这些语音语言模型的特征并非直接针对语音合成进行优化。相比之下,StyleTTS2框架利用了通过对抗训练建立大SLM框架所获得的知识,以便在不使用潜在空间映射的情况下合成语音语言模型的特征,从而直接学习语音合成优化的潜在空间。
StyleTTS2:架构和方法论
在核心上,StyleTTS2是基于其前身StyleTTS框架构建的,StyleTTS框架是一个非自回归文本到语音框架,利用风格编码器从参考音频中派生风格向量,从而实现表达性和自然的语音生成。StyleTTS框架中使用的风格向量直接整合到编码器、持续时间预测器和预测器中,利用AdaIN(自适应实例归一化)进行处理,因此StyleTTS模型可以生成具有不同韵律、持续时间甚至情感的语音输出。StyleTTS框架总共包括8个模型,分为三个类别:
- 声学模型或语音生成系统,包括风格编码器、文本编码器和语音解码器。
- 利用韵律和持续时间预测器的文本到语音预测系统。
- 实用系统,包括文本对齐器、音高提取器和鉴别器,用于训练目的。
由于其方法,StyleTTS框架在可控和多样化语音合成方面实现了最先进的性能。然而,这种性能也有其局限性,如样本质量下降、表达能力受限以及对实时语音干扰应用的依赖。
在改进StyleTTS框架的基础上,StyleTTS2模型具有提升的表达性和高人类水平质量的文本到语音任务性能。StyleTTS2框架通过端对端训练过程,使用对抗训练和直接波形合成共同优化不同组件。与StyleTTS框架不同,StyleTTS2框架将语音风格建模为潜在变量,并通过扩散模型对其进行采样,从而生成不使用参考音频的多样化语音样本。让我们详细了解这些组件。
干扰的端对端训练
在StyleTTS2框架中,使用端对端训练方法来优化各种文本到语音组件,无需依赖固定组件。StyleTTS2框架通过修改解码器,直接从风格向量、音高与能量曲线以及对齐表示生成波形。框架然后移除解码器的最后一个投影层,并替换为波形解码器。StyleTTS2框架使用两个编码器:基于HifiGAN的解码器直接生成波形,基于iSTFT的解码器生成相位与幅度,进一步转换为波形,以实现更快的干扰和训练。

上图表示预训练和联合训练使用的声学模型。为了减少训练时间,这些模块首先在预训练阶段进行优化,然后在联合训练过程中对除音高提取器外的所有组件进行优化。之所以联合训练不优化音高提取器,是因为它用于为音高曲线提供真值。

上图表示带WavLM框架的语言模型对抗训练和干扰,该模型在预训练时未经调整。这个过程与上面提到的过程不同,它可以接受不同的输入文本,但在每批中累积梯度来更新参数。
风格扩散
StyleTTS2框架旨在通过遵循条件分布的潜在变量来对语音进行建模。这个潜在变量被称为广义语音风格,代表语音样本中超出任何语音内容范围的任何特征,包括词法重音、韵律、说话速度甚至共振转移。
语言模型鉴别器
语言模型因其在语义和声学方面对有价值信息进行编码的普遍能力而闻名,SLM表示传统上能够模仿人类感知,评估生成合成语音的质量。StyleTTS2框架使用对抗训练方法利用SLM编码器的生成能力,并采用12层WavLM框架作为鉴别器。这种方法使框架能够在分布外的文本上进行训练,从而改善性能。此外,为了防止过拟合问题,框架以相等的概率采样分布外和分布内的文本。
可微分时长建模
传统上,在文本到语音框架中使用时长预测器来产生音素持续时间,但这些时长预测器使用的上采样方法在端到端训练过程中往往会阻塞梯度流动,并且NaturalSpeech框架采用了基于注意力的上采样器进行人类级的文本到语音转换。然而,StyleTTS2框架发现在对抗训练中,这种方法不稳定,因为StyleTTS2使用可微分上采样和不同对抗训练进行训练,而由于偏差导致长度不匹配的多余项丢失。虽然使用软动态时间规整方法可以帮助缓解这种不匹配,但使用它不仅计算成本高,而且在处理对抗目标或mel重构任务时稳定性也是一个问题。因此,为了实现对抗训练的人类级性能并稳定训练过程,StyleTTC2框架使用了非参数化上采样方法。高斯上采样是一种常用的非参数化上采样方法,用于转换预测的持续时间,尽管由于预先确定的高斯核长度而具有局限性。高斯上采样的这种限制限制了它准确建模不同长度的对齐的能力。
为了克服这个限制,StyleTTC2框架提出了一种新的非参数化上采样方法,不需要任何额外的训练,并且能够考虑对齐的不同长度。对于每个音素,StyleTTC2框架将对齐建模为一个随机变量,并指示音素与其对齐的语音帧的索引。
模型训练和评估
StyleTTC2框架在三个数据集上进行训练和实验:VCTK、LibriTTS和LJSpeech。StyleTTS2框架的单说话者组件使用包含大约13,000多个音频样本的LJSpeech数据集进行训练,其中包括12,500个训练样本、100个验证样本和近500个测试样本,总运行时间近24小时。该框架的多说话者组件在包含超过44,000个音频片段的VCTK数据集上进行训练,其中包含100多个具有不同口音的个体本地发音人,并分为43,500个训练样本、100个验证样本和近500个测试样本。最后,为了使该框架具备零-shot适应能力,该框架在组合的LibriTTS数据集上进行训练,该数据集包含大约250小时的音频,其中包含超过1,150个个体发言者。为了评估其性能,该模型采用了两个指标:MOS-N 或自然度均值意见分数,以及 MOS-S或相似度均值意见分数。

结果
StyleTTS2框架中使用的方法和方法在其性能展示中得到体现,该模型在自然音乐数据集上优于几种最先进的TTS框架,从而为该数据集建立了新的标准。此外,StyleTTS2框架在VCTK数据集上优于最先进的VITS框架,在以下图中展示了结果。

StyleTTS2模型在LJSpeech数据集上也优于先前的模型,并且在相同指标下与先前框架在OOD或分布外文本上没有显示任何质量下降的程度。此外,在零-shot设置中,StyleTTC2模型在自然度方面优于现有的Vall-E框架,尽管在相似度方面落后。然而,值得注意的是,与Vall-E框架使用超过60,000小时的训练相比,StyleTTS2框架仅使用245小时的音频样本进行训练,从而证明StyleTTC2是现有大型预训练方法的一个数据高效的替代品,这些方法在Vall-E中使用。

此外,由于缺乏情感标记的音频文本数据,StyleTTC2框架使用GPT-4模型生成了500多个不同情感的实例,用于可视化框架使用其扩散过程创建的样式向量。

在第一幅图中,LJSpeech模型的样式向量展示了对输入文本情感的情感样式,展示了StyleTTC2框架合成具有多样情感的表达性语音的能力。第二个图展示了每个五个个体演讲者的不同聚类形成,从单个音频文件中表现出了广泛的多样性。最后一个图展示了第一个演讲者情感的松散聚类,并揭示了尽管存在一些重叠,基于情感的聚类仍然显著,从而表明可以在引用音频样本和其输入音调之外操纵演讲者的情感音调。尽管使用了扩散的方法,StyleTTS2框架成功地超过了现有的最先进框架,包括VITS、ProDiff和FastDiff。

总结
在本文中,我们谈论了StyleTTS2,这是一个新颖、强大和创新的文本到语音框架,建立在StyleTTS框架的基础上,旨在呈现出最先进的文本到语音系统的下一个步骤。StyleTTS2框架将语音样式建模为潜在的随机变量,并使用概率扩散模型对这些语音样式或随机变量进行采样,从而使StyleTTS2框架能够有效地合成逼真的语音,而无需使用参考音频输入。StyleTTS2框架使用样式扩散和SLM辨别器在文本到语音任务上实现了人类级别的性能,并成功地在各种语音任务上超过了现有的最先进框架。




