哪些研究问题自然源于可控文本转语音模型?

可控TTS研究空白:细粒度韵律、跨语言控制、实时编辑和鲁棒性——哪些已被验证,哪些仍待探索。

直接答案

可控文本转语音(TTS)模型为研究如何赋予用户对语音的细粒度、直观控制开辟了新的方向——例如调整语速、音高,甚至用自然语言描述声音。最有力的证据表明,像FastSpeech这样的并行模型能够平滑地调整语速,同时将合成时间缩短38倍,但在不损失自然度的前提下精确控制时长仍然是一个挑战[1][2]。其他研究在利用文本描述进行风格控制和跨语言语音控制方面显示出潜力,但这些研究仍处于早期阶段,需要在鲁棒性和实际可用性方面做更多工作[3][4]。总体而言,该领域正从“能否控制?”转向“控制得有多精确、多自然?”——最大的空白在于细粒度韵律、跨语言泛化以及编辑现有语音。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

用户目前究竟能控制什么?

对语速的控制是最成熟的。FastSpeech是一款2024年推出的并行TTS模型,能够平滑地调整语速,几乎消除了跳词或重复词的问题,同时与自回归模型相比,将梅尔频谱生成速度提升了270倍,端到端合成速度提升了38倍[1]。这意味着用户可以获得更快、更可靠的语音,并支持可调节的语速——这对无障碍访问和实时应用来说是一大优势。

但对话语时长的精确控制——比如让一句话恰好持续3秒——仍然很困难。2024年的一项研究引入了掩码时长模型,该模型能从音频和文本提示中预测音素时长,从而实现细粒度的时长控制,但它需要对抗训练来保持对齐的稳健性,并且在自然度上仍不如无约束合成[2]。因此,虽然语速控制已经流畅,但精确的时长控制仍在推进中。

你能直接描述想要的语音吗?

是的,这是一个热门的研究方向。PromptTTS(2023)允许用户输入类似“一位女士轻声对朋友低语”这样的提示,并生成匹配的语音,它使用了独立的风格和内容编码器[4]。这比调整音高或韵律等声学参数更加用户友好,因为后者需要专业知识。然而,该研究不得不创建新数据集,因为此前没有现成的,而且评估仅限于风格控制质量,并未涉及现实世界的鲁棒性。

2025年的一项研究将这一思路扩展到了跨语言控制:他们在一个日语TTS模型和一个英语描述控制模型上进行了训练,共享与语言无关的音色和风格表征,从而让用户可以用英语描述声音,并获得具有该风格的日语语音[3]。这一方法之所以有效,是因为这些表征基于自监督学习,不依赖于具体语言。但该研究仅测试了英语和日语,且由于缺乏日语音频-描述配对,跨语言迁移仍停留在概念验证阶段,尚未成为可投入生产的成熟功能。

我们能否在语音生成后对其进行编辑?

是的,但有局限性。EdiTTS(2022)利用基于分数的扩散模型,通过对目标区域施加有针对性的扰动和掩码,在不重新训练的情况下编辑现有语音中的音高和内容[5]。它在听感测试和语音转文字准确率上优于基线方法,但它是一种现成的方法,需要仔细调整扰动强度和掩码——因此对于非专业人士来说,它还不是一个即插即用的工具。

最佳情况与典型情况下的证据差距显而易见:FastSpeech在受控环境中展现出令人瞩目的速度和稳健性,但现实世界的语音更为复杂,而其他研究则表明,精确控制往往以牺牲自然度为代价,或需要额外的训练数据[1][2][3][4]。因此,尽管该领域已取得飞跃式进展,随之而来的研究问题自然聚焦于稳健性、泛化能力以及用户友好界面——而不仅仅是原始性能。

关于这些来源

本回答基于5项同行评审研究——发表于2022年至2025年间,其中3项为2024年或之后发表,1项发表于Q1–Q2期刊,合计被引用405次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的36篇文献。

本文引用的文献

1

FastSpeech:快速、稳健且可控的文本到语音合成

FastSpeech是一种并行的前馈式TTS模型,在保持自回归模型音质的同时,将梅尔频谱生成速度提升了270倍,端到端语音合成速度提升了38倍,并且几乎消除了单词跳读或重复的问题,同时支持流畅的语速调节。

2

用于话语时长可控的文本转语音的掩码时长模型

掩码时长模型通过从音频/文本提示和掩码中预测音素时长,实现了细粒度的语句时长控制,但需要对抗训练以确保对齐的稳健性;该模型在时长控制上优于基线,但自然度仍是一大挑战。

3

基于描述的可控文语转换与跨语言语音控制

一种基于描述的文语转换(TTS)方法通过将目标语言的TTS与来自另一种语言的描述控制模型相结合,利用基于SSL的语言无关音色/风格表征,实现了跨语言的语音控制;该方法在英语和日语上进行了测试,在无需日语音频-描述配对的情况下,达到了较高的自然度和可控性。

4

Prompttts:基于文本描述的可控文本转语音

PromptTTS使用文本描述(风格和内容)作为提示来合成语音,并配备了风格编码器和内容编码器;它展示了精确的风格控制和高品质,但由于当时不存在现成数据集,因此需要构建一个新的数据集。

5

EdiTTS:基于评分的编辑方法,用于可控文本到语音合成

EdiTTS将基于分数的扩散模型应用于现有语音的音高和内容编辑,无需额外训练,通过扰动和掩码实现;在听感测试和语音转文字准确率上均优于基线方法,但需要仔细调参。