为什么词级强调滑块是最明确的优势
让TTS听起来可控的最直观方式,是让用户能够调整对特定词语的强调,而不仅仅是对整个句子的控制。苹果公司2022年的一项研究测试了三种在神经TTS系统中编码强调的方法:词内音高/时长的变化、一种结合音高、能量和时长的基于小波的特征,以及两者的学习混合。这三种方法都允许用户通过简单提高一个数值来增加对某个词的强调,听者能够感知到强调的变化,且质量损失很小——事实上,在成对比较测试中,他们更喜欢带有强调的语句,而非平淡的语句[2]。这意味着产品可以为每个词提供一个简单的“强调滑块”,并且它能按用户的预期工作。
同一项研究发现,学习到的特征组合表现最佳,但即便是最简单的基于方差的方法也颇为有效。这对产品设计师来说是个好消息:你不需要复杂的模型就能为用户提供实用的控制。关键在于,该控制映射到可感知的声学变化——音高和时长——而非用户无法预测的隐藏潜在变量[2]。
语句层面的韵律控制:表现力的支柱
除了单个词汇,用户还希望塑造句子的整体旋律和节奏。2023年的一项研究在基于神经HMM的语音合成系统中加入了话语级韵律控制,使用户能够调整整个话语的音高范围和语速等特征。该系统即使在包含填充词和口误的自发言语中也能保持稳定的对齐,感知测试表明,韵律控制并未降低合成质量[1]。这表明,一个全局性的“表现力”旋钮——例如控制音高范围——可以在不破坏自然度的前提下添加。
2024年一项关于情感可控语音合成的研究更进一步,将语句级韵律因素与词级突显相结合。他们实现了平均线性可控性得分0.95(满分1.0),这意味着用户可以平滑地调节情感强度和韵律变化,而输出也随之相应调整[5]。这种两阶段设计——先设定情感,再微调韵律——为希望同时具备粗粒度和细粒度控制的产品提供了一个强有力的模板。
情感与风格控制:从软标签到轻量级原型
情感是用户关注的高级控制维度,但实现起来颇具挑战,因为情绪在强度上存在差异,且常常相互交织。2024年的一项研究采用“情感软标签”——即用连续值而非单一类别——来对TTS模型进行条件控制。这使得用户能够连续调节情感强度,该系统在三种情感上达到了51%的情感可区分准确率,意味着听者大多数情况下能辨别出系统所表达的情感意图[5]。该研究还表明,在情感标签之上叠加词级重音,既能保持情感间的可控性,又能增强同一情感内部的多样性[5]。
在风格控制方面,一项2026年的研究发现,理解风格提示并不需要重型文本编码器。相反,他们使用了预计算的“原型属性向量”——即从大量风格描述中提取的嵌入平均值——并在词错误率和质量评分上达到了与使用完整文本编码器的基线相当的水平,同时将模型大小减少了38%[3]。对于希望提供风格预设(例如“欢快”“悲伤”)而又不想承担大型语言模型计算成本的产品来说,这是一个实用的设计选择。
关于这些来源
本回答基于5项同行评审研究——发表于2022年至2026年,其中3项为2024年或之后发表,合计被引用74次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的65篇文献。
本文引用的文献
基于神经HMM的韵律可控自发语音合成
在基于神经HMM的语音合成系统中加入语句级韵律控制,在感知测试中保持了合成质量,即使面对包含不流畅现象的自发语音也是如此,并且实现了对嘎裂声类型的合成。
并行神经TTS的强调控制
在对三种用于强调控制的潜在特征进行比较时,所有特征都通过增大特征值来实现词级强调,在成对测试中,听者更偏好带强调的语音而非不带强调的语音,其中学习得到的组合方式表现最佳。
基于语音属性向量的免编码器风格可控语音合成
用预计算的风格原型属性向量替代大型文本编码器,使模型体积减少了38%,同时词错误率和自动评估分数保持相当水平,这表明轻量级风格表示是可行的。
Matcha-TTS:一种基于条件流匹配的快速语音合成架构
Matcha-TTS采用最优传输条件流匹配技术,在听感测试中相较于强基线模型获得了最高的平均意见得分,同时具有最小的内存占用和快速的合成速度,不过它并未侧重于可控性。
基于情感软标签、语句级韵律因子和词级重音的可控情感语音合成
采用情感软标签与韵律因素的两阶段情感可控语音合成模型,实现了51%的情感区分准确率与0.95的平均线性可控性评分,同时保持了与传统模型相当的音频质量。
