标准TTS质量测试究竟遗漏了什么?
传统TTS评估主要关注语音的自然度和可懂度,但这并不能说明模型能否遵循特定指令。例如,一个模型可能生成完全流畅的音频,却完全无视“用耳语般悲伤的语气”或“像新闻主播一样说话”的要求。新的InstructTTSEval基准测试包含6000个测试用例,涵盖三类任务(声学参数指定、描述性风格指令和角色扮演),结果发现当前的指令跟随型TTS系统“仍有很大改进空间”[1]。这意味着即使是最优秀的模型,也常常无法执行复杂、多部分的指令——而这一点,简单的质量评分永远无法揭示。
另一个缺口是情感控制。EmoVoice是一个通过自然语言实现细粒度情感控制的模型,在40小时的英语情感数据集和中文数据集上进行了测试。研究人员发现,现有的情感评估指标与人类感知偏好并不完全一致[2]。因此,一个模型可能在自动化情感指标上得分很高,但人类听众仍会觉得情感表达不准确或过于夸张。因此,如果质量测试不包含人类对情感恰当性的判断,就可能产生虚假的成功感。
为什么质量测试无法发现韵律或精确度失败?
韵律——即语音的节奏、重音和语调——是质量测试常常忽略的一个关键控制维度。一个模型可能听起来很自然,却无法生成你所要求的确切音高曲线或强调。EdiTTS作为一种基于分数的编辑方法,证明了无需重新训练即可进行有针对性的音高编辑,但其评估依赖于听力测试和语音转文本回转录来验证编辑是否正确应用[3]。这比通用的质量评分要精细得多,而且很少成为标准TTS评估的一部分。
同样地,自发语音中的韵律控制——如嘎裂声或填充词——需要文本与声学特征之间的精确对齐,而这很难实现。一个基于神经HMM的系统能够在不降低合成质量的前提下实现话语级别的韵律控制,但作者仍需进行感知测试,以确认该控制并未损害质量[4]。这表明质量与可控性是相互独立的:你可以拥有其一而不具备另一个,且仅凭质量测试无法判断控制是否准确。
那么“解耦”呢——质量测试能否揭示控制是否相互干扰?
可控文本转语音模型通常致力于解耦说话人身份、语言和风格等因素,以便在改变其中一个时不影响其他因素。然而,质量测试并不会检验改变风格是否会无意中改变说话人的声音或语言。2022年的一项研究提出了一种方法,通过最小化潜在表示之间的互信息来提升解耦效果,并借助主观听感测试对其进行了验证,同时衡量了质量和可控性[5]。他们之所以需要明确测试可控性——而不仅仅是质量——恰恰说明这两者是相互独立的维度。
这些论文共同表明,质量测试是必要的,但还不够充分。它们能告诉你音频是否悦耳、是否清晰可懂,却无法告诉你模型是否遵循了你的指令、是否传达了正确的情感、是否达到了精确的韵律,或者是否保持了各控制项之间的独立性。正因如此,像InstructTTSEval这样的新基准正在推动使用自动化评判(如Gemini)来直接评估指令跟随能力[1]。在此类评估成为标准之前,一个模型完全有可能在质量测试中过关,却在它被设计来做的核心任务上失败——即可控性。
关于这些资料来源
本回答基于5项同行评审研究——发表于2022年至2025年间,其中2项为2024年或之后发表,合计被引用126次——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这5项研究又源自从超过5亿篇论文的数据库中检索到的55篇文献。
本文引用的文献
InstructTTSEval:面向文本到语音系统中复杂自然语言指令跟随的基准评测
提出了InstructTTSEval基准,包含6000个测试用例,覆盖英语和中文的三种任务(声学参数指定、描述性风格指令、角色扮演),并发现当前遵循指令的TTS系统在遵循复杂自然语言指令方面仍有很大改进空间。
EmoVoice:基于大语言模型的自由文本提示情感语音合成模型
提出了EmoVoice,一种基于大语言模型的情感语音合成模型,并发现现有的情感评估指标与人类感知偏好并不完全一致,这表明自动化指标可能无法可靠地反映人类对情感表达的判断。
EdiTTS:基于评分的编辑方法用于可控文本到语音合成
我们提出了EdiTTS,一种基于评分的TTS编辑方法,无需重新训练即可实现针对性的音高和内容编辑,并通过听感测试和语音转文字回转录证明,它在满足用户指定要求方面优于基线方法。
基于神经HMM的韵律可控自发语音合成
开发了一套基于神经隐马尔可夫模型(HMM)的语音合成系统,支持自发语音的语句级韵律控制,并通过客观测试和主观听感测试证明,韵律控制不会降低合成质量,同时能够再现嘎裂声等发声类型。
一种基于多变量信息最小化的可控多语言、多说话人、多风格文本到语音合成方法
提出了一种多变量信息最小化方法,用于解耦多语言、多说话人、多风格TTS的潜在表示,并通过主观听感测试验证了该方法在提升音质和可控性方面的有效性。
