为什么同一个声音在不同测试设置下会得到不同的质量评分?
主观质量并不是声音的固有属性,它取决于听者所想象的情境。2024年一项众包研究在四种不同任务框架下(家用机器人、儿童语音替代、有声书、长篇幅信息性文本)测试了四种TTS语音,结果发现平均意见得分(MOS)在不同框架间存在显著差异,且每种语音在不同情境中的表现也各不相同[5]。这意味着,在有声书中听起来很出色的语音,作为机器人助手时可能得分很低。因此,任何评估都应明确预期的使用场景和框架,否则结果将无法推广到实际应用中。
实际意义在于:当你为表现性语音设计主观测试时,不要只问“这听起来有多自然?”——要给听者一个具体的场景。2024年的研究明确警告,脱离语境的MOS评估并不可靠,报告应始终说明所使用的框架[5]。因此,在你自己的评估中,要明确目标应用(例如,对话代理、有声书旁白),并据此指导评分者。
您应请听众对表现力的哪些具体方面进行评分?
表现力是多维度的,因此单一的总体评分并不足够。针对普通话有声书合成的研究采用了多尺度方法,在三个层级(可能是句子、段落和篇章)提取风格嵌入,并发现对这些层级进行建模在主观测试中同时提升了自然度和表现力[2]。这表明你应从多个粒度评估风格——例如,情感在单个句子中的传达效果与在整个段落中的传达效果——而不仅仅是依赖一个全局评分。
另一项关于有声书TTS自监督风格表征的研究发现,使用隐式、上下文感知的风格嵌入,在域内和域外测试集上均提升了主观评分,同时使长段落中的情感转换听起来更加自然[3]。因此,在评估时,应包含长篇幅段落以考察情感连贯性,而不仅仅是孤立的句子。请让评分者针对情感一致性和转换流畅度进行评价,而非笼统地以“表现力”作为模糊的整体指标。
客观度量如何辅助主观判断?
客观韵律指标——如音高、时长和能量——能够为主观评分提供支撑,甚至预测这些评分。在2021年一项关于跨说话人风格迁移的研究中,所提出的模型在韵律准确性上达到了与依赖特定说话人的模型(基于目标说话人自身数据训练)相当的水平,并在客观和主观评估中均优于基线方法[4]。这表明,客观测量韵律(例如,与真实音高的相关性)可以作为风格保真度的代理指标,补充人工听测评估。
然而,仅靠客观指标无法全面反映感知质量。同一项研究还采用了主观评估来确认韵律瓶颈确实提升了风格迁移质量,这表明在评估时,你应当始终将客观度量与人工评分结合使用[4]。在你的评估中,两者都要收集:一方面计算韵律误差指标(如F0均方根误差、时长误差),另一方面结合前面讨论过的上下文框架进行听感测试。如果两者结果一致,你就有了强有力的证据;如果出现分歧,则需深入探究原因——或许客观指标遗漏了听众真正在意的某些方面。
关于这些来源
本回答基于5项同行评审研究——发表于2021年至2024年间,其中2项为2024年或之后发表,合计被引用54次——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的76篇文献。
本文引用的文献
生成式表达性对话语音合成
GPT-Talker是一种生成式对话语音合成系统,在自然度和表现力的主观与客观评估中,均优于其他先进系统,该评估基于一个新的236小时自然对话数据集(NCSSD)进行。
面向多尺度说话风格建模的汉语语音合成中的层级上下文信息方法
一种多尺度说话风格建模方法,利用三级风格嵌入和分层上下文预测器,在普通话有声书数据集的主观评估中显著提升了自然度和表现力。
用于表现性语音合成的自监督上下文感知风格表示
通过对比学习和深度聚类,从纯文本中学习到的自监督风格表征,在领域内和领域外的有声书测试集上,其主观评分均优于人工标注的风格标签,并使长段落中的情感转换更加自然。
跨说话人风格迁移在神经语音合成中的韵律瓶颈方法
一种采用显式韵律瓶颈的跨说话人风格迁移TTS系统,其韵律准确度达到了与说话人相关模型相当的水平,并在客观和主观评估中均优于循环一致性和GMVAE基线方法。
评估情境框架对主观文本转语音质量的影响
在对四种TTS语音进行众包MOS评估时,系统性地改变任务框架(机器人、儿童声音、有声书、长文本)显著改变了MOS分数,且各语音在不同框架下的表现存在差异,这表明脱离语境的评估结果不具备泛化性。
