变化之处:纯文本指标已不足以评估多模态质量
多年来,评估多模态输出的质量——例如包含图像在内的翻译——一直依赖于仅为文本设计的自动评估指标。但近期研究表明,这种方法存在缺陷:这些指标往往无法捕捉依赖于视觉上下文的错误。在一项2026年关于多模态机器翻译的研究中,基于n-gram和基于嵌入的指标在一套专门用于捕捉上下文相关错误的对比评估集上均表现不佳,这意味着它们无法判断翻译是否因忽略图像而出错[1][3]。这一发现颠覆了“仅凭文本评估便能充分评判多模态系统”的假设。
同一项研究发现,在通用测试集上,所有指标都能区分图像感知系统与图像无关系统,但这还不够——现实世界中的错误往往取决于微妙的视觉线索。因此,新的图景已然清晰:要评估扁平化多模态表征的主观质量,你需要明确纳入视觉信息而不仅仅是文本的指标。
如何真正进行评估:使用图像描述与人工评分
最有前景的方法是将自动生成的图像描述输入到有监督的评估指标中。在2026年的研究中,将此类视觉信息纳入有监督指标后,其与人类判断的一致性优于仅基于文本的指标[1][3]。这意味着,如果你在评估一个多模态系统,应当生成图像的文本描述并将其纳入指标的输入中——这有助于指标“看到”视觉上下文。
人的判断同样至关重要,但它并非一成不变。研究观察到,当人类评估者有机会看到视觉背景时,他们的评分往往会发生显著修正[1][3]。这表明主观质量并非固定属性——它取决于提供给评估者的背景信息。因此,为了公平评估,应始终向人类评分者呈现多模态输入(图像+文本),而不仅仅是文本输出。
这在什么时候适用?取决于任务和评估指标
视觉上下文在评测中的有效性因任务而异。在2026年的研究中,所有指标都能在通用测试集上成功区分图像感知系统与图像无关系统,但在为捕捉上下文相关错误而设计的对比集上却失效了[1][3]。这意味着,如果你的评测集过于简单(例如只包含通用句子),即使仅基于文本的指标看起来表现良好,它们也会遗漏那些图像真正起关键作用的困难案例。
对于其他多模态任务,如视频中的情感分析,挑战是相似的:你需要联合建模语音词汇和视觉手势,正如MOSI数据集[5]所示。该数据集提供了逐帧的视觉标注和逐毫秒的音频标注,这对于训练和评估捕捉跨模态交互的模型至关重要。因此,经验教训是:根据具体的多模态任务定制你的评估方法,并加入对比性示例,以检验模型是否真正利用了视觉信息。
关于这些来源
此回答基于5项研究(2项经同行评审,3项为预印本)——发表于2022年至2026年间,其中4项为2024年或之后发表,1项发表于Q1–Q2期刊,合计被引用348次——这些研究是从5项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的43篇文献。
本文引用的文献
MT评估中的视觉语义:图像描述是否有助于多模态MT质量评估?
在2026年一项关于多模态机器翻译的研究中,将自动生成的图像描述纳入有监督评估指标后,其与人类判断的一致性有所提升,而n-gram和嵌入类指标在旨在捕捉上下文相关错误的对比测试集上表现不佳。
感知视觉质量评估:原理、方法与未来方向
2025年感知视觉质量评估(PVQA)综述概述了主观方法(人工评分)和客观方法(算法预测),用于评估包括图像、视频、虚拟现实和生成式AI内容在内的多种多媒体类型的质量。
MT评估中的视觉语义:图像描述是否有助于评估多模态MT质量?
[1]的重复研究(相同作者和相同发现)证实,评估指标中的视觉上下文能提升与人类判断的一致性,并且当提供视觉上下文时,人类评分往往会被修正。
FOAA:用于多模态肿瘤分类的扁平化外部算术注意力
FOAA,一种用于多模态融合的扁平化外部算术注意力机制,在两个肿瘤分类数据集上取得了最先进的结果,表明基于注意力的融合能够提升多模态任务的特征质量。
MOSI:在线观点视频中情感强度与主观性分析的多模态语料库
MOSI数据集为在线视频中的情感和主观性分析提供了首个意见级别标注的语料库,包含逐帧的视觉标注和逐毫秒的音频标注,从而能够对口语词汇与视觉手势进行联合建模。
