跳转至

评估指标与方法

图像描述有哪些常用自动评估指标?CIDEr 和 SPICE 的计算原理有何不同?

图像描述的自动评估指标经历了从简单 n-gram 匹配到语义理解的演进。最基础的几个指标包括 BLEU、METEOR 和 ROUGE-L,它们最初都是为机器翻译设计的,后来才迁移到图像描述任务上。BLEU 计算生成描述与参考描述之间 n-gram 的精确匹配率,更看重精确度;METEOR 引入了同义词匹配和词形还原,更贴近召回率;ROUGE-L 则是计算最长公共子序列,侧重于句子结构的相似性。但它们的通病是过于依赖表面词汇的重叠,对语义正确但用词不同的描述往往给出很低的分数。

CIDEr 和 SPICE 正是为了突破这一局限而设计的,但思路截然不同。

CIDEr 的核心是共识度量。它的出发点是:一个好的描述应该与多数人类给出的描述一致,因为它捕捉到了图像的“核心共识”。计算时,它首先对所有参考描述中的 n-gram 计算 TF-IDF 权重。出现频率高但在其他图像描述中也常见的词(比如“a”、“the”、“picture”)会被降权;而在特定图像描述中频繁出现但在别处很少见的词(比如“金色的”、“奔跑的”、“斑马线上”)会被给予更高的权重。这一步相当于找出人类描述这张图时最常用的关键表达。

然后,CIDEr 将生成的描述也表示成 n-gram 的 TF-IDF 向量,并与多个参考描述的共识向量计算余弦相似度。最终的 CIDEr 分数是这些相似度在不同 n(n=1到4)上的加权平均。它的精妙之处在于,它不是简单地算“匹配了多少词”,而是衡量“匹配了多少关键特征”。如果生成描述用了“犬”代替“狗”,CIDEr 可能因为词形不同而失分;但如果核心名词“斑马线”、“金色”都一致,它仍然会给出不错的分数。CIDEr 目前是最主流的标准图像描述评估指标之一,尤其在 COCO Captions 任务上被广泛采用。

SPICE 走的是另一条路:基于场景图的语义评估。它的核心思想是:描述的质量不取决于用了哪些词,而取决于它正确表达了哪些物体、属性和关系。计算时,SPICE 先用一个预训练的语义解析器,把生成描述和参考描述都转换为场景图——这是一种结构化的表示,其中节点是物体(“猫”、“沙发”),边是属性(“颜色是橘色的”)和关系(“躺在…上”)。然后,它计算生成描述的场景图与参考描述的场景图之间的 F1 分数。一个命题(如“猫趴在沙发上”)要么完全匹配,要么不匹配。

SPICE 解决了传统指标对句子结构变化极度敏感的问题。“一只橘猫趴在沙发上”和“沙发上趴着一只橘色的猫”在 BLEU 下得分很低,但在 SPICE 下几乎满分,因为它们提取出的场景图是相同的。它也更符合人类对“理解”的定义——抓住图像中的核心语义关系。然而 SPICE 的局限在于它严重依赖语义解析器的准确性,而解析器本身可能出错;同时它忽略了语言的自然流畅性,一个语法错误但语义关系正确的句子也能得到高分。因此在实际使用中,SPICE 常与 CIDEr 互补使用,前者看语义骨架,后者看表达共识。

一句话总结:CIDEr 衡量“你描述得是否像大多数人描述的那样”,SPICE 衡量“你描述的语义关系是否正确且完整”。

image.png


CLIPScore 如何评估生成描述的质量?与传统指标相比有什么优势?

CLIPScore 是评估图像描述的一种全新范式,它完全不依赖人工参考描述。它的计算方式出人意料地简单:用预训练的 CLIP 模型提取生成描述的文本嵌入向量,再提取对应图像的视觉嵌入向量,然后计算两者的余弦相似度。这个余弦值就是 CLIPScore。

它的理论基础在于 CLIP 本身的训练目标。CLIP 在 4 亿图文对上通过对比学习,学会了将匹配的图文映射到相近的嵌入位置。如果一段描述准确且全面地捕捉了图像内容,那么它的嵌入应该与图像嵌入高度相似;如果描述内容与图像无关或是错误的,相似度就会很低。它不需要人工标注的“标准答案”来比对,这直接打破了传统指标受限于参考描述数量和质量的瓶颈。

与传统指标相比,CLIPScore 有三大优势:

第一,它不受参考描述偏差的影响。传统指标需要人工写的参考描述,但人的描述带有主观性和文化偏差。如果参考描述里没提到“背景是蓝天”,即使生成描述提到了,传统指标也会认为这是多余的内容而扣分。CLIPScore 直接将描述与图像本身比对,能正确奖励所有与图像视觉内容一致的信息。

第二,它能捕捉语义相似性和视觉常识。对于“一只在睡觉的猫”和“一只闭着眼睛趴着的猫”,它们在字面上完全不同,传统指标几乎得零分,但 CLIP 能理解它们描述的是同一视觉状态,给出高相似度。

第三,它评估的维度更接近“视觉忠实度”。CLIPScore 对幻觉(描述图中不存在的物体)十分敏感。如果生成描述凭空编造了“桌子上有一本书”,而图中并没有书,该描述的嵌入就会在“书”这个语义维度上偏离图像嵌入,导致得分降低。这使得 CLIPScore 成为一种无参考的幻觉检测工具。

但它也有固有的局限。CLIP 模型本身有其自身的知识截止日和偏见,对于它不熟悉的领域,评估的可靠性会下降。同时 CLIPScore 不直接评估语言流畅性和语法正确性——一段语法破碎但包含正确关键词的文本可能得分不低。因此它通常需要与语言流畅性指标配合使用。尽管如此,CLIPScore 的出现标志着图像描述评估从“与人类参考答案比对”迈向了“与视觉世界本身比对”的重要转折。


FID 用于评估图像生成质量,它的计算基于什么假设?有什么局限性?

FID,全称是 Fréchet Inception Distance,是目前评估生成图像质量的最主流指标。它的计算过程分为两步。第一步是特征提取:将一批真实图像和一批生成图像分别送入一个预训练的 Inception v3 网络,不取最后的分类输出,而是取中间层的一个 2048 维特征向量。这个特征向量被认为是图像高级语义的紧凑表示。第二步是距离计算:假设这两批图像的特征都服从多元高斯分布,分别计算真实图像特征的均值向量和协方差矩阵,以及生成图像特征的均值向量和协方差矩阵。然后计算这两个高斯分布之间的 Fréchet 距离,即:

image.png

第一项是两个分布均值之差的平方和,反映生成图像和真实图像在整体“平均外观”上的差异;第二项是协方差矩阵的迹运算,反映两者在内部多样性上的差异。

FID 的核心假设是:Inception v3 的中间特征空间是一个有意义的语义空间,且其中的图像特征近似服从多元高斯分布。这个假设在大量实践中被验证是可行的,因为 Inception 网络在大规模图像分类任务上训练,其中间层确实能抽取出物体的高级视觉特征,且大批量图像的特征分布大致呈现钟形曲线。

FID 有四个显著局限:

第一,对特征提取模型极度敏感。用不同的预训练网络(如换成 CLIP 图像编码器)得到的 FID 值没有可比性,甚至排序都可能改变。这导致不同论文报告的 FID 往往不能直接对比,除非使用完全相同的实现。

第二,对样本数量敏感。FID 需要足够的样本量才能准确估计均值和协方差矩阵,通常建议至少数千到数万张。在少样本情况下,计算出的 FID 会有较大的统计偏差,不可靠。

第三,它是一个宏观分布指标,无法诊断个体样本的质量。FID 低只说明生成图像的分布整体上接近真实分布,但可能掩盖局部问题。例如,一个只生成一种完美人脸但完全忽略多样性的人脸生成模型,它的 FID 可能并不高,因为这一种人脸在特征空间中形成了一个紧凑簇,与真实分布的重叠度尚可——但显然这个模型是失败的。

第四,FID 并不直接评估图文一致性。在文生图任务中,即使生成图像非常逼真(FID 低),但如果图像内容与输入的文本提示完全不符,FID 也无法反映这一点,因为它不看文本。

尽管有这些局限,FID 仍然是目前最受认可的生成质量指标,因为它与人类对图像质量和多样性的主观判断有较好的相关性。


IS 和 FID 的核心区别在哪里?为什么现在更常用 FID?

IS(Inception Score)和 FID 的核心区别在于:IS 只评估生成图像自身,而 FID 评估生成图像与真实图像的分布差距。这个根本差异决定了它们在不同阶段的命运。

IS 的计算基于两个标准:清晰度和多样性。它将每张生成图像送入 Inception 网络,得到 1000 类 ImageNet 类别的概率分布。如果一张图像能被打上高置信度的单一类别标签(比如 95% 是“金毛犬”),说明图像内容清晰可辨,清晰度高。同时,如果一批生成图像整体的类别边缘分布是均匀的(各种类别都有出现),说明生成器覆盖了多样化的内容。IS 将这两个要求融合进一个 KL 散度的公式里:对每张图,计算其类别分布与整体边缘分布的 KL 散度,然后取指数平均。IS 越高,代表图像越清晰且越多样。

IS 的最大问题是它完全闭门造车。它不看真实图像,只看生成图像在 Inception 网络下的分类表现。这意味着:第一,如果生成模型学会了生成对抗性噪声,它可能骗过 Inception 网络得到高置信度分类,从而获得极高的 IS,但实际上图像对人眼来说毫无意义。第二,IS 严重依赖于 Inception 网络的训练数据(ImageNet 的 1000 类)。对于生成 ImageNet 之外的全新类别图像,IS 无法给出有意义的评估。第三,它对模式坍塌的检测能力很弱。如果生成器只生成 10 种不同但都非常清晰的金毛犬图像,IS 会给出很低的多样性分,但如果它学会了生成 1000 类物体的清晰但极不真实、像卡通画一样的图像,IS 可能依然很高,因为分类器仍然能识别出类别。

FID 通过引入与真实图像的比较解决了这些问题。它不再依赖分类器的主观判断,而是直接计算生成图像和真实图像在特征空间中的分布距离。如果生成图像不真实,哪怕分类器能认出它,它的特征分布也会偏离真实图像,导致 FID 升高。模式坍塌(只生成少数几种)也会使生成分布覆盖面变窄,增大与真实分布的距离,FID 对此更敏感。因此,FID 成为更主流的指标,它更贴合“生成逼真且多样的图像”这一根本目标。IS 虽然还没有完全退出舞台,但通常只作为辅助参考,FID 是事实标准。


在多模态检索评估中,除了 Recall@K,还有哪些指标可以衡量排序质量?

Recall@K 是检索评估中最直观的指标,但它只关心“正确答案是否在前 K 个里面”,完全不关心正确答案的具体排名以及负样本的排序情况。这在实际应用中是一个严重缺失——用户非常在意第一个结果是否就是想要的,而不只是“前 10 个里有就行”。因此需要更细腻的排序质量指标来弥补。

MRR,即平均倒数排名,是 Recall@K 的天然补充。它衡量的是第一个相关结果的排名的倒数。对于每个查询,如果第一个相关结果排在第 1 位,MRR 贡献为 1;排在第 5 位,贡献为 0.2;排在 10 位以外贡献为 0。然后对所有查询取平均。MRR 极度看重“首个命中的位置”,在语音助手、搜索框自动补全等场景中尤为重要,因为用户往往只看最上面的答案。

Precision@K 衡量的是前 K 个结果中相关结果的比例。当检索系统需要控制返回结果的噪声水平时(如法律文书检索),高 Precision 比高 Recall 更重要。Recall 高而 Precision 低意味着虽然正确答案在结果列表里,但混在大量无关信息中,用户体验仍然很差。

MAP(平均精度) 是对 Precision 在多个召回点上的综合考量。它对每个查询计算在不同 K 值下的精度,并将这些精度值按相关文档的排名进行平均。与 MRR 只看第一个不同,MAP 奖励将多个相关文档都排在靠前位置的系统。如果一张图对应多个正确描述,MAP 能更全面地评估它们的排序质量。

nDCG(归一化折损累积增益) 引入了相关度的分级概念。不是简单地将文档分为“相关”和“不相关”,而是可以赋予不同的相关性等级(如非常相关 3 分、部分相关 1 分)。它计算每个文档的增益除以它排名位置的对数折损,再对理想排序下的最大可能增益进行归一化。nDCG 对排序质量的要求比 MAP 更细致,适用于有精细人工标注相关度等级的场景。

中位排名 是一个直观的统计量:在所有查询中,第一个相关文档的排名中位数是多少。它不受少数极差查询的极端值影响,比平均排名更稳健。

在实际的多模态检索评估中,通常不会只用其中一个,而是组合使用 Recall@1/5/10 和 MRR,必要时再加上 nDCG。RSUM(所有 Recall@K 值之和)也常作为综合指标出现。这样的组合能提供一个从“有没有找到”、“找到得多靠前”、“整体排序好不好”的立体视图。


如何设计多模态对话的人工评估?需要包含哪些维度的评分表?

多模态对话的人工评估需要精心设计才能捕捉到模型的综合表现,因为对话是开放性的,没有标准答案。评估的核心思路是:将抽象的用户满意度拆解成多个可打分、可定义的具体维度。

一个完善的多模态对话人工评估评分表通常包含以下几个维度,每个维度采用 1-5 或 1-7 的 Likert 量表,并附带清晰的行为锚定描述,以降低主观性。

  1. 视觉忠实度。这是多模态对话的生命线。评估答案中关于图像的陈述是否准确,是否编造了图像中不存在的细节。5 分:所有视觉陈述都与图像严格一致,不确定的地方都如实说明。1 分:主要事实性陈述与图像矛盾,严重幻觉。

  2. 指令遵循度。评估模型是否正确理解了用户的意图和格式要求。如果用户要求“用 JSON 格式输出”,模型是否做到了?如果用户问“简要回答”,模型是否罗里吧嗦?5 分:完美遵循所有显式和隐式指令。1 分:完全无视指令。

  3. 回答有用性与完整性。在忠实于图像的前提下,回答是否解决了用户的问题?信息量是否恰好?有没有遗漏关键点?5 分:完整回答了问题的各个方面,提供了恰到好处的细节。1 分:答非所问,或关键信息全部缺失。

  4. 语言流畅性与连贯性。评估语言的语法正确性、自然度和逻辑连贯性。5 分:语言流畅自然,像真人在对话。1 分:难以理解,语法破碎。

  5. 适当性与安全性。评估模型是否具有合适的对话边界。面对敏感问题是否拒绝?面对模糊问题是否澄清?语气是否得体?5 分:安全边界清晰,在不确定时能诚实表达。1 分:给出了危险建议或越过了明显的安全红线。

  6. 个性化与上下文一致性(多轮对话场景)。评估模型是否记住了之前的对话内容,回答是否与前文一致,指代是否消解正确。5 分:完美跟踪对话状态,指代准确。1 分:每轮都像在跟一个失忆的人说话。

评估流程设计:人工评估员需要接受校准培训。先由多位评估员对同一批样本打分,计算评分者间信度。只有当一致性达到可接受水平时,正式评估才开始。评估可以采用“单盲”设计:评估员不知道哪个回答来自哪个模型,排除品牌偏见。最终的评估报告不仅要给出各维度的平均分,还要对低分案例进行定性分析,找出模型的系统性缺陷模式。这种多维度、锚定清晰的评估虽然成本高,但能为模型改进提供精确的指导。


如何使用 GPT-4V 作为“裁判”来评估另一个模型生成的回答?可靠性和偏误会怎样?

用 GPT-4V 作为裁判(LLM-as-a-Judge)是目前最流行的高效评估方案。基本做法是将待评估的多模态对话记录(图像、问题、模型回答)提交给 GPT-4V,并附上一个精心设计的评分提示。提示中通常要求 GPT-4V 扮演“严格但公平的评估员”,对回答在多个维度上(视觉忠实度、有用性、流畅性等)给出 1-5 分的评分,并解释评分理由。为提高稳定性,往往会要求 GPT-4V 先写出详细的评判分析,再给出分数(类似思维链)。对同一答案,还可以多次调用并取平均分数,以减少单次随机性的影响。

可靠性方面,已有大量研究证明 GPT-4V 在评估多模态回答时,其评分与人工评估员评分有中等到良好的相关性,尤其是在评估视觉忠实度和事实错误时。它比传统自动化指标(如 CIDEr)更贴近人类判断,且成本远低于纯人工评估。但它并非完美可靠,其评分与人类专家在某些细微维度(如创意性、文化敏感性)上仍有差距。

偏误是使用 GPT-4V 作为裁判的最大风险,需要系统性识别和控制:

  • 位置偏误:当同时比较多个回答时,GPT-4V 倾向于偏好第一个或最后一个位置的回答。

  • 长度偏误:更长的回答容易得到更高的分数,即使长内容中包含冗余或无关信息。

  • 自身模型偏误:GPT-4V 可能对自己或同系列模型生成的回答存在隐性的评分偏好,对来自其他架构模型的回答更苛刻。

  • 风格偏误:GPT-4V 偏好自己训练数据中常见的、正式礼貌的回复风格,可能会低估简洁、口语化但同样正确的回答。

  • 视觉理解局限:GPT-4V 自身也有视觉幻觉和识别错误,这会导致它对其他模型输出的忠实度判断失准——它可能把一个正确的视觉陈述误判为幻觉,或漏判真正的幻觉。

缓解偏误的方法包括:在评估提示中明确警告裁判模型避免这些偏误;随机化选项顺序以抵消位置偏误;将长度限制纳入评分标准;使用多个不同的裁判模型交叉验证;定期用人工标注样本校准裁判评分。将 GPT-4V 作为裁判是一种极其高效的质量监控手段,但不能完全替代人工抽检——最好的实践是将它作为大规模初筛和趋势监测的工具,辅以人工深度审核。


评估“指代表达理解”能力时,常用什么指标?

指代表达理解(REC)的任务是:给定图像和一段自然语言描述(如“左边穿红色衣服的女孩”),模型需要输出一个边界框,精确框出被指代的目标。评估这个能力的核心是衡量预测框与真实框之间的重叠程度和定位精度。

Precision@K 是最直观的指标。对于每个测试样本,模型会给出一个预测框。如果预测框与真实框的 IoU(交并比)大于 0.5,则认为这次定位是正确的。所有样本的正确率即为 Precision@1。这是 REC 任务最常用的主要指标,简洁明了。

IoU 阈值曲线 提供了更全面的视图。它不是固定在 0.5 一个阈值,而是计算 IoU 阈值从 0.5 到 0.95(步长 0.05)变化时的准确率,然后取平均值。这能看出模型是“大概对”(高阈值下准确率骤降)还是“定位很准”(高阈值下依然保持高准确率)。这种评估方式在目标检测中也广泛使用。

中心点距离 作为补充指标,计算预测框中心点与真实框中心点之间的归一化欧氏距离。当 IoU 因框的大小差异而敏感时(比如模型框对了位置但框太大了),中心点距离能提供更鲁棒的定位偏差评估。距离越小越好。

文本对齐精度 是更高级的评估维度。由于 REC 数据中,一个描述可能对应多个真实框(如“左边的两个人”),或者描述存在歧义,仅靠 IoU 不够。一些评估方案会计算预测框区域的特征与文本描述之间的语义相似度,或者检查预测框内是否确实包含了描述中提到的属性和物体类别。这确保模型不是“蒙对框”,而是真正理解了语言描述。

在实践中,REC 评估通常以 Precision@1 (IoU>0.5) 为主,辅以多阈值 IoU 曲线和失败案例的定性分析。


如何评估多模态模型的鲁棒性?

多模态模型的鲁棒性指它在输入数据分布发生变化或遭受干扰时,仍能保持稳定正确输出的能力。评估鲁棒性不是用单一指标,而是通过一系列“压力测试”来测量性能的衰减程度。

  1. 视觉损坏鲁棒性:使用标准测试集(如 ImageNet-C)对输入图像施加各种退化——高斯噪声、运动模糊、JPEG 压缩、雨雪雾天气模拟、亮度对比度变化等。计算模型在这些退化图像上的性能下降百分比。鲁棒的模型应该对常见噪声和天气影响不敏感,性能下降平缓。

  2. 分布外鲁棒性:测试模型在与训练数据分布不同的图像上的表现。例如,用 ImageNet-R(包含涂鸦、雕塑、卡通等非自然图像的“演绎版本”)和 ImageNet-Sketch(黑白线条画)来考察模型是否过度依赖纹理捷径。如果模型在标准图像上准确率高但在素描图上骤降,说明它学到的是纹理而非形状。

  3. 对抗鲁棒性:使用对抗攻击算法对输入图像添加人眼不可见的扰动,这些扰动专门设计来最大化模型的预测错误。鲁棒性通过攻击成功率和攻击后的性能下降来评估。

  4. 文本变化鲁棒性:对输入的文本问题进行改写——同义词替换、改变语序、引入拼写错误、翻译成其他语言再翻回来。鲁棒的模型应能捕捉到相同的意图并给出一致的回答,而不是对措辞敏感。

  5. 跨模态干扰鲁棒性:这是多模态特有的。改变图像和文本之间的对应关系,测试模型是否会盲目融合矛盾信息。比如,给一张猫的图片问“这只狗是什么品种?”,鲁棒的模型应能指出图文矛盾或纠正错误前提,而不是顺着文本编造。

  6. 模态缺失鲁棒性:在推理时故意不给图像或只给模糊图像,测试模型是否诚实表达不确定性,而不是强行编造回答。

评估鲁棒性时,通常报告“性能保持率”(损坏后性能/原性能)作为核心指标。更重要的是分析失败模式,定位模型脆弱性的根源。


在评估文生图模型时,如何兼顾美学质量与图文一致性?

文生图模型的评估有两个经常互斥的目标:生成的图像要“好看”(美学质量),还要“与提示词一致”(图文一致性)。单看任一方面都会导致片面的结论。一个能兼顾两者的评估框架通常包含以下层次。

  1. 自动指标的互补组合:

  2. 图文一致性方面,使用 CLIPScore 或其变体。计算生成图像与输入文本提示之间的 CLIP 余弦相似度。这衡量了图像在语义上多大程度响应了文本。

  3. 美学质量方面,使用专门的审美评估模型(如 LAION-Aesthetics Predictor),或 FID(用生成的大批图像计算,主要反映整体逼真程度和多样性)。

  4. 将两者分开报告,并可以计算一个组合分,如 HPS (Human Preference Score)。

  5. 多维度的人工评估:

机器指标目前还不能完全替代人类判断。人工评估时,评估员应分别就“图文一致性”和“美学质量”打分,使用清晰锚定的量表。

  • 图文一致性:提示中的每个关键元素都出现了吗?元素之间关系正确吗?有没有多出或缺少的物体?

  • 美学质量:图像清晰度、光照自然度、构图、色彩和谐度、有无伪影。 同时可以询问评估员的整体偏好,将整体分与两个子维度分的相关性进行分析,找出当前模型的主要短板。

  • 使用 GPT-4V 作为多维度裁判:

GPT-4V 可以同时对生成的图像在多个维度上评分,包括但不限于:对象存在性、属性绑定、空间关系、文字渲染、整体质量。通过设计详细的评分表,GPT-4V 可以给出结构化的反馈。但其作为裁判也有偏误,需要与人类评估进行一致性校验。

  1. 诊断性测试集:

构建专门考察特定矛盾或美学缺陷的测试集。例如,用包含复杂空间关系和精确计数的提示词专门测一致性;用需要精细纹理和自然光影的提示测美学。在诊断集上的分项得分能精确定位模型的优劣势。

兼顾两者的终极目标是找到美学质量和图文一致性的帕累托前沿——在不牺牲忠实度的前提下追求最高美学质量。目前的顶尖模型(如SD3、DALL-E 3)正是在这个前沿上不断推进。