幻觉与偏见评估

POPE 基准如何通过构造二元问答来评估对象幻觉?它的“对抗样本”是怎样生成的?¶
POPE(Polling-based Object Probing Evaluation)是一种专门评估多模态模型“对象存在性幻觉”的基准。它的核心思想很简单:既然多模态模型经常无中生有地编造图中不存在的物体,那就直接问它“图中有XX吗?”,让它回答“是”或“否”。如果模型对不存在的东西频繁答“是”,说明它出现了幻觉。POPE将这种提问标准化、规模化,并且巧妙地构造了三种不同难度的问题集。
评估流程:首先,用目标检测或人工标注的方式为每张图像确定一个真实物体集合(如{人, 猫, 沙发})和一个明确不在图中的负样本物体集合。然后,向模型依次提问“图中有XX吗?”,要求它用“Yes”或“No”回答。最后,计算整体的二元分类指标——准确率、精确率、召回率、F1分数。对于正样本(图中真实存在的物体),模型应该回答“Yes”;对于负样本(图中不存在的物体),模型应该回答“No”。如果模型在负样本上频繁回答“Yes”,就暴露了其对象幻觉。
对抗样本的生成是POPE的精髓,通过三种不同策略构造越来越有挑战性的负样本:
-
随机负样本:从整个数据集的物体词表中随机抽取不在当前图像中的物体。这模拟了最简单的情形,大多数模型都能做好。
-
常见负样本:从数据集中出现频率最高的物体中随机抽取。因为模型在训练中见得太多,容易产生“常见物体大概率存在”的先验偏见。比如,即使图中没有“人”或“椅子”,模型也倾向于说“有”,因为训练数据中它们无处不在。
-
对抗负样本:这是最巧妙的一种。它利用模型的视觉-语言对齐特性,通过检索找出那些与图像整体语义相似但恰好不在图中的物体。例如,一张“汽车”的图片,其对抗负样本可能是“停车场”、“轮胎”、“红绿灯”——这些词在CLIP嵌入空间中与图像向量高度相似,但实际上在该特定图像中并不存在。模型极容易被这种语义相近的“邻居”概念迷惑,产生幻觉。
通过这三种难度递进的问题集,POPE可以精确刻画模型的幻觉严重程度,并分析其在哪种情况下最容易被诱导。它逼着模型必须在视觉证据面前保持诚实,是评估对象幻觉的事实标准。
多模态任务评估中,如何设计可控实验来量化“文本先验”?¶
文本先验是指模型不依赖视觉输入,纯粹根据文本问题中的语言统计规律来作答的倾向。量化它需要将视觉信号与语言信号解耦,构造出一组“看图像”和“不看图像”的对比实验。
核心思路:构建两个测试条件——正常条件(给图像+文本)和盲测条件(只给文本,图像换成全黑图、随机噪声或完全不相关图),比较两者准确率。两者之间的差值反映了视觉信息的真实贡献,而盲测条件下的准确率则直接度量了文本先验的强度。
具体设计:
-
先验强度测量:在盲测条件下运行模型,记录准确率。如果盲测准确率远高于随机猜测基线,说明模型有很强的文本先验。例如,在VQA v1上,盲测准确率能达到30%以上,而随机基线仅为几个百分点。
-
先验敏感度:计算正常准确率与盲测准确率的比值或差值。一个健康的模型,正常准确率应显著高于盲测准确率。如果两者接近,说明模型基本不看图。
-
反事实数据集:使用专门设计的数据集,如VQA v2的对比集或VQA-CP(Changing Priors)。VQA-CP的特殊之处在于,训练集和测试集的文本-答案分布被人为地设置为不同。一个依赖文本先验的模型会在测试集上惨败,因为它背诵的“问题词→答案”映射在测试集上不再有效。
-
输入消融:系统性地移除图像的不同部分(遮挡物体、改变颜色、打乱空间布局),观察对答案的影响。如果模型对一个“黑猫”问题,在猫被遮挡后仍答“黑猫”,说明它依赖语言记忆而非视觉。
-
结构化探针:构造语法正确但语义荒谬的问题,如“图中的大象是什么颜色?”,而图中根本没有任何动物。如果模型能坚持说“没有大象”而不是顺从问题给出颜色,说明视觉约束压过了文本引导。
通过这一整套梯度式的消融和反事实实验,可以精确量化模型在多大程度上被文本先验所绑架,这是诊断捷径学习的核心方法论。
对于生成式多模态问答,如何设计基于覆盖率的指标?¶
生成式问答的答案通常是自由形态的自然语言,没有固定的几个选项。基于覆盖率的指标衡量的是模型回答中包含的“必要信息点”的完整程度,而不是简单的词重叠。
设计步骤:
-
关键信息点提取:对于每个测试问题,从参考标准答案(或多个参考答案)和相关的图像区域中,提取出回答该问题“必须包含”的信息单元。例如,问“图中有什么水果?”,图像中有苹果和香蕉。关键信息点可以是{苹果,香蕉},甚至可以细化到{苹果,颜色红色;香蕉,颜色黄色}。
-
答案信息点提取:用同样的方法,从模型生成的回答中提取出所有信息点。
-
覆盖率计算:计算模型提取出的信息点集合与关键信息点集合的交集大小,除以关键信息点集合的大小,得到覆盖率:覆盖率 = (匹配的信息点数 / 总关键信息点数)。
-
加权覆盖率:如果各信息点重要程度不同(例如,回答中“苹果”的存在比“红色”的属性更重要),可对每个信息点设置权重,计算加权覆盖率。
实现难点与自动化:
-
关键信息点的获取成本高。可以用大模型(如GPT-4)从图像的参考描述和问题中自动提取关键信息点,并让模型判断每个信息点是否在候选答案中被覆盖。
-
对于细粒度视觉问题,关键信息点可以结合场景图:从图像的场景图中选择与问题相关的三元组(物体-关系-物体),作为必须覆盖的信息单元。
这种基于覆盖率的指标比BLEU等更贴近“是否把该说的都说到了”,特别适合评估全面性和详细程度,是传统n-gram指标的语义增强版。
POPE 之后,还有哪些改进版幻觉评估基准?如 CIEM、HallusionBench。¶
POPE 主要关注对象存在性幻觉,后续基准向更细粒度、更多模态和更复杂推理方向扩展。
CIEM(Contrastive Image Evaluation Method):
CIEM 的设计思路是“正反对比”。它不是直接问“有没有”,而是给模型展示两张图像——一张是原始的真实图像,另一张是基于原图做了局部修改的“反事实”图像。修改的内容就是加入或移除某个物体。然后问一个关于该物体的对比性问题,如“哪张图中有猫?”。如果模型不能准确识别,或者对两张图的回答自相矛盾,就说明它存在幻觉或视觉混淆。这种方法比 POPE 更进一层,因为它迫使模型在极其相似的两张图之间做精细的视觉区分,更能检测出模型的视觉敏感度而非语言先验。
HallusionBench:
HallusionBench 是一个更全面的视觉幻觉诊断基准,不仅覆盖对象存在性,还覆盖属性、关系、文字阅读和知识推理幻觉。其独特之处在于:
-
图像-文本联合逻辑陷阱:精心设计图文不一致的样本。例如,图像是一只斑马,但文本问“这匹马的条纹是什么颜色?”模型需要先识别到图中是斑马而非马,然后理解问题中“马”的指代是错误的,并做出纠正或指出矛盾。这测试模型是否盲目跟随文本中的错误前提。
-
多轮递增测试:对同一张图像,先问简单问题,再逐步加问涉及推理和细节的问题,观察幻觉是否在多轮中累积。
-
控制组:为每个视觉问题设计一个纯文本对照问题,以区分幻觉是来自视觉理解失败还是语言推理失败。
其他改进方向:一些基准开始引入视频中的时间幻觉(事件顺序错误)、多图对话中的跨图混淆、以及多模态长文本生成中的事实一致性等更复杂的幻觉类型,推动评估向更真实复杂的场景演进。
如何评估多模态模型在“关系幻觉”(如错误表述物体间空间关系)上的严重程度?¶
关系幻觉指模型正确识别了物体,但错误描述了它们之间的空间、逻辑或交互关系。评估这类幻觉比对象幻觉更难,因为需要结构化的关系标注。
评估方法:
-
基于场景图的关系探针:使用已有场景图标注的数据集(如Visual Genome),提取出所有的关系三元组(物体1-关系-物体2)。为每个三元组生成两个问题:一个是正向问题(“猫在沙发上吗?”答案应为是),一个是反向问题(“狗在沙发上吗?”答案应为否)。反向问题中的物体必须是图中存在的,但与参照物的关系不成立,以避免混入对象幻觉。计算模型在这些正向和反向问题上的准确率,反向问题的错误就是关系幻觉。
-
空间关系专项测试集:专门设计包含多种空间介词(上下左右里外前后)的图像,物体的位置关系经过精确控制。问“X在Y的左边吗?”,通过改变物体位置,构造出是/否各半的平衡测试集。可以细化到不同难度:物体相邻易混淆、物体大小差异误导等。
-
视觉定位与描述的交叉验证:让模型先生成图像的详细描述,然后从中抽取关系陈述,再让模型自己对每个关系陈述做定位验证(如让模型输出该关系对应的边界框)。如果模型无法为某个关系找到对应区域,说明该关系可能为其编造的。
-
对比性评估:构造仅改变物体位置关系、其他元素保持不变的图像对。模型如果对两张图给出了同样的关系描述,说明它可能没有真正理解空间关系,而是在用高频共现组合瞎猜。
通过这些方法,可以将关系幻觉从笼统的“胡说”中单独剥离出来,进行量化诊断。
怎样构建一个控制变量实验,来单独评估视觉编码器引入的偏见?¶
视觉编码器偏见指模型在提取图像特征时,对特定群体或场景产生了不公正或不准确的表征。这需要通过巧妙的实验设计将视觉编码器从整个多模态管道中隔离出来。
核心方法:控制图像,变化文本,固定编码器。
-
反事实图像对:这是最直接的方法。使用图像编辑技术,生成一对图像,它们在视觉内容上除了某个敏感属性(如性别、肤色)外完全相同。例如,同一张办公桌后的照片,一张是男性,一张是女性,其他背景、服装、姿势都保持一致。将这两张图像分别通过视觉编码器,提取特征。
-
特征相似度测试:对于上述图像对,计算它们在编码器特征空间中的余弦相似度。如果编码器是公平的,这两个特征应该非常接近,因为它们只有敏感属性不同,而高层语义相同。如果距离较大,说明编码器对敏感属性过度敏感,引入了不应有的表示差异。
-
线性探测:在编码器输出的特征上训练简单的线性分类器,来预测敏感属性(如性别)。如果分类器能高精度预测,说明编码器特征中包含了大量与敏感属性相关的信息,存在潜在偏见。一个理想的去偏编码器应该使探测准确率接近随机基线。
-
词嵌入关联测试:将不同群体的图像通过编码器得到特征向量,再与包含正面/负面情感的职业词(如“CEO”、“护士”)的文本嵌入计算相似度。检查是否存在群体与职业的不当关联,如女性图像特征更靠近“护士”文本嵌入,男性更靠近“CEO”。这种偏差直接来源于编码器的预训练数据。
-
下游任务影响隔离:将编码器冻结,只替换下游的LLM或分类头,在不同群体反事实图像上测试下游任务(如描述生成)的性能差异。由于下游部分相同,性能差异可直接归因于视觉编码器。
通过这些控制变量实验,能够精确定位偏见是在“眼睛”(视觉编码器)还是在“大脑”(LLM)层面产生的。
多模态公平性评估中,如何确保测试数据的标注员也具备多样性背景?¶
标注员的偏见会直接注入到数据中,成为评估的隐性偏差。如果所有标注员都来自同一文化和社会背景,他们可能对某些偏见习以为常,根本无法识别出来。
确保多样性的具体措施:
-
按人口统计特征招募:在招募标注员时,明确要求覆盖不同的性别、年龄组、种族、地域、语言背景、教育程度等。标注平台的筛选功能应支持这种定向招募。
-
地理分布:确保标注员分布在不同的国家和地区,尤其不能只来自以英语为母语的西方发达国家。许多文化偏见只有特定文化内部的人才能识别。
-
社群参与:对于涉及少数群体、残障人士等特定主题的数据,应直接邀请该群体成员或其代表组织参与标注过程。他们对涉及自身的刻板印象和无礼表述最敏感。
-
多视角标注与分歧仲裁:同一个样本分配给多个背景不同的标注员。不要求他们达成强制一致,而是保留分歧记录。对于公平性敏感样本,分歧本身就是重要信号——揭示了不同背景人群对内容的不同感受。最终标签可以记录多数意见,但附带歧义说明。
-
偏见识别培训与校准:在标注前,对所有标注员进行公平性意识的培训,用案例展示刻板印象的不同表现形式,帮助他们建立共同的识别框架。定期进行标注员间的一致性校验。
-
元数据记录:为每个标注打上标注员的部分匿名化人口标签,以便事后分析是否存在系统性的标注偏差(如某性别标注员倾向于对某类内容更宽容)。
没有标注员的多样性,数据集的公平性声明就是空中楼阁。这不仅是技术问题,更是伦理和组织流程问题。
评估多模态模型对“残疾人”、“少数群体”的描述是否存在刻板印象,应该使用什么方法?¶
这种评估需要极高的敏感度,因为刻板印象往往微妙且深嵌于文化叙事中,不是简单的正面或负面词汇能捕捉的。
评估方法:
-
刻画深度与维度分析:收集模型对包含残疾人和少数群体的图像的描述文本。分析这些描述集中在哪些维度上。例如,对轮椅使用者的描述是否总聚焦于“身残志坚”、“可怜”、“需要帮助”等有限叙事,而忽视了他们的职业、情绪、正在做的普通事情?对少数族裔的描述是否总强调“异域风情”、“传统服饰”,而很少描述其在现代科技场景中的形象?
-
对比实验:选取中性场景的图像,通过编辑技术只改变人物的群体身份(如把一名白人男性换成一名戴头巾的女性)。其余背景、动作、衣着完全不变。看模型生成的描述发生了哪些变化。是否对某一群体开始使用更多的情感化词汇、负面预设或与场景无关的身份标签?
-
主题关联探测:用大规模的图像描述数据集,统计不同群体与特定形容词、职业、场景的共现频率。计算类似于WEAT(词嵌入关联测试)的统计量,检查是否存在不平衡的关联,如残疾人图像更多与“医疗场景”、“慈善”共现,而非“职场”、“运动”。
-
避免“他者化”评估:检查模型是否默认“正常”为多数群体的形象,而将少数群体显式标注为“特殊的”。例如,在描述一张白人男性照片时只用“一个男人”,而对一张黑人男性照片则描述为“一个黑人男性”,这种区别化标签本身就是刻板印象。
-
社区审核:直接邀请相关群体成员对模型的输出进行盲评,打分维度包括“是否感到被冒犯”、“是否体现了刻板印象”、“是否真实还原”。他们的主观感受是最终极的检验标准。
这种评估不是一次性的定量打分,而是持续性的质性分析,需要跨学科团队和社群的深度参与。
如何利用对抗生成网络构造测试图片,来探测模型的敏感属性偏好?¶
对抗生成网络(GAN)可以生成高度逼真且参数可控的图像,是构建控制变量测试集的理想工具。
构造方法:
-
属性解耦的GAN:使用如StyleGAN这类可以将语义属性解耦的生成模型。StyleGAN的潜在空间有明确的方向向量对应“年龄”、“性别”、“肤色”、“表情”等属性。通过沿特定方向移动潜在编码,可以生成一个图像序列,其中只有目标属性在平滑变化,其余所有视觉元素(身份、背景、姿势、光照)保持绝对一致。
-
构造测试集:选择一系列基准潜在编码,生成中性的基础图像。然后对这些编码应用不同的性别、种族和年龄方向的偏移,生成多个人口统计版本的同一“人”的图像。最后将这些图像嵌入到标准测试场景中(通过图像合成技术)。
-
探测偏好:将这些控制变量的图像输入多模态模型,进行任务测试。例如,针对每一组只有性别不同的图像,问相同的问题“这个人的职业可能是什么?”。统计模型的回答中职业标签的分布是否随性别发生系统性变化。如果“男性”版本被频繁回答为“CEO”、“医生”,而“女性”版本被回答为“教师”、“助理”,则探测到了性别-职业偏见。
-
剂量-反应测试:利用GAN的连续属性变化能力,可以探测偏见的“陡峭度”。例如,让肤色从浅到深连续变化,观察模型输出的情感评分或犯罪关联词频率是否连续变化,是否存在某个阈值后显著恶化。
-
生成反事实干扰样本:对真实图像进行GAN反事实编辑(如将照片中的男性换成女性),然后将原始图和编辑图配对测试,评估模型对同一场景不同群体的回答一致性。
GAN的优势在于它能生成现实中不存在但视觉上完全真实的反事实图像,填补了真实数据中难以找到完美控制对的空白。但要注意,GAN自身也可能携带训练数据中的偏见,生成的图像可能强化某些刻板印象,使用时需谨慎验证。
在多模态问答中,评估“拒绝回答”的正确率与召回率,为什么重要?如何定义?¶
拒绝回答的能力是模型“知道自己不知道”的体现,对于安全性和可信度至关重要。一个不会拒绝的模型会编造答案(幻觉),一个过度拒绝的模型会频繁说“我无法回答”而变得无用。评估拒绝回答的正确率和召回率,就是在精确衡量这种平衡。
定义:
我们将模型对问题的响应分为三类:应回答的问题(可回答),和不应回答的问题(不可回答)。不可回答的原因包括:图像中没有相关信息、问题超出模型知识范围、问题本身不安全等。
-
拒绝正确率(Precision of Refusal):在所有模型输出“无法回答”或类似拒绝表述的样本中,实际属于“不可回答”类别的比例。低正确率意味着模型在不该拒绝时也拒绝,影响了可用性。
-
拒绝召回率(Recall of Refusal):在所有实际“不可回答”的样本中,模型成功输出拒绝回答的比例。低召回率意味着模型对大量不可回答问题仍强行作答,产生幻觉。
-
F1分数:两者的调和平均,综合评估拒绝行为的整体质量。
为什么重要:
高召回但低正确的模型是“过度谨慎的懦夫”,用户体验极差。低召回但高正确的模型是“自大的骗子”,在不该回答时瞎编,带来安全和信任风险。只有两者都高的模型才能在保持诚实的同时最大化有用性。在医疗、法律等高风险领域,拒绝召回率应无限接近100%,哪怕牺牲一定的正确率。
测试集构建:需要精心构造一个同时包含“可回答”和“不可回答”问题的平衡测试集。不可回答的问题不应是弱智问题,而应该是看起来合理但确实缺乏依据的问题,这样才能测出模型在真实场景下的判断力。
对多模态模型进行“压力测试”:连续提问、逻辑陷阱、图片顺序变换等,属于哪类评估?¶
这些都属于鲁棒性与对抗性评估范畴,具体可细化为动态交互鲁棒性测试。它们不像静态基准那样让模型一次性回答单个问题,而是在一个持续的交互过程中,对模型的稳定性、一致性和抗干扰能力施加动态压力。
-
连续提问:在同一对话上下文中连续追问,考察模型是否出现状态退化——是否在多轮之后忘记最初图像内容、前后回答是否矛盾、是否会因为之前的诱导而改变对同一事实的判断。这测试的是模型的多轮一致性和状态保持能力。
-
逻辑陷阱:设计问题中包含错误前提(“图里的猫是什么颜色?”而图中是狗)、多义表述、自我指涉矛盾等,考察模型是否盲从问题中的错误假设,还是能识别并纠正。这测试的是模型的抗误导能力和前提批判性。
-
图片顺序变换:在多图对话中,调换图片的输入顺序,问相同的问题,看答案是否因顺序改变而不同。一个鲁棒的模型应给出与顺序无关的一致回答。这测试的是模型对序列位置的偏置。
-
重复与干扰:在对话中插入大量无关的图片或文本,之后再回到原始问题,看模型是否还能准确回忆起最初的视觉信息。这测试的是模型在噪声和干扰下的记忆与检索能力。
这些压力测试的目的不是求一个具体的分数,而是找到模型的“崩溃边界”——在何种压力程度和压力类型下,模型的输出开始变得不可靠。这类评估对将模型部署到不可控的开放域环境至关重要。
评估多模态模型“溯源能力”:能否正确指出答案来源于哪张图或哪段文本?用什么指标?¶
溯源能力评估模型是否能为自己的回答提供准确的证据支撑。给定多张图像或包含文本的图像,模型不仅要答对,还要指出是“从哪张图的哪个区域”或“从哪些文字”得出该结论的。
评估指标:
-
引用精确率:模型答案中给出的所有引用标注(如图片编号、区域坐标、原文引用),有多少是真正支撑该条陈述的。可以人工判断,也可以用NLI模型校验引用文本是否蕴含该陈述。
-
引用召回率:答案中每个事实性陈述,有多少被正确引用。如果模型说了三个事实,只有一个附了准确引用,召回率就很低。
-
引用F1:上述两者的调和平均。
-
定位IoU:对于指向图像区域的引用(边界框),计算预测区域与真实支撑区域的交并比(IoU),设定阈值(如0.5)判定是否正确定位。
-
证据充分性:给定引用的证据集合,是否足以推导出最终答案。这是一个整体性判断,需要模型确保引用的完整性。
评测方法:需要构造专门的溯源测试数据。数据中明确标注每个问题的正确答案以及回答该问题所必需依赖的视觉或文本证据片段(图片ID、区域框、文本段落)。模型在输出答案的同时,必须以结构化格式输出证据引用。对于不能结构化输出的模型,可以从其生成的文本解释中提取引用信息,但噪声较大。
溯源能力是建立可信多模态系统的关键,它把模型从“黑箱答题机”变成了“可以审计的推理者”。
构建一个动态评估集,让问题随时间变化而更新,以检测模型是否过时,如何设计?¶
动态评估集的目标是持续监控模型对“当下世界”的认知,及时发现知识过时和新出现的偏见。这需要一个自动化的数据采集和刷新机制。
设计框架:
-
时间敏感数据源:接入持续更新的结构化数据流——新闻API(带图片)、维基百科近期编辑、社交媒体趋势(含多模态内容)、股票行情图、天气预报图、体育赛事数据等。这些源不断产生新的图文对。
-
自动问题生成:对于每条新数据,使用一个强大的MLLM或模板引擎自动生成问答对。例如,对于一张最新的颁奖典礼照片,可以生成“这张图片中的年度专辑获奖者是谁?”。问题必须具有时效性,答案在当前时间点是确定的,但随时间推移可能会变。
-
时效性标签:每个问题都打上时间戳和“知识有效期”。例如,问“现任美国总统是谁?”有效期到下次就职日;问“昨天的比赛结果”有效期只有24小时。
-
版本化存储:每次数据更新时,不覆盖旧数据,而是追加新版本。同一个问题(如“当前的流行趋势是什么?”)在不同时间点有不同版本,每个版本对应当时的标准答案。
-
定期自动化评估:设定评估频率(如每周),用最新版本的测试集评估模型。计算指标时,必须考虑时效性权重——对时效性越强的问题,模型必须给出匹配最新版本的答案,否则视为过时。
-
过时检测指标:定义“时效准确率”——模型在所有时间敏感问题上的得分。可以细分领域(政治、科技、娱乐)查看哪个领域的知识老化最快。同时监控模型是否开始对已过时的事件仍给出旧答案。
挑战:自动生成的问题质量、标准答案的自动验证(需要多源交叉验证)、以及持续维护的成本。但这是评估模型“知识新鲜度”不可或缺的手段。