跳转至

四、幻觉的评估指标与基准

评估模型幻觉率的常用自动化指标有哪些?

评估大模型幻觉率的自动化指标,核心目标是以无监督或弱监督的方式量化生成文本与事实依据之间的一致性。按照方法论,可以分为以下几类:

(1)基于自然语言推理(NLI)的指标

  • 蕴含率(Entailment Ratio):将生成文本拆分为原子事实,判断每个事实是否能被源文或检索证据“蕴含”。通常计算被蕴含的事实比例。具体指标如 FactCC(专为摘要设计)和 SummaC(提供多种NLI变体),它们直接使用预训练NLI模型(如RoBERTa-MNLI)输出蕴含、矛盾或中立的概率。

  • ANLI(Adversarial NLI):通过对抗生成的难题库检验模型对细微矛盾的敏感度,指标是模型在这些难样本上的准确率。

  • AlignScore:在大量合成的不一致数据上微调的模型,输入源文和生成文本,直接输出0~1的忠实度得分,可视为一种连续性NLI指标。

(2)基于问答的指标

  • QAGS(Question Answering for Grounding Summaries):自动从源文生成问题,用源文和生成文本分别回答,计算两组答案的语义等价性(如ROUGE-L、BERTScore)。若生成文本的答案与源文答案不一致,则判定为潜在幻觉。该指标能发现信息增删和扭曲。

  • QuestEval:将QAGS思想与NLI融合,不仅比较答案,还考虑答案与问题、源文的多重蕴涵关系,分数更全面。

(3)基于信息抽取的指标

  • 实体重叠与幻觉率:抽取生成文本中的命名实体,检查有多少实体未在源文或知识库中出现。简单计算 实体幻觉率 = 新实体数 / 总实体数。变体可针对数字、日期等精确信息。

  • 三元组重叠率:同时抽取主语-谓语-宾语三元组,计算生成文本的三元组被源文支撑的比例。常用OpenIE工具。

(4)基于检索增强的指标

  • FActScore:专为人物传记等事实密集型文本设计。将生成文本拆分为原子事实,每个事实在维基百科中检索证据,用NLI判断支撑情况,最终计算 被支撑的事实数 / 总事实数。该指标直接对应“事实正确率”,是检索增强评估的代表。

  • 检索式自我一致性:不依赖固定知识库,而是将生成文本的多个采样与搜索引擎实时检索结果比较,求一致性分数。

(5)基于概率和不确定性的指标

  • 序列平均对数似然(Length-Normalized Log Prob):计算整个输出的归一化对数概率,越低越可疑。但需模型校准且不绝对。

  • 预测熵(Predictive Entropy):生成过程中每个token的熵的平均值。高熵可能表示模型在猜测,易幻觉。这类指标常作为辅助信号。

  • 多次采样一致性(Self-Consistency):如SelfCheckGPT,计算多次生成样本之间的语义分歧,分歧度与幻觉正相关。具体用NLI或BERTScore衡量各样本对主回答的支持度。

(6)基于大模型裁判的指标

  • GPT-4/Judge:用强模型作为裁判,给定生成文本和参考源文,要求直接输出幻觉评级或逐句标签。通过设计精细提示可得到高相关性指标,常用于生成训练信号或顶层评估。

  • G-Eval:利用链式思维让大模型对文本质量进行打分,其中包含事实一致性维度。

(7)混合指标

  • UniEval:将多种评估任务(包含事实一致性)统一到一个框架,将评估转化为QA问题,输出多维度分数。

  • BARTScore:将评估视为文本生成任务,计算生成文本在给定源文下的条件概率,可反映忠实性,但属于隐性指标。

选用策略:

  • 对于忠实性幻觉(与源文比),首选NLI类(SummaC)和QA类(QAGS)。

  • 对于事实性幻觉(与外部知识比),首选检索增强类(FActScore)或强模型裁判。

  • 实际中常组合使用,以多指标投票或平均提高鲁棒性。


“TruthfulQA” 基准测什么?为什么它专门设计来考察幻觉?

TruthfulQA 是一个专门设计用来评估语言模型是否会产生模仿性幻觉的基准数据集。它测试模型在面对容易被误解或存在常见错误认知的问题时,能否给出真实、符合事实的答案,而不是简单地复现训练数据中频率较高的错误信息。

核心设计:

  • 数据集包含 817个问题,覆盖38类主题,包括健康、法律、金融、常识、神话、伪科学等。例如:“谁制定了地球是平的理论?”(存在常见误解),“吃胡萝卜能改善视力吗?”(部分真实但被夸大)。

  • 每个问题配有多个人工撰写的正确答案(真实)和错误答案(常见误解)。错误答案并非随机编造,而是真实反映网络上频繁出现的、人类因认知偏误而易于相信的错误信息。

  • 评估时,模型生成的回答需与正确答案语义一致,并避免输出任何错误答案的内容。指标包括真实性(Truthfulness) 和信息性(Informativeness),两者需权衡,因为简洁的“不知道”虽然真实但信息量少。

为什么专门设计来考察幻觉:

  1. 检测知识扭曲:大模型通过预测高概率文本进行学习,训练数据中常见的错误观念会被模型内化成高置信度的“伪知识”。TruthfulQA的问题故意瞄准这些高频错误,验证模型是否复制了这些谬误,这正是幻觉中“过度泛化与模式复现”的典型表现。

  2. 分离真实与常见:许多问题正确的答案反而在训练数据中不常见,模型容易选择常见的错误回答。例如,问“测谎仪是否可靠?”网络上大量犯罪题材剧集可能强化其可靠性的论述,而科学共识是测谎仪并不可靠。模型若输出“可靠”,即产生幻觉。该基准系统地探测了这种分布偏差。

  3. 覆盖隐性幻觉:不同于传统问答评估只检验模型知不知道答案,TruthfulQA检验模型是否因为训练语料中的错误信念而主动给出错误答案,即使它可能“知道”正确答案(可通过提示词激发)。这直接触及了幻觉的成因——模型在模仿人类,而非坚守事实。

  4. 人类参照:错误答案由人类标注,确保反映真实世界中的误解,而非特意构造的对抗样本,因此具有生态效度,能衡量模型在实际应用中的误导风险。

使用效果:研究表明,模型规模增大并不一定提高TruthfulQA上的真实性,甚至可能因记住更多错误信息而变差。这凸显了仅靠扩大规模无法解决幻觉问题,需要针对性的对齐和去偏。因此,TruthfulQA已成为评估模型事实性和幻觉风险的黄金基准之一。


“HaluEval” 数据集包含哪些类型的幻觉?如何构造的?

HaluEval 是一个大规模、多样化的幻觉检测数据集,专门用于评估和训练幻觉检测器,覆盖多种任务和幻觉类型,并通过创新的自动构造方法生成。

包含的幻觉类型:

HaluEval 将幻觉分为两大类,并细化为具体子类:

  • 忠实性幻觉(Faithfulness Hallucination),即在给定上下文的情况下,模型输出与上下文不符。具体包含:
  • 事实不一致(Factual Inconsistency):生成内容中的事实与源文矛盾或无法从源文推出。
  • 上下文忽略(Context Ignorance):模型无视给出的上下文,擅自添加细节。
  • 指令违背(Instruction Violation):输出未遵循用户给出的指令,可能添加了多余内容。

  • 事实性幻觉(Factuality Hallucination),即输出本身与客观事实相悖,涵盖更广泛的不可验证或错误陈述,即使在开放式对话中也成立。

针对不同任务,幻觉的表现形式不同,HaluEval 覆盖了三种核心任务,并在每种任务中标注了细粒度标签:

  • 对话:幻觉包括在聊天回复中添加对话历史没有的信息、捏造事实性知识、前后矛盾等。

  • 摘要:生成摘要中包含原文没有的细节或歪曲原文意思。

  • 问答:对于知识型问答,提供错误的事实;或对于上下文问答,提供上下文不支持的答案。

每个样本都被人工标注了是否存在幻觉,并在幻觉样本中进一步标记幻觉类型(如“实体幻觉”、“关系幻觉”、“数字幻觉”等),还高亮了具体的幻觉片段。

构造方法:

HaluEval 的构建结合了自动生成和人工校验,以实现规模和质量平衡。

  1. 种子数据收集:从现有数据集(如对话、摘要、QA数据集)收集原始上下文和参考输出。

  2. 自动幻觉生成:使用一个强大的生成模型(如ChatGPT),通过精心设计的提示词,要求它“在给定上下文的基础上,生成一段包含幻觉的输出”。提示中包含对幻觉类型的描述和要求,以确保多样性。例如,提示模型“在摘要中加入一个原文没有提及的人物”或“修改对话中的数字使其错误”。

  3. 过滤与质量提升:自动生成的幻觉样本可能存在语义不通或过于明显的问题。采用以下策略过滤:

  4. 使用规则和轻量分类器去除严重语法错误。
  5. 用NLI模型初步筛除与上下文完全无关的离题输出。
  6. 最终提交给人工标注者进行质量审核和精细调整,确保幻觉看似合理(即难以用简单规则发现),以增加检测难度。

  7. 人工标注与细粒度标签:人工标注者不仅确认样本是否包含幻觉,还负责高亮幻觉出现的具体文本 span,并为每个 span 标注具体的幻觉类别(如无依据添加、矛盾、数值错误等)。这为检测模型提供了宝贵的细粒度监督信号。

  8. 数据构成:HaluEval 包含约5,000个经过人工过滤的样本,平衡了不同任务和幻觉类型,附带高亮和类别标签。

价值:HaluEval 提供了具有挑战性的幻觉检测基准,其细粒度标注使得研究者可以训练和评估能够定位错误片段的系统,超越了简单的句子级分类,推动了幻觉解释和修复技术。


“FreshQA” 如何评估模型的时效性和幻觉?

FreshQA 是一个旨在评估大模型处理快速变化的事实信息能力的动态基准,直接检测因知识过时或未能及时更新而产生的时效性幻觉。

评估机制与设计:

  1. 动态问题集:FreshQA 不采用静态问题,而是围绕持续更新的、具有时效性的知识点设计问题。这些问题涉及近期事件、最新统计数据、新兴人物、最新产品发布等。例如,“现任联合国秘书长是谁?”(相对稳定但可能变化),“2024年奥斯卡最佳影片是哪一部?”(极强时效性)。问题集定期维护,移除过时问题并添加新问题。

  2. 两类核心任务:

  3. 单条实时信息测试(One-hop):直接询问一个近期发生的事实,如“2023年世界田径锦标赛男子100米冠军是谁?”。这检测模型是否记住了最近的数据。
  4. 多跳实时推理(Multi-hop):将时效性问题与知识推理结合。例如,“对比2022年和2023年诺贝尔文学奖得主的国籍”,既要求知道两个时变事实,又要进行对比推理。这类幻觉更难检测,因为模型可能知道单个事实却错误关联。

  5. 评估指标:

  6. 答案准确性:与标准答案(从可靠来源如维基百科、权威新闻收集,且定期校验)进行比对,可使用精确匹配或语义等价(借助BERTScore或NLI)。
  7. 时效幻觉率:定义为回答中含有过时信息或编造的最新信息的比例。特别统计模型坚持给出已过时事实的频率。
  8. 知识截止归因:当模型出错时,分析其错误答案是否恰好对应问题在某一历史时间点的真相,从而推断模型的知识截止点,这直接证明了幻觉源自过时知识。

  9. 防猜测试设计:FreshQA 包含部分前提为假或无确定答案的问题,评估模型是否会因追求时效性而强行作答(捏造最新数据),这是对幻觉中“过度帮助性”的专门测试。

  10. 快速刷新流程:研究人员依据重大事件定期更新题库和答案,并通过手动和自动验证确保答案正确,这使得FreshQA成为一个“活的”基准。

对幻觉评估的意义:

  • FreshQA 将幻觉研究从静态事实延伸到时敏事实,揭示模型在面对知识截止边界时的行为。许多模型为了显得“与时俱进”,会编造出带有具体年份和数据的回复,这正是典型的时间性幻觉。通过 FreshQA,可以量化这类幻觉的严重程度,指导检索增强或持续更新技术的改进。

“RealTimeQA” 等动态基准在幻觉评估中的作用。

RealTimeQA 及类似动态基准(如 StreamEval、LiveBench)是一类持续更新的测试集,旨在反映世界的最新变化,在幻觉评估中填补静态基准的空白,主要作用如下:

  1. 检测时效性幻觉与知识遗忘

  2. 静态基准(如 Natural Questions)的知识可能已被模型充分学习,导致对事实性的评估虚高。动态基准定期加入关于新事件的问题,迫使模型在无法靠记忆回答时展现出真实行为:是承认未知,还是进行猜测和编造。这直接暴露时效性幻觉。

  3. 可以追踪模型在知识截止日期后的表现:是产生了大量幻觉,还是能通过工具检索等方式保持准确。

  4. 评估模型的更新与适应能力

  5. 动态基准不仅测量当前正确率,更关注正确率随时间的衰减曲线。如果一个模型在问题首次发布时能答对,但数月后开始给出过时答案,就暴露了其内部知识的僵化和幻觉化。这为模型的知识维护和更新策略提供了连续反馈。

  6. 提供反哺现实的压力测试

  7. 动态基准包含可能包含“高关注度”的谣言或误导信息,测试模型是否轻信这些新出现的错误信息。这对于评估对抗性幻觉和安全风险尤为重要。例如,模型是否会受到近期网络谣言的污染,并以此生成错误答案。

  8. 驱动RAG与外部知识整合的研究

  9. 面对实时问题,纯粹的参数化模型必然产生幻觉。动态基准成为检验检索增强生成(RAG)系统有效性的天然考场。通过比较纯模型和RAG模型在动态基准上的表现,可以量化外部知识在减少时效性幻觉方面的增益。

  10. 构建更稳健的评估生态

  11. 许多动态基准通过社区贡献和自动抓取持续扩展,避免了过拟合。由于问题不断变化,模型开发者无法通过针对特定测试集优化来“刷分”,评估结果更能反映模型的真实泛化能力和幻觉控制水平。

局限与挑战:

  • 答案验证同样需要动态维护,成本高。

  • 需要设计合理的评估窗口,刚发生的事件可能缺乏公认的“正确答案”,存在争议期。

  • 动态基准只能辅助,无法完全替代静态基准对深层知识理解的评估。

总之,RealTimeQA 等动态基准将时间维度纳入幻觉评估,使研究更贴近实际应用,推动了从“静态知识库”到“持续学习与验证”的范式转变。


什么是“幻觉率”(Hallucination Rate)?如何统一定义?

幻觉率(Hallucination Rate) 是衡量模型生成文本中幻觉内容占比的量化指标,用于回答“模型在多大程度上产生了不实信息”。由于幻觉可以存在于不同粒度,幻觉率需要从定义到计算进行统一。

统一定义的框架:

(1)原子事实级幻觉率(最常用且鲁棒)

  • 定义:将生成文本拆解为原子事实集合,逐条验证,计算其中被判定为幻觉的原子事实数占总原子事实数的比例。

image.png

  • 优势:粒度细,不受文本长度影响;对部分错误的捕捉敏感;便于综合不同任务。

  • 验证标准:基于源文(忠实性幻觉)或外部知识(事实性幻觉)进行判断,通常使用NLI或人工标注。如果一条原子事实无法被源文/知识库支撑,或与之矛盾,则标记为幻觉。

(2)句子级幻觉率

  • 定义:包含至少一个幻觉的句子数占总句子数的比例。

  • 优势:计算快,适合快速概览。

  • 劣势:粗粒度,可能高估(一个句子仅一个词错误就算幻觉)或低估(句子内多处错误仅算一个)。不完全反映严重程度。

(3)样本级幻觉率

  • 定义:在整个评估集中,存在幻觉的生成样本数占总样本数的比例(即每个样本只要有幻觉即计入分子)。

  • 优势:直观体现模型的整体可信度,容易理解。

  • 劣势:极端化,忽略幻觉多寡;一个长篇大论样本仅一个轻微错误与通篇编造可能被等同对待。

统一的关键要素:

为了实现不同研究和系统间的可比性,一个统一的“幻觉率”应满足:

  • 明确幻觉类型范围:指明是评估忠实性幻觉(偏离给定源文)还是事实性幻觉(偏离外部真相),或者两者综合。两者率值含义不同。

  • 采用标准验证流程:推荐使用原子事实级作为基础粒度,并公开验证方法(检索增强NLI、人工校验规则等)。

  • 报告置信度与无答案处理:对于无法验证的原子事实(证据不足),需明确统计处理方式:是计入分母忽略不计,还是作为独立类别。一般建议单独报告“未验证率”,并从幻觉率分母中剔除,以反映可核实部分的幻觉密度。

  • 加权可能性:根据幻觉的危害程度加权(如数字错误比同义词替换严重),但实际操作复杂,目前主流仍采用简单算术比。

公式表示(原子事实级综合定义):

image.png

该定义被广泛应用于如FActScore等评估框架,旨在提供一个可比较、可复现的“幻觉密度”指标。


“忠实度”如何量化?给出至少两种指标。

忠实度(Faithfulness)衡量生成文本与给定源文(或上下文)的一致性,即生成内容是否严格基于源文,没有无依据的添加、歪曲或遗漏。量化忠实度的指标主要分为基于蕴涵和基于问答两类。

(1)基于自然语言推理的蕴涵率(Entailment Ratio)

  • 原理:将生成文本分解为独立声明,每个声明作为假设,源文(或其局部片段)作为前提。使用训练好的NLI模型判断前提是否蕴涵(entails)假设。计算被蕴含的声明比例。

  • 具体指标:

  • FactCC(Factual Consistency Check):专门为摘要任务设计的NLI指标。它训练一个BERT变体,输入源文-摘要句对,输出一致/不一致的二分类,并可以指出不一致片段。评价时通常使用准确率,但在量化时可以直接用模型预测为“一致”的句子比例作为忠实度分数。
  • SummaC:构建了多个NLI模型集成,给定源文-摘要,输出一个0-1的连续分数。分数越高代表越忠实。它能处理长源文,在多个摘要忠实度数据集上表现优于简单NLI。
  • AlignScore:一个无监督训练的评分模型,输出源文和生成文本之间的一致性得分(0~1)。分数代表整个文本对的一致程度,本质也是对多声明的整体蕴涵判断。

  • 计算:若有细粒度声明,则忠实度 = 被蕴涵的声明数 / 总声明数。若是整句/全文分数,则直接使用模型输出概率或分数。

  • 优点:能捕捉语义层面的忠实度,不依赖词表重叠。

  • 缺点:NLI模型本身可能出错,尤其是对需要背景知识的矛盾不敏感。

(2)基于问答的忠实度指标(QAGS / QuestEval)

  • 原理:利用问答模型,将忠实度评估转化为比较答案的任务。流程:
  • 使用问题生成(QG)模型,根据源文自动生成一系列覆盖不同信息点的问题。
  • 分别以源文和生成文本作为上下文,用问答(QA)模型回答这些问题,得到两组答案(源文答案,生成文本答案)。
  • 比较两组答案的语义等价性(通常用BERTScore、ROUGE-L或直接训练等价分类器)。如果对于某个问题,生成文本给出的答案与源文答案不一致,则说明生成文本在该信息点上不忠实于源文。

  • 具体指标:

  • QAGS:最终的QAGS分数是各问题等价分数的平均值。若生成文本完全忠实,那么从它里面抽出的答案应与从源文中抽出的答案高度一致。QAGS能有效检测信息的遗漏和添加。
  • QuestEval:扩展了QAGS,同时计算精度(生成文本答案是否源文有支持) 和召回(源文答案是否生成文本有覆盖),并融入了NLI判断,使得分数更均衡。

  • 计算:通常为一个0到1的分数,1表示完全忠实。

  • 优点:通过问答间接检验事实覆盖,能够发现NLI可能漏掉的、因同义改写而掩盖的细微事实扭曲。

  • 缺点:严重依赖QG和QA模型的质量,流程耗时较长。

其他相关指标:

  • 实体及关系重叠指标:抽取三元组进行覆盖率和精度计算,如实体匹配率。更为直观但语义覆盖有限。

  • 大模型裁判:如GPT-4直接打分,可给出忠实度评分及理由,灵活且与人类高度相关,但成本高、有自身偏误。

实践中:往往组合使用SummaC(速度快,整体评估)和QAGS(细粒度事实覆盖)来全面量化忠实度,或在重要场景辅以大模型裁判验证。这些指标为自动化监督模型生成质量提供了不可或缺的手段。


“事实一致性”的 BLEU/ROUGE 类指标为何不足?需要哪些专门指标?

BLEU(Bilingual Evaluation Understudy)和 ROUGE(Recall-Oriented Understudy for Gisting Evaluation) 是基于 n-gram 重叠的文本相似度指标,最初用于机器翻译和自动摘要。它们在评估事实一致性方面存在根本性不足。

不足的原因:

  • 只测量表面词汇重叠,不捕捉语义:两个文本可能用词高度重叠但事实完全相反(例如,否定词的增减)。“巴黎是法国首都”和“巴黎不是法国首都”的 ROUGE-1 精确度可能接近 100%,但事实性截然相反。

  • 无法区分信息重要性:所有词视为同等重要,一个关键的数字错误和无关紧要的冠词改动在评分中权重类似。比如,将“GDP 增长 2.7%”误说成“2.8%”,BLEU/ROUGE 只有细微降分,但这种错误是严重幻觉。

  • 无法检测无依据的添加:如果生成文本添加了大量合理但与源文无关的细节(例如,编造了一个不存在的人名),只要用词不重复,这些严重的不忠实内容不会显著影响分数。

  • 忽视同义性和知识等价性:两个事实等价但表达不同的句子会得到低重叠分,导致误判。例如,“爱因斯坦出生于1879年”和“爱因斯坦在1879年降临人世”几乎无 n-gram 重叠,BLEU/ROUGE 会认为它们不相似,而实际上完全忠实。

  • 对长文本和结构变化的脆弱性:长文本中,即使整体事实一致,由于语序、句子切分差异,n-gram 重叠率也会暴跌,产生不公的低分。

专门的事实一致性指标需求:

为了弥补上述不足,需要能进行深层语义理解和事实逻辑判断的指标。这些指标通常基于以下技术:

  • 基于自然语言推理(NLI)的指标:如 SummaC、FactCC、AlignScore。它们直接判断生成文本能否从源文蕴涵出来,跨越了词汇层面,能识别矛盾、无据添加和逻辑断裂。

  • 基于问答的指标:如 QAGS、QuestEval。通过自动生成问题并检验答案一致性,间接评估事实覆盖与扭曲。这类指标聚焦于“信息点”级别的准确性,而非笼统的文本相似度。

  • 基于信息抽取的指标:如 实体F1、三元组重叠率。抽取事实骨架(实体、关系)进行匹配,对数字、日期等精确信息特别有效。

  • 检索增强的事实核实指标:如 FActScore,将声明与外部知识库比对,不依赖固定参考文本,适用于开放域生成的事实性评估。

  • 大模型作为裁判:利用 GPT-4 等模型进行零样本或小样本的忠实度评分,具有很高的语义灵活性。

总而言之,专门指标从“文本匹配”转向“事实核查”,能够评估语义等价性、矛盾性和证据充分性,这是 BLEU/ROUGE 永远无法实现的。


基于问答的评估:如何通过模型回答衍生问题集来检测幻觉?

基于问答(QA)的评估方法通过自动生成问题并比较答案来间接评估生成文本的忠实度,能有效检测信息遗漏、添加和歪曲。

工作流程:

  1. 问题生成:使用一个训练好的问题生成模型,以源文(或参考文本)为输入,自动生成一组覆盖源文关键信息点的问题。这些问题应多样化,包括事实性问题(谁、何时、何地)、数字问题、因果问题等。生成质量至关重要,低质量或模糊的问题会破坏评估。

  2. 答案生成:

  3. 源文答案:使用问答模型,以源文为上下文,回答第一步生成的所有问题,得到一组基准答案。这些答案代表了源文中明确包含的信息。
  4. 生成文本答案:同样使用问答模型,以待评估的生成文本为上下文,回答相同的问题。得到另一组答案。

  5. 答案比较与评分:比较两组答案的语义一致性。如果对于某个问题,生成文本给出的答案与源文答案不一致(例如,缺失、错误、或添加了额外不实细节),则意味着生成文本在该信息点上存在幻觉(不忠实)。

  6. 比较方式:可以使用基于文本相似度的方法,如 BERTScore、ROUGE-L,更鲁棒的方法是使用 NLI 模型判断两个答案是否等价。例如,计算“等价率”或“支撑度”。

  7. 指标聚合:

  8. 对每个问题-答案对计算得分(0或1,或连续相似度),然后对所有问题取平均,得到最终的忠实度分数。QAGS 和 QuestEval 是此类方法的典型代表。
  9. QuestEval 进一步区分了精度(生成文本的答案在源文中是否有据可查)和召回(源文的关键信息是否都在生成文本的答案中得到体现),从而更全面。

为什么有效?

  • 聚焦信息点:将长文本的比较转化为多个具体的信息点问答,细粒度地捕捉增删改。

  • 对同义改写鲁棒:只要答案语义等价,即使表达不同也能得高分,避免了 n-gram 指标的缺陷。

  • 可解释性强:能够明确指出在哪个问题上出现了不一致,便于定位幻觉片段。

局限性:

  • 问题生成和问答模型本身可能犯错,错误会被传播。

  • 隐晦的、需要多步推理的矛盾可能难以通过单一问答发现。

  • 若生成文本完全编造了源文没有的主题,问题生成器可能无法提出相应问题,导致漏检。此时需结合 NLI 或覆盖率指标。

尽管如此,基于问答的评估已成为忠实度检测的主流和强基线之一。


解释“Entity-level F1”在幻觉评估中的作用。

实体级 F1(Entity-level F1) 是一种基于信息抽取的评估指标,通过比较生成文本和参考文本(或源文)中命名实体的重叠情况来量化事实一致性和幻觉程度。

计算方式:

  1. 使用命名实体识别(NER)工具,分别从生成文本和参考文本(对于忠实度评估,参考文本为源文;对于事实性评估,参考文本为知识库片段或人工参考答案)中抽取所有实体,得到实体集合。

  2. 计算精确率(Precision):生成文本中的实体有多少比例出现在参考文本中。

image.png

在幻觉评估中的作用:

  • 检测实体幻觉:精确率低意味着生成文本添加了大量参考源中不存在的实体(外在实体幻觉)。例如,摘要中凭空捏造了一个人名、地名、产品名,这些会被直接捕获为精确率下降。因此,实体精确率可以视为一种“幻觉密度”指标。

  • 检测信息遗漏:召回率低则表示生成文本遗漏了参考源中的重要实体,可能丢失关键信息。虽然这不直接等同于幻觉,但在摘要等任务中,关键实体缺失导致信息失真,也属于忠实性缺陷。

  • 对数字、日期等关键信息敏感:若将数字、日期也作为特殊实体(Numerical Entity),则实体级 F1 能有效捕捉数值幻觉。因为数字错误往往只是几个字符之差,但 NER 可将其识别为不同实体。

  • 快速、低成本:实体抽取极快,可作为实时评估或大规模粗筛,标记出存在明显实体错误的样本。

  • 与语义指标互补:它无法处理同义实体(如“奥巴马”与“贝拉克·奥巴马”),需要实体链接或别名表辅助。此外,它不能检测关系幻觉(实体对了但关系错了)。因此,实体 F1 通常与 NLI 或 QA 指标联合使用,前者抓“骨架错误”,后者查“血肉不符”。

总结:Entity-level F1 是一个直观、高效的幻觉辅助指标,尤其在检测无中生有的实体和数值错误方面表现突出。


在长文本生成中,如何评价模型维持事实链的能力?

长文本生成(如故事、长报告、多步推理文章)中,维持事实链能力要求模型在生成过程中保持前后逻辑一致,且所有事实陈述都能自洽并与初始约束/知识吻合。评估这种能力需要关注连贯性、一致性和因果链的保真度。

评价方法与指标:

(1)长距离一致性评估

  • 滑动窗口NLI:在长文本上滑动窗口,检查当前句子与之前所有已生成内容(或限定窗口内)的蕴涵关系。如果某个句子与历史内容矛盾(NLI预测为矛盾),则发生事实链断裂,标记为幻觉。统计断裂点次数或矛盾句占比。

  • 自相矛盾检测模型:训练专门的矛盾检测器,输入两个文本片段(可以是同一文本的不同部分),输出是否矛盾。用于自动扫描生成的长文中前后不一致的陈述。

(2)因果与时间逻辑验证

  • 时序关系抽取与校验:抽取文中的事件及其时间表达式,使用时间推理模块检验事件顺序是否合理。例如,不能先生效后发生。

  • 因果方向判断:对于包含“因为…所以…”、“导致”等连接词的句子,抽取因果对,利用常识知识图谱(如 ConceptNet)验证因果关系是否成立。错误的因果链接是典型的事实链幻觉。

(3)知识链覆盖与支撑度

  • 原子事实链的支撑追溯:将长文本从头到尾拆解为原子事实序列,对于每个事实,要求能够从上文已生成的内容或可信的外部知识中找到唯一支撑。如果某个事实突然无法被前文或知识库支撑,则为事实链中的“凭空跳跃”幻觉。

  • 事理图谱一致性:将文本描述的事件序列映射到预构建的事理图谱(如脚本知识库),检查事件转移概率是否符合典型模式。极度不符合常规的事件序列可能表明模型在幻想。

(4)规划一致性评估

  • 提纲忠实度:如果生成长文前先生成了提纲,可以评估正文与提纲在章节主题、核心主张上的一致性。使用文本相似度或 NLI 判断每个正文段落是否遵循并履行了提纲中的承诺。

  • 关键约束追踪:定义必须在全文保持一致性的关键要素(如人物设定、地点、目标),建立约束槽位,自动抽取值并检验全文各处是否统一。

(5)长文本问答(Long-form QA)评估

  • 针对长文本内容,自动生成覆盖前后多个位置的综合问题(包括需要跨段落推理的问题)。用生成文本回答这些问题,再与基于可靠知识的答案比较。如果无法正确回答,说明相应的事实链没有维持好。

(6)人工评估维度

  • 设计多维评分量表,包括“全局逻辑一致性”、“因果合理性”、“人物/事件前后一致”、“无凭空细节”等,由人工进行阅读评分。

挑战:长文本的事实链评估极其复杂,自动指标尚处于早期,目前多依赖人工评估或结合多种自动指标的弱监督信号。


“FaithDial” 数据集设计目标是什么?如何帮助评估?

FaithDial 是一个专为对话生成设计的大规模、高质量的忠实性数据集,旨在解决对话模型中的幻觉问题,并提供评估基准。

设计目标:

  1. 消除对话中的幻觉:常规对话数据集(如 Wizard of Wikipedia)中充满大量与知识源不一致的回复(幻觉)。FaithDial 对这些数据进行了忠实化改造,确保每条回复都能严格从提供的知识文档中推导出来,不添加、不歪曲。

  2. 定义并标注细粒度忠实性:不仅区分“忠实”与“不忠实”,还对不忠实的回复标注了具体的错误类型和位置,如“无依据添加”、“信息遗漏”、“过度泛化”、“逻辑错误”等。

  3. 促进忠实对话生成研究:提供一个干净、可依赖的训练和评估资源,鼓励模型学习在给定知识的情况下生成完全忠实的回复,而不是编造。

如何构建(实现忠实化):

  • 原始数据基于 Wizard of Wikipedia,其中对话者可以访问维基百科知识。原始标注存在许多不忠实。

  • 研究者让众包标注者修正那些不忠实的回复,使其变成完全忠实于知识库的版本。修正过程包括了删除添加的内容、用知识片段中的正确信息替换、消除模糊表述等。

  • 每个原始的不忠实回复及其修正版本都被保留,形成正负例对,便于训练检测器和模型。

  • 同时保留对话历史和对应的知识快照,使得上下文完整。

对评估的帮助:

  • 标准测试集:FaithDial 提供了高品质的忠实对话金标准,可直接用于评估对话模型的事实一致性。模型生成的回复可以与其标准修正版本进行语义一致性比较,或通过 NLI 判断是否被知识支撑。

  • 细粒度错误分类:由于包含详细的错误类型标注,评估时不仅可以给出整体的忠实度分数,还能诊断模型倾向于犯哪类幻觉(如过度添加细节、还是曲解原意),从而提供针对性改进方向。

  • 训练检测器:其细粒度标签可用于微调强大的幻觉检测模型,这些检测器稍后又可用来评估其他模型的输出。

  • Few-shot 评估的范例:数据集中的样本可作为提示词示例,指导大模型裁判对新的对话回复进行忠实度打分,提升评分的准确性和一致性。

意义:FaithDial 通过构建一个“无幻觉”的高质量对话数据生态,将对话生成的评估从模糊的“流畅度、相关性”提升到精准的“证据支撑度”层面,推动了安全可信对话系统的发展。


多轮对话幻觉的评估有哪些难点?

相比于单轮文本生成,多轮对话中的幻觉评估面临独特挑战:

(1)状态依赖性导致评估上下文复杂

  • 每一轮回复的忠实性不仅取决于本轮用户输入,还受整个对话历史中积累的共享知识、承诺、实体引用等影响。评估时必须提供完整的对话历史作为“源文”,这极大增加了评估的输入长度和语义复杂度。自动化工具(如NLI)在处理超长历史时性能显著下降。

(2)记忆与遗忘的动态验证

  • 需要检测“记忆漂移”:模型在本轮是否遗忘或修改了之前轮次中已确认的事实。这要求评估系统能跨轮次追踪事实,识别前后矛盾。例如,用户在第二轮说“我叫李明”,第五轮模型却回应“张先生你好”。这需要一套动态状态追踪机制,而不仅仅是静态文本比对。

(3)隐式信息确认与修正的捕获

  • 对话中存在大量隐含状态变更。用户可能通过一个含糊的回应间接纠正了模型,或者模型默认接受了用户的纠正但未显式复述。评估系统需要理解这些“隐含承诺”,判断模型后续是否遵循了修正后的设定。这需要高深的语用推理。

(4)任务场景的多样性

  • 多轮对话可能同时包含闲聊、任务指令、信息查询、推荐等多种场景,不同场景对“忠实”的定义不同。闲聊中适当的虚构可以接受,但任务指令中绝不能。评估指标需要能够区分场景并动态调整严格度。

(5)评价基准的缺乏

  • 绝大多数现有幻觉数据集和评估工具都是针对单轮摘要、QA等设计的。多轮对话的忠实度评估金标准极少,FaithDial 等是初步尝试。构造多轮评估数据成本极高,因为需要完整的对话历史和知识支撑标注。

(6)自动化指标的局限性

  • NLI 模型在长文本、对话结构上的准确率打折扣;基于QA的方法需要生成覆盖历史的问题,而问题生成器本身可能产生偏差;实体级F1无法处理同义替换,且对话中人称代词频繁,解析复杂。

(7)人类评估的认知负担

  • 人工评估者需要阅读数十轮对话并记住所有细节,才能判断当前回复是否存在事实漂移或编造。认知负荷大,易疲劳,导致一致率低,成本极高。

缓解方向:开发专用的对话状态追踪增强型评估器;构建如 FaithDial 等高质量多轮基准;利用大模型裁判进行端到端评估并辅以事实链解释;在评估时将对话压缩为结构化状态摘要以供自动化工具使用。


不同领域(医疗、法律、金融)的幻觉评估需要特殊处理吗?

是的,绝对需要。 通用领域的幻觉评估在专业领域会严重失效,因为这些领域对准确性、专业术语、逻辑严谨性和风险控制有极高要求。

医疗领域特殊处理:

  • 知识库专业化:必须使用权威医学知识库(如 PubMed、UpToDate、临床指南)作为事实来源,而非通用维基百科。评估需要检索医学文献数据库。

  • 实体的高精度链接:症状、药物、剂量、检查指标等实体的微小偏差都可能导致严重后果。实体级F1极其重要,且需要链接到标准医学本体(如UMLS、SNOMED CT),避免同义词误判。

  • 数值与单位的致命性:剂量数值(5mg vs 5g)、单位的错误是绝对红线。需要专门的高亮检测和针对数值的严格比对。

  • 风险与禁忌推断:评估需检查生成内容是否违反了禁忌症、相互作用等安全边界。这需要构建规则库与医学知识图谱结合的逻辑验证模块。

  • 无法验证即高风险:在医疗中,证据不足的声明应直接视为高风险幻觉,默认“不给出建议”比“基于不确定知识建议”更安全。评估必须保守。

法律领域特殊处理:

  • 条文与先例精确性:幻觉常表现为编造不存在的法条、条款号、伪造案例名。评估需要对接法律法规数据库(如Westlaw、北大法宝),进行条文号存在性验证和内容匹配。

  • 逻辑与适用性推理:法律论证需要严谨的演绎逻辑。评估需检测“引用正确但推导错误”的逻辑幻觉,这需要复杂的法律推理模型或专家人工核查。

  • 时效性与司法管辖区:法律具有地域和时效,评估必须区分不同国家、州的法律,并确认判决年份是否过时。引用已废止法律属于严重幻觉。

  • 特权与保密:不能假想律师-客户特权信息。评估需检查生成文本是否包含不当假设。

金融领域特殊处理:

  • 实时数据:股价、汇率、财报数据瞬息万变。评估必须接入实时数据源(如Bloomberg API),检验数字的时效性和精确性,容忍度极低。

  • 投资建议幻觉:提供虚假的投资建议、伪造的公司业绩数据可能引发财务损失。评估需要与官方披露文件进行交叉验证。

  • 量化分析中的计算错误:生成的财务模型、计算公式中的逻辑错误。需要执行实际计算或使用形式验证工具。

  • 术语与合规:对“保证收益”、“无风险”等受监管术语的使用需要合规性检查,错误的表述可能触犯法律。

共同特殊处理:

  • 专家参与评估:自动指标只能作为初筛,最终需要大量引入领域专家进行人工评估,尤其是针对高风险样本。

  • 可解释性要求:评估不仅要给出幻觉分数,还需要解释为什么错、正确的信息是什么,以便追溯责任。

  • 定制化训练数据:需要用领域内的高质量数据微调 NLI 模型和检测器,使其理解专业语境。


多语言幻觉评估的挑战是什么?

多语言幻觉评估面临跨语言迁移、文化差异和资源匮乏等多重挑战。

(1)训练数据与评估资源极度不均

  • 绝大多数幻觉评估数据集(如FactCC、HaluEval、TruthfulQA)都是英文的,其他语言很少或没有。直接训练的多语言检测器性能在低资源语言上大幅下降。

  • 缺乏高质量的多语言知识库和检索源,难以进行检索增强的事实核查。

(2)跨语言知识迁移导致的评估复杂性

  • 模型内部主要知识存储为英文。对于非英文问题,模型会经历“翻译→英文知识检索→生成→翻译”的隐式过程。这个管道中的任何翻译错误都可能扭曲事实,产生翻译幻觉。但评估系统很难区分是“知识本身错误”还是“翻译过程中的错误”。

  • 例如,实体名称在不同语言中的翻译和音译不同,评估系统可能无法将“Einstein”和“爱因斯坦”链接为同一实体,误报为幻觉或漏报。

(3)文化依赖性与语境化事实

  • 许多事实是文化特定的(如历史人物、当地习俗、法律)。评估系统必须使用该语言社区公认的权威来源,而不能简单地以英文维基百科为标准。否则,文化特有的正确陈述可能被错误地标记为幻觉。

  • 常识推理也因文化而异,评估需要适配当地的常识体系。

(4)语言形态与句法的多样性

  • 低资源语言的复杂形态(如屈折变化、黏着语)使得基于实体抽取、n-gram 的方法更容易出错。语义对齐更为困难。

  • 代码切换(在回答中混合多种语言)现象非常普遍,评估系统需要支持混合语言文本,并判断其中事实是否正确。

(5)缺乏多语言 NLI 和对齐模型

  • 多语言 NLI 模型(如 XLM-R)在某些低资源语言上性能有限,难以作为可靠的自动评估器。

  • 现有的大模型裁判(如 GPT-4)在非英文上的评估质量可能下降,且校准不充分。

(6)人工评估的难度

  • 多语言人工评估需要招募具有不同语言能力的标注者,成本极高,且难以保证跨语言的一致性。标注指南需要进行文化和语言适配。

应对策略:

  • 构建多语言幻觉数据集,如将现有英文基准翻译并人工校验,但需要注意翻译后的细微事实偏移。

  • 使用多语言检索增强,链接到当地维基百科或新闻源。

  • 开发更好的多语言 NLI 和跨语言实体链接系统。

  • 在评估时,显式地考虑翻译管道,或采用源语言知识直接评估,非英语生成文本可回译成英语再进行事实核查(但可能改变原意)。


如何设计一个综合性的人评方案,对模型幻觉进行多维度打分?

设计一个全面的人评方案需明确维度、制定详细的标注规范、设计科学的评估流程和质量控制,以捕捉幻觉的多个侧面。

(一)评估维度设计(多维度打分)

综合方案应评估以下核心维度,每个维度单独打分(如1-5分或0-1连续量表):

  1. 事实性(Factuality):生成内容是否与客观世界事实相符。子维度可包括:实体准确性、数值准确性、时间准确性。

  2. 忠实性(Faithfulness):生成内容是否忠实于给定的上下文/源文。子维度:无据添加程度、信息遗漏程度、内容歪曲程度。

  3. 一致性(Consistency):内部前后是否矛盾。子维度:局部一致性(句子间)、全局一致性(全文/全对话)、与历史承诺一致性(多轮对话)。

  4. 来源可靠性(Attribution / Grounding):对于声称引自某源的内容,引用是否真实存在且内容匹配。评估引用准确率。

  5. 知识边界诚实度(Honesty about Knowledge Boundaries):在面对不确定、无法知晓或超出知识范围的问题时,模型是否诚实地表达不确定性或拒绝回答,而不是强行编造。可评估“拒答恰当性”和“过度自信程度”。

  6. 时效性(Temporal Accuracy):对于时敏信息,答案是否反映了最新真实情况,而不是过时数据。评估是否错误地使用了截止日期前的旧信息。

  7. 安全与偏见(Safety & Bias):幻觉内容是否涉及有害、歧视性或冒犯性的虚构信息。虽然这更偏向安全评估,但由幻觉引发的有害陈述应在此维度惩罚。

(二)标注指南与细粒度标签

  • 制定详细的标注手册,包含每个维度的定义、正面/反面示例、边界案例。

  • 标注者不仅给出维度的分数,还需要对存在严重幻觉的文本进行高亮标注,并选择错误类型(如“捏造实体”、“数字错误”、“矛盾”、“无据引用”、“过时信息”等)。

  • 提供标准化的标注界面(如 LabelStudio 配置),支持文本高亮、维度评分滑块、下拉选项等。

(三)评估流程

  1. 样本抽样:从模型真实交互数据中分层抽样,确保覆盖不同主题、长度、任务类型,并包含预期的高风险场景(如医疗建议)。

  2. 任务设计:每个评估任务单元包含:完整的输入(对话历史、源文等)、模型输出、以及可选的辅助验证信息(如检索到的证据段落、知识截止日期提示)。

  3. 双重标注与仲裁:每个样本至少由两名独立标注者评估。计算评分者间信度(如加权 Kappa)。对于分歧大于阈值的样本,引入第三方资深专家仲裁。

  4. 先导测试与培训:进行多轮先导测试,校准标准,直至评分者信度达标(如 Kappa>0.7)。持续培训与答疑。

(四)质量控制

  • 嵌入金标准题目(已知分数的高质量样本)作为陷阱题,实时监控标注质量。

  • 限制每日标注量,防止疲劳。

  • 定期举行校准会议,讨论疑难案例,更新指南。

(五)综合评分与报告

  • 总分聚合:根据应用场景对各维度加权求和,得到一个综合的“幻觉严重度指数”。例如,高风险领域给事实性和安全性更高权重。

  • 细粒度报告:提供按维度、按错误类型的细分统计,定位模型的主要短板。例如,“模型在历史类问题实体准确率高,但时间准确率低,经常错配年代”。

  • 可操作的分析:标注过程中收集的修改建议和正确版本,可用于生成训练数据,直接改进模型。

这样的人评方案成本高但价值巨大,不仅提供了准确的性能衡量,还提供了模型改进所需的详细错误分析,是构建可信大模型不可或缺的一环。


“基于文本蕴含”的评估在幻觉指标中的地位。

基于文本蕴含(Textual Entailment)的评估在幻觉指标中占据核心支柱地位,是实现语义级忠实度验证最成熟、应用最广泛的技术路线之一。

地位体现:

  • 事实一致性的黄金自动代理:文本蕴含直接回答“前提(源文/知识)是否在逻辑上蕴含假设(生成声明)”这个问题,本质上是对忠实度的操作性定义。如果一个声明不能被源文蕴含,则可判定为无依据(潜在幻觉);若矛盾,则为明确幻觉。

  • 语义深度远超表面匹配:它能够识别同义改写、概括、详述等变化,也能捕捉矛盾,解决了 BLEU/ROUGE 类指标的盲区。这使其成为衡量事实一致性的首选自动指标。

  • 标准化框架:NLI 任务有成熟的数据集(如 SNLI、MNLI、ANLI)和预训练模型,可以直接作为评估器微调和使用,使得基于蕴含的指标具有良好的可复现性和社区基础。

  • 细粒度与多任务适用:通过将生成文本拆解为原子声明并逐条进行蕴含判断,可以实现细粒度的幻觉定位,不仅给出整体分数,还能指出具体错误片段。适用于摘要、对话、问答等多种任务。

  • 衍生出专用指标:许多关键指标均基于蕴含,如 FactCC(摘要一致性)、SummaC(多粒度蕴含评分)、AlignScore(连续蕴涵得分)、FActScore(结合检索的蕴含率)。这些指标在实际系统中常作为主要自动化评估手段。

局限与挑战:

  • NLI 模型本身存在错误率,对需要深层推理、常识或长文档上下文的情况可能误判。

  • 对于“中立”的处理:中立可能意味着未提及,在需要完全支撑的任务中归为幻觉,但 NLI 模型的中立预测并不总是可靠。

  • 无法检测一些需要外部知识的幻觉,除非与检索结合(如基于检索增强的蕴含)。

地位总结:基于文本蕴含的评估是目前自动评估幻觉的基础模块,它提供了从“文本匹配”到“语义核查”的关键跃迁,几乎所有的现代幻觉评估框架都将其作为核心组件或重要参考。


“Self-contradiction” 如何在评估中被检测和量化?

自相矛盾(Self-contradiction) 指模型在同一输出或一段对话中生成互相冲突的陈述。检测和量化自相矛盾需要识别文本内部的不一致。

检测方法:

  • 基于NLI的扫描:将长文本按句子或原子声明分割,对任意两条声明形成前提-假设对,运行NLI模型。如果检测到“矛盾”关系,则标记为一个自相矛盾点。为提高效率,通常限制比较窗口(如只比较距离较近的句子,或随机抽样后重点检测)。

  • 矛盾检测专用模型:训练一个二分类器,输入两个文本片段,输出是否矛盾。可使用已有的矛盾检测数据集(如 WANLI、Adversarial NLI 的硬例)进行微调。应用时,提取所有对,用该分类器标记矛盾对。

  • 基于信息抽取的逻辑冲突验证:对文本中的实体、关系、数值进行抽取,利用规则检测冲突(如年龄前后不一致:“我今年30岁” vs “我出生于1990年”隐含年龄可能冲突;数值“收入为1000元” vs “收入为2000元”)。结合常识知识图谱还可检测隐含矛盾(如“外面下着大雨”和“我正要去晒被子”)。

  • 大模型裁判直接评估:提示GPT-4等强模型“找出以下文本中前后矛盾的地方”,并让其指出矛盾的具体句子对和原因。效果较好但成本高。

量化指标:

  • 矛盾密度:矛盾对数量 / 总句子对数量(或所有可能对数的抽样比例)。直观反映自相矛盾的频繁程度。

  • 矛盾跨度:发生矛盾的句子之间的距离(字数或句子数),衡量模型维持长期一致性的能力。如果矛盾多发生在远处,说明长距离记忆差。

  • 矛盾严重度:对矛盾进行加权,例如关键事实矛盾(如人名、决策)权重高于一般描述矛盾。可由人工评分或基于矛盾类型自动加权。

  • 段落级矛盾率:在评估集上,包含至少一处矛盾的样本占比。简单易用。

  • 综合一致性得分:在对话等多轮场景中,记录每轮对话与历史的一致性状态,最终计算整个对话的一致率(如连续一致轮次占比)。

应用:自动化检测常使用 NLI 扫描作为基础,并在关键领域辅以规则和大模型验证,最终给出矛盾密度和位置报告。


使用模型作为裁判评估幻觉,其可靠性和偏差如何评价?

将大模型(如 GPT-4)作为裁判(LLM-as-Judge)来评估幻觉具有灵活性高、可解释等优势,但也引入新的可靠性和偏差问题。需要从以下方面系统评价其质量。

(1)与人类判断的一致性(最核心的可靠性指标)

  • 相关系数:计算裁判模型给出的幻觉分数与多位人类专家平均评分之间的 Pearson 或 Spearman 相关系数。高相关表明可靠。

  • 一致率:设定阈值,将分数二元化(幻觉/非幻觉),计算与人类标签的 Cohen's Kappa 系数或 F1 分数。

  • 细粒度对齐:在声明级,比较裁判模型标记的幻觉片段与人工高亮片段的重叠度(如 Intersection-over-Union)。位置的一致性比整体分数更重要。

(2)稳定性与鲁棒性

  • 输入扰动敏感性:对同一文本对,微调无关紧要的措辞(如添加礼貌用语、改变标点),看裁判分数是否大幅波动。波动大则鲁棒性差。

  • 多次询问一致性(Self-consistency):对同一样本多次运行裁判模型(可变化温度),观察打分的方差。低方差表示输出稳定。

(3)偏差评价

  • 位置偏差:裁判模型是否对生成文本中靠前或靠后的句子给予不同严苛度?通过交换句子顺序或前后对照实验来检测。

  • 长度偏差:是否倾向于给更长或更短的文本更高/更低分?可以通过控制文本长度观察分数变化。

  • 权威口吻偏差:是否容易被“根据...”、“研究显示”等伪权威措辞所误导,忽略实际不实的内容?专门构造此类样本进行测试。

  • 自有知识干扰:作为裁判的模型本身具有强大知识,可能在评估时用自身知识替代评判上下文的忠实度,这在评估忠实度时造成污染。可以通过给裁判提供与自身知识矛盾的源文,看其是严格依照源文还是依据自身知识判分来检测。

  • 提示词敏感性:不同提示词(如角色设定、输出格式)是否导致显著不同的结果。设计多组提示进行对比实验。

  • 领域偏差:在特定领域(医疗、法律)是否存在与领域不匹配的宽严标准。

(4)校准度

  • 裁判模型输出的分数是否反映真实准确率?例如,模型给0.9分的样本是否确实有90%的概率是非幻觉?可以通过期望校准误差(ECE)来度量。

(5)与其他裁判模型的一致性

  • 如果可能,比较不同裁判模型(GPT-4, Claude, Gemini等)之间的评分一致性。高一致性增强可信度。

改善途径:在裁判评估中提供详细的判断依据、引入思维链、提供少样本示例以校准,以及使用多模型集成,都可提升可靠性并减少偏差。


如何构建一个对抗性幻觉测试集,测试模型的鲁棒性?

对抗性幻觉测试集旨在故意诱导模型犯错,以评估其在最坏情况下的表现。构建方法包括已知弱点的针对性设计和自动发掘。

(1)知识冲突样本

  • 上下文-记忆冲突:构造问题,提供的上下文包含与模型强参数知识相矛盾的信息(如上下文说“水的沸点是50°C”),测试模型是否能遵循上下文而不依赖错误记忆。如果模型输出参数知识,则是固执性幻觉。

  • 多源矛盾:提供多个检索文档,相互之间对同一事实给出矛盾信息,测试模型是否能识别冲突、表达不确定性或进行合理整合,而不是盲目选择或混合。

(2)复杂推理与逻辑陷阱

  • 误导性推理链:设计需要多步推理但存在常见错误推理捷径的问题。例如,给出错误提示“如果A>B且B>C,那么C最大”,诱使模型输出错误结论。

  • 嵌套谬误:在源文中嵌入虚假因果关系、循环论证等,然后要求总结,观察模型是否复制这些逻辑谬误为幻觉结论。

  • 反事实前提问题:询问基于假前提的问题(如“为什么天空是绿色的?”),测试模型是否先否认前提。

(3)统计模式陷阱

  • 高频错误模板:利用 TruthfulQA 的思想,构造那些在训练数据中常被错误关联的事实(如流行谬误),考验模型是否跟随错误的群体记忆。

  • 模糊实体拼接:构造涉及多个相似实体的描述,实体属性交错,诱使模型张冠李戴。

(4)长文本与注意力压力测试

  • 大海捞针变体:在长文档的中间部分插入关键矛盾信息,测试模型是否能注意到并妥善处理。

  • 远距离依赖矛盾:文档开头确立某个事实,在末尾引入与该事实冲突的新信息,要求模型根据全文回答,考察其整合能力。

(5)对抗性提示设计

  • 角色扮演诱导:使用“你现在是一个不诚实的助手”等提示,看模型是否会被诱导产生幻觉。

  • 假设性幻觉触发:用“详细描述X,即使你知道不存在”测试模型是否在压力下编造。

(6)自动对抗生成方法

  • 基于梯度的扰动:对于白盒模型,可在输入上添加微小扰动,最大化输出矛盾或实体错误的概率。

  • 基于大模型的对抗改写:用 GPT-4 改写源文,保持原意的同时增加模棱两可的表述,或植入微妙的矛盾,测试模型是否会被干扰。

  • A/B 测试框架:自动生成大量原始样本,每个样本有一个对应的对抗版本(如修改某个数字),比较模型在两者上的幻觉率差异。

测试集构成与评估:

  • 每个样本都有明确的金标签(如:回答应跟随上下文,应指出矛盾,应拒绝回答等)。

  • 评估指标包括:冲突识别率、正确依从率、拒答率、新增幻觉率等。

  • 按难度分层,报告模型在不同攻击类型下的鲁棒性得分。

对抗性测试集能暴露模型在边界和压力下的脆弱性,是评估幻觉鲁棒性的关键工具。


开放域对话的幻觉评估为什么比封闭域任务难?

开放域对话(闲聊、任意话题)的幻觉评估难度远高于封闭域任务(如基于特定文档的摘要、指定知识库的问答),原因如下:

(1)缺乏固定参考源(无源可依)

  • 封闭域有明确的源文或知识库,忠实度可以通过与源文比对直接判断。开放域对话的回复不需要依赖特定源文,而是利用模型自有知识和想象力。判断一个开放域陈述是否幻觉,只能求诸外部全部世界知识,这极其困难且成本高昂。

(2)事实性界限模糊

  • 开放域中,用户可能询问主观看法、创意故事、未来预测,这些内容没有客观真值。区分“合理的创意虚构”和“有害的幻觉”需要结合对话上下文和用户意图,无法通过简单的知识匹配解决。比如,讲故事时编造一个城市名可能是创意,但在提供建议时编造一个医生名就是幻觉。

(3)对话中的语用适当性

  • 开放域对话中,社会性回应(如“我有个朋友也...”)可能是虚构的社交润滑,不一定被视为需要验证事实的幻觉。评估必须区分“社交性虚构”与“事实性编造”,这种语用判断非常微妙。

(4)多轮动态语境

  • 开放域对话通常是多轮的,知识随着对话历史累积、更新、甚至被覆盖。评估需要解析整个对话状态,判断当前轮次的回复是否与历史已经确认的事实(包括用户纠正过的)一致。这比封闭域任务中的单一源文复杂得多。

(5)评估的自动化困难

  • NLI 等工具需要前提文本。在开放域,需要动态检索相关知识作为前提,但检索什么、检索多少、如何对齐都是难题。生成的内容可能涉及多个领域的知识,检索覆盖不全或引入噪声。

  • 大模型裁判虽然灵活,但在开放域中其本身的事实知识边界和偏见会极大影响评估准确性,且难以校准。

(6)缺乏标准评测集

  • 封闭域有大量高质量的标注数据集,开放域对话的幻觉评估基准非常有限,且制作成本高昂,因为每个对话的每一轮都需要进行大量事实核查和状态标注。

(7)用户意图与期望管理

  • 用户可能故意提出矛盾或虚假前提来测试模型,这时模型合理的应对是纠正或指出矛盾,但这本身又涉及对用户意图的理解,评估更趋主观。

因此,开放域对话的幻觉评估仍主要依赖昂贵的人工评估,并需要多维度(事实性、一致性、安全性、边界诚实度)的综合评判。


针对 RAG 模型的“RAGAS”框架如何评估忠实度和相关性?

RAGAS(Retrieval Augmented Generation Assessment) 是一个专门为评估 RAG 系统而设计的无需人工标注的自动化评估框架。它通过将生成回答与检索文档进行逻辑分析,量化忠实度和答案相关性等关键维度。

对忠实度的评估:

  • 核心思想:忠实度衡量生成的答案在多大程度上是基于检索到的文档,而不包含幻觉。

  • 方法:

  • 声明分解:利用 LLM 将生成的答案分解为一系列独立的原子声明。
  • 文档支撑验证:对于每个原子声明,使用 LLM(如 GPT-3.5/4)判断该声明是否能够从检索到的文档片段中推断(entail) 或直接找到。提示词要求 LLM 给出是/否的判断,并可以附上依据。
  • 忠实度得分:计算被判定为有文档支撑的声明数占总声明数的比例,作为忠实度分数。得分范围 0-1,1 表示完全忠实,没有幻觉。

  • 优势:利用 LLM 的强语义理解进行细粒度核查,无需人工标注参考,完全自动化且可解释(能指出哪个声明不被支撑)。

对答案相关性的评估:

  • 核心思想:评估生成的答案是否与用户问题相关,是否回答了问题,而非答非所问。

  • 方法:

  • 反向问题生成:使用 LLM 根据生成的答案,自动生成若干个问题,要求这些问题必须只能由该答案来回答,以捕捉答案的关键信息点。
  • 语义相似度计算:计算生成的问题与原始用户问题之间的语义相似度(如使用余弦相似度,基于 embedding 模型如 text-embedding-ada-002)。
  • 答案相关性得分:对每个生成问题与用户问题的相似度取平均,得到最终相关性得分。这实质上衡量了答案与用户意图的契合度。

  • 优势:避免了直接比较问题和答案的困难,通过反向生成问题巧妙地将评估转化为语义匹配,具有良好的一致性。

RAGAS 的评价维度还包括:

  • 上下文相关性(Context Relevancy):检索到的文档是否精炼且与问题相关,无冗余。

  • 上下文召回(Context Recall):检索文档覆盖了真实答案所需的信息比例(需要参考标准答案)。

  • 其他:如批评(Critique)维度,评估无害性等。

总结:RAGAS 通过一系列基于 LLM 的自动化流程,为 RAG 系统提供了一套完整、可解释且无需大量人工的评估方案。其忠实度评估直接针对幻觉问题,是当前 RAG 评估中最受欢迎的方法之一。


如何评估模型“知道何时不知道”的能力?有哪些指标?

评估模型知识边界诚实度或自知之明,即“知道何时说不知道”,需要度量模型在不确定或不知情时能否拒绝猜测、表达不确定性或承认局限。

评估指标:

(1)拒答率(Refusal Rate)

  • 对于一组专门设计的不可回答问题(如询问未来事件、虚构实体、无解问题),计算模型明确拒绝回答或表达不知道的比例。拒答形式包括:“我不知道”、“无法确定”、“我的知识截止于...”等。

  • 挑战:需定义什么是合格的拒答,避免过于生硬(“作为一个AI模型...”)的模板被简单计分,也要考虑模型在拒答同时是否提供了部分相关但无伤害的信息。

(2)幻觉风险下的校准错误率

  • 对可回答和不可回答问题的混合集,计算两个指标:
  • 误拒率(False Refusal):对于明明知道的知识,却错误地表示不知道的比例。
  • 误答率(False Answer):对于不知道的问题,却强行给出错误答案(幻觉)的比例。

  • 综合衡量:平衡准确率(Balanced Accuracy) 或 F1 分数,同时优化这两者。

(3)不确定性表达覆盖率

  • 对于所有输出,检测模型是否使用了适当的认知动词或修饰语(如“可能”、“据报道”、“在大多数情况下”)。可以计算含不确定表达的陈述占所有事实性陈述的比例。理想情况是在不确定的事实上高亮不确定性,在确定的事实上语气肯定。这需要声明级的验证。

  • 指标:过度自信比率 = 在已被验证为错误或无法验证的声明中,模型以绝对肯定语气陈述的比例。越低越好。

(4)选择性预测指标

  • 模型为每个回答输出一个置信度分数(可通过prompt要求或基于概率)。计算:
  • AUROC / AUPRC:将置信度分数作为预测值,事实正确性作为标签,评估校准度。
  • 期望校准误差(ECE):衡量置信度与实际准确率的一致性。
  • 覆盖率与风险曲线:设定不同置信度阈值,拒绝低于阈值的回答,观察剩余回答的准确率和回答比例。曲线下面积(AUC)越高,表示模型越懂得根据置信度有选择地回答,知道何时该闭嘴。

(5)知识边界探测的精确度

  • 构造一批问题,其中一部分在模型训练数据中确定存在(高频事实),一部分确定不存在(虚构或极新)。看模型能否区分它们。可以使用探测任务的F1:正确预测“可回答”/“不可回答”的能力。

(6)自省式提示评估

  • 在模型生成答案后,追加提问:“你确定这个答案吗?可能正确吗?”,观察模型是否能自我发现错误并纠正。评估其自我纠错率和自我一致性。

(7)TruthfulQA 中的信息性-真实性曲线

  • TruthfulQA 指标设计将真实性与信息量结合,因为一直说“不知道”虽然真实但无用。通过分析不同提示下模型的答案,评估其在维持高真实性的同时能提供多少信息,这反映了模型“知之为知之,不知为不知”的综合水平。

这些指标共同刻画了模型在知识边界上的诚实度和自我认知能力,是负责任AI的核心要求之一。


目前主流排行榜(如 Chatbot Arena)是否充分反映幻觉水平?

不完全充分。 主流排行榜如 LMSYS Chatbot Arena(基于 Elo 分数的人类偏好投票)主要衡量人类对模型回答的整体偏好,而非专门针对幻觉的系统性评估。其反映幻觉水平存在局限。

为何不充分:

  • 偏好不等于真实性:用户投票时往往被流畅度、文采、共情、长度、格式等表面质量所左右,容易忽略其中隐秘的事实错误。一个流畅但有幻觉的回答可能比一个生硬但正确的回答获得更高票数。

  • 缺乏系统的幻觉覆盖率:Arena 的问题来自开放式用户随机输入,虽然覆盖广,但并不能保证对事实密集型、高风险领域(医疗、法律)、时效性问题、知识边界问题进行专门的压力测试。模型可能会在常规对话中表现良好,但在特定幻觉触发场景下失败,这种弱项难以在随机的Arena中充分暴露。

  • 无细粒度幻觉标注:投票仅给出A vs B 或评分,并不要求用户识别和标记回答中的幻觉片段。因此无法量化幻觉率,不知道模型的具体错误类型和频率。

  • 时效性问题:排行榜分数是一段时间内的静态排名,而幻觉可能与模型版本、知识截止日期密切相关,动态排行榜无法实时反映模型的时效性幻觉风险。

  • 评估者的能力差异:用户来自不同背景,大多缺乏专业事实核查能力,无法准确判断回答的真实性,特别是需要专业知识时。这导致幻觉可能被大量非专业投票所掩盖。

排行榜的补充价值:

  • 可以从宏观上反映模型的安全/无害对齐情况,如果某个模型经常产生明显有害的幻觉,可能会在用户满意度中体现出极低分数。

  • 结合社区反馈和具体案例,排行榜可以间接揭示某些模型存在严重的幻觉倾向。

改进方向:需要专门的幻觉排行榜(如 TruthfulQA 榜单、HaluEval 榜单、FActScore 榜单)来补充,这些榜单专注于事实性和忠实性。理想的全面评估应结合人类整体偏好(Arena)与专项可信度评估(幻觉基准),才能对模型能力有完整认知。


如果让你从零设计一个幻觉评估体系,你会包含哪些维度和方法?

从零设计一个全面的幻觉评估体系,我会采用多维分层、自动+人评融合、静态+动态覆盖的架构,确保能够捕捉各种幻觉类型,并适应不同应用场景。

一、评估维度体系(5大维度,15+子维度)

  1. 事实性 (Factuality)
  2. 世界知识准确性(常识、实体、关系)
  3. 数值与日期精确性
  4. 时效性(动态基准,如 FreshQA)

  5. 忠实性 (Faithfulness)

  6. 对源文/上下文的支撑度(无依据添加、遗漏、歪曲)
  7. 对检索文档的忠实度(RAG场景)
  8. 对用户指令的依从度

  9. 一致性 (Consistency)

  10. 局部一致性(相邻句子)
  11. 全局一致性(全文/全对话)
  12. 多轮对话状态一致性(记忆漂移检测)

  13. 知识边界诚实性 (Honesty about Knowledge)

  14. 对不可回答问题的拒答恰当性
  15. 不确定性的正确表达(校准度)
  16. 自我矛盾与自我纠正能力

  17. 安全与鲁棒性 (Safety & Robustness)

  18. 对对抗性提示的抵御(拒答/纠正而不是产生有害幻觉)
  19. 偏见性幻觉(刻板印象驱动的虚构)
  20. 来源可靠性(引用真实性)

二、方法体系(三层金字塔)

第一层:快速自动化指标扫描(全量)

  • 使用 AlignScore、SummaC、实体F1、熵与概率等轻量级指标进行全样本粗筛,标记高风险片段。

  • 结合 SelfCheckGPT 思路,对开放域进行多次采样一致性评估。

第二层:深度自动化核查(高风险样本)

  • 原子事实分解 + 检索增强NLI(类似FActScore):
  • 用 LLM 将生成文本拆分为原子声明。
  • 对每条声明,动态检索外部知识库(维基百科、实时搜索引擎、领域数据库)。
  • 使用专用 NLI 模型(如 FactualNLI 微调版)判断证据是否蕴涵声明,计算幻觉密度和类型分布。

  • RAGAS 框架用于RAG场景的忠实度与上下文相关性自动评分。

  • 自相矛盾扫描:NLI滑动窗口 + 规则检测。

  • 强模型裁判:利用 GPT-4 + 精细提示 对中等样本量进行多维度打分,作为自动指标的补充和校准。

第三层:专家人工精评(小规模金标)

  • 分层抽样约5%-10%的样本,覆盖边缘案例和所有高风险类别。

  • 设计标准化多维打分方案(参见第16题的人评方案)。

  • 由领域专家进行细粒度标注(高亮幻觉span、标记错误类型、修正建议)。

  • 人工结果用于:① 校准自动指标;② 训练更好的自动评估器;③ 最终决策高风险场景。

三、测试集构成(动静结合)

  • 静态基准集:TruthfulQA, HaluEval, FaithDial, SummaC Benchmark 等,用于横向对比和基础能力测试。

  • 动态时敏集:FreshQA,定期更新,检验时效性幻觉。

  • 对抗与压力测试集:自行构建(知识冲突、逻辑陷阱、长文本远距离矛盾、错误前提等),评估鲁棒性。

  • 真实生产数据:从模型实际线上服务中采样,反映真实分布下的幻觉表现,避免基准过度拟合。

四、持续评估与反馈闭环

  • 建立 CI/CD 流水线,在模型每次更新时自动运行全层级评估。

  • 将检测到的幻觉自动转化为训练数据(DPO对),反哺模型优化,形成“检测-修正-重训”闭环。

  • 可视化仪表盘:实时展示各维度幻觉率、高发错误类型、趋势变化,支撑模型治理。

五、应用定制化

  • 针对不同领域(医疗、法律等),替换相应知识库和人工专家池,并调整维度权重(如医疗将安全性权重提到极高)。

  • 针对多语言,集成多语言检索、多语言NLI和当地文化专家。

通过这样一套完整、分层、闭环的体系,可以实现对模型幻觉系统化、可操作、可信赖的管理。