二、自动化评测指标与经典基准
困惑度(Perplexity)在大模型评测中的作用和局限是什么?¶
困惑度(Perplexity, PPL) 是语言模型最基础的自动评估指标,衡量模型对给定文本的预测能力。它定义为模型预测序列的平均负对数似然的指数:

作用:
-
模型选择与训练监控:在预训练阶段,PPL是验证模型收敛情况、比较不同模型架构或训练设置的核心指标。较低的PPL意味着模型对训练数据的分布拟合得更好。
-
领域适配:可用于评估模型对特定领域文本的适应性,领域内的低PPL表明模型较好地掌握了该领域的语言统计规律。
-
内在基准:在一些情况下,PPL可用于快速对比模型在大量未标注文本上的通用语言能力,成本较低。
局限:
-
不能直接衡量生成质量:PPL仅度量模型“理解”文本的概率,而不评价其自由生成文本的连贯性、创造性、事实性、安全性等。一个低PPL的模型可能在生成时产生大量重复、无意义或有害内容。
-
严重依赖测试数据分布:PPL的高低极大程度上受测试集文本领域、风格和难度的影响。在新闻文本上PPL低的模型,可能在社交媒体或专业论文上PPL很高。跨数据集比较PPL无意义。
-
对不确定性不敏感:PPL鼓励模型对测试集中所有token赋予高概率,包括那些实际上可以有多种合理选择的词汇。这导致PPL偏好的模型可能偏向保守和重复,缺乏多样性和创造力。
-
对长尾和事实性无感知:PPL无法反映模型是否正确记忆了事实。模型可以通过常见的模板“合理”预测下一个词,即使事实错误,只要语言上符合分布,PPL仍可能较低。
-
评估偏差:模型在训练时就是优化似然,PPL作为评估指标有循环论证之嫌,并且容易受到 tokenization 方案、序列长度处理等因素影响。
结论:困惑度是模型内在能力的“温度计”,适合开发和消融实验,但不能作为面向最终用户的大模型质量的代理指标。
为什么困惑度不能直接衡量生成文本的质量?¶
困惑度衡量的是模型对给定文本的似然,而不是模型自生成文本的质量,这一根本差异导致它无法直接评价生成质量。具体原因:
(1)评估对象不同
-
PPL评估的是“如果这段人类撰写的优质文本出现在我的训练分布中,我会有多惊讶”。它完全是在人类文本上计算,不涉及模型自身的生成行为。
-
生成质量关注的是模型自主采样的文本是否连贯、有用、忠实。一个模型可能在人类文本上PPL很低,但其自采样文本可能充满重复、矛盾或事实错误,这是因为解码策略会偏离模型的高概率区域。
(2)奖励“保守”而非“优秀”
- PPL鼓励模型将所有人类文本中的词汇赋予极高概率。然而,优秀的生成往往需要在多种合理延续中做出创造性选择,这种不确定性在PPL计算中反而被惩罚。因此PPL最低的模型往往是过度保守、缺乏多样性的模型。
(3)忽略全局结构与逻辑
- PPL是逐token计算的局部度量,对远程一致、文本整体结构、因果逻辑、事实准确性完全失明。一段言辞华丽但前后矛盾、充满事实幻觉的文本,其逐字概率可以很高,PPL会给出错误的高评价。
(4)无法反映用户感知质量
- 用户关心的流畅性、帮助性、情感契合度、安全合规等,没有一项能通过下一个词的概率反映。两段语言风格截然不同的回复,可能拥有相近的PPL,但在用户满意度上却有天壤之别。
结论:困惑度衡量“理解”,而非“生成”。它可能作为底层模型训练的一个必要检查点,但对最终生成质量的评估,必须依赖其他专门设计的指标、人类评估或强模型裁判。
BLEU 和 ROUGE 这类词重叠指标的致命缺陷是什么?在LLM评测中是否已过时?¶
BLEU 和 ROUGE 分别是机器翻译和自动摘要领域经典的 n-gram 重叠指标,它们的致命缺陷在评估大模型的开放式生成时被极度放大。
致命缺陷:
-
忽略语义与同义性:仅基于精确词汇匹配。两个语义完全等价的句子,若用词不同(如“迅速” vs “快速”),重叠分数会非常低。这在生成式模型丰富多样的表达面前成为致命伤。
-
无法区分信息重要性:所有词被视为同等重要。一个关键数字的错误(“营收增长2%” 误说成 “20%”)在分数上的惩罚可能与一个冠词变动相当,完全不能反映事实错误的严重性。
-
对添加和遗漏不敏感:生成文本添加了大量合理但未经源文证实的细节(幻觉),只要没有与参考文本的n-gram重叠,分数不会显著受影响。同样,遗漏核心信息也可能被其他词的重叠掩盖。
-
依赖一个或少量的参考文本:大模型的开放式生成没有唯一标准答案。以单个参考译文或摘要做对比,会严重低估那些表达不同但同样优质甚至更优的生成结果。
-
长度与截断问题:需要复杂的长度惩罚和截断策略,但这些参数对不同任务不通用,调节不当会导致分数失真。
是否已过时?
在评估 LLM 的自由文本生成(尤其是对话、创意写作、长文本生成)时,BLEU/ROUGE 已经基本过时,不能作为主要的质量指标。它们仍然可以用于:
-
受限的快速回归测试:在参考输出非常固定的场景(如某些特定格式的信息提取),仍有作为弱信号的参考价值。
-
作为复合指标的一个非常小的组件:与其他语义指标结合时提供词汇层面的辅助信息。
但在任何严肃的 LLM 评测中,研究者已转向基于语义嵌入(BERTScore)、自然语言推理(NLI)、问答(QAGS)、大模型裁判等更智能的指标,BLEU/ROUGE 单独使用将严重误导结论。
METEOR 相比 BLEU 做了哪些改进?¶
METEOR 针对 BLEU 对精确词汇匹配过于严苛的问题,引入了多项改进:
(1)引入语义级别的匹配(词形与同义词)
- 词干化与同义词库:METEOR 不仅匹配完全相同的词形,还通过词干提取和外部同义词资源(如WordNet)将语义等价的词视为匹配。例如,“running” 和 “run” 能匹配,“happy” 和 “glad” 能匹配。这在BLEU中只能算作完全不匹配。
(2)平衡精确率和召回率
- BLEU 主要偏向精确率(生成文本中的n-gram有多少在参考中),通过简洁惩罚间接考虑召回。METEOR 显式地计算生成文本与参考文本之间的单字匹配召回率和精确率,并计算两者的调和平均(F值)。这使得它能更好地惩罚信息遗漏。
(3)引入词序惩罚
- METEOR 考虑了匹配词在生成文本和参考文本中的顺序一致性。它将匹配词序列分组为“块”,块越少说明词序越一致。通过对块数施加惩罚,METEOR 能区分词袋相同但语序混乱的输出。
(4)单阶段综合评分
- METEOR 将精确率、召回率、词序惩罚整合为一个单一的得分,并对召回赋予更高的权重,因为研究发现召回与人工判断的相关性更高。这避免了像BLEU那样多个n-gram分数需要几何平均带来的复杂性。
总体而言:METEOR 在句子级评测上相比 BLEU 有更显著的人工相关性,尤其是在允许灵活表达的任务中。但在处理深层语义理解和事实一致性时,仍受到词级匹配框架的根本限制。
BERTScore 如何利用上下文嵌入计算相似度?它的优势在哪?¶
BERTScore 彻底抛弃了表面的 n-gram 匹配,转而使用预训练语言模型(如BERT)产生的上下文嵌入来衡量生成文本与参考文本的语义相似度。
工作原理:
-
嵌入获取:将生成文本和参考文本分别输入同一个预训练模型,取模型某一层(或多层组合)的每个token的上下文向量。
-
相似度矩阵:计算生成文本中每个token与参考文本中每个token的余弦相似度,形成相似度矩阵。
-
贪心匹配:对于生成文本中的每个token,找到参考文本中与之余弦相似度最高的token,将其相似度作为该token的“召回”贡献。对称地,对于参考文本中的每个token,也在生成文本中找最佳匹配,计算“精确率”贡献。
-
聚合:将所有token的匹配分数平均,得到BERTScore-Precision、BERTScore-Recall,并计算F1。可以选择基于重要性的加权(如IDF),削弱常见词的权重。
优势:
-
跨词汇语义匹配:能识别“轿车”与“汽车”高度相似,即使它们表面完全不同。这使它极大改善了对同义改写和灵活表达的包容度。
-
上下文感知:同一个词在不同语境下的向量不同,能部分处理一词多义。
-
无参考的扩展能力:由于只需源文和生成文本,不需要人工预先定义同义词库,且在不同领域泛化好。
-
与人类判断的相关性显著提升:在摘要、翻译等任务上,BERTScore 与人类评估的相关性远超 BLEU/ROUGE。
-
细粒度可解释性:可以通过相似度矩阵可视化,看出哪些部分匹配得好,哪些部分存在语义差异,辅助错误分析。
局限:它仍然依赖于参考文本,且对需要深层逻辑或事实校验的场景不够直接。此外,嵌入模型的训练数据和偏差也会影响评分。
BLEURT 是基于什么理念设计的?为什么它比简单嵌入相似度更准?¶
BLEURT 是一种基于学习的文本生成评估指标,它的核心理念是:训练一个模型,直接预测人类评分者对生成文本的判断,而不是通过手工设计的相似度公式。
设计理念:
-
预训练+微调范式:先用大量合成数据预训练BLEURT,使其学习通用的文本质量概念和语义差异,然后在人工标注的评分数据集上进行微调,使其精确拟合人类的评价标准。
-
合成数据预训练:通过随机扰动维基百科句子(如掩码、替换、回译)生成大量“正确-错误”文本对,并赋予自动的语义相似度得分作为训练信号。这让模型在没有人类标签的情况下学会了识别多种文本质量缺陷。
-
输入形式:直接接收一对句子(参考和生成),输出它们之间的相关性或质量分数。它不依赖明确的 token 匹配规则,而是通过全连接神经网络端到端地学习评分函数。
为什么比简单嵌入相似度更准?
-
面向评估优化:BERTScore 基于静态的余弦相似度,其嵌入模型并未针对“评估”任务优化。BLEURT则专门训练来最小化与人类判断的误差,能捕捉到更复杂的评估准则,如事实一致性、风格适切性、逻辑连贯性等。
-
能够学习非线性的质量判断:简单的嵌入相似度是线性运算,而BLEURT通过多层神经网络,可以学习到例如“添加一个否定词会使分数急剧下降”这种非线性的质量映射。
-
鲁棒性:对各种干扰和表达变化更稳健,因为它见过大量人工生成的错误案例。
局限:需要大量人工标注微调才能达到最佳效果,且作为黑盒模型,其判断逻辑的可解释性弱于 BERTScore。同时,它也继承了参考文本的依赖性。
什么是 BARTScore?它将评测视为什么问题?¶
BARTScore 是一种将文本评估形式化为生成任务的创新指标。它的核心思想是利用预训练的序列到序列模型(如BART),以条件生成概率来度量文本质量。
核心概念:
-
BARTScore 将评估问题转化为:给定一个文本(如源文)作为输入,评估另一个文本(如生成文本)作为输出时的条件似然。
-
对于忠实性评估,它计算
P(生成文本 | 源文),即模型看到源文后生成目标文本的概率。若生成文本忠实于源文,其条件概率应较高;若有幻觉,概率会降低。 -
对于精确性评估,可以反过来计算
P(源文 | 生成文本),衡量从生成文本中还原源文信息的能力,类似召回的概念。 -
最终得分通过对序列的对数似然取平均或加权得到。
将评测视为生成问题:
- BARTScore 将“评估”重新解释为“生成概率”。这种视角利用了 BART 等模型在大量文本上预训练的生成能力,隐式地编码了语法、流畅性和语义连贯性等知识,无需显式设计规则或额外标注。
优势:
-
一体化多维度评估:通过改变计算方向,可以用同一个模型评估忠实度、精确率和召回率等多个维度。
-
超越表面形式:相比 n-gram 和简单的嵌入匹配,它能够感知更深层的语义和结构化信息。
-
无需参考文本的可能性:在某些变体中,可仅依赖源文和生成文进行评估,减少对标准参考答案的依赖。
局限:计算成本相对较高(需要进行模型推理),对评估模型的性能敏感,并且其分数量纲和含义不如某些专有指标直观,但它的框架思想影响深远。
在代码生成评测中,Pass@k 指标如何计算?k 的含义是什么?¶
Pass@k 是衡量代码生成模型解决问题能力的核心指标,定义为:对每个问题,模型生成 k 个候选代码样本,如果其中至少有一个能通过所有单元测试,则视为该问题解决。最终 Pass@k 是所有问题的解决率。
公式与无偏估计:
-
记 n 为每个问题实际生成的总样本数(n ≥ k),c 为这 n 个样本中能通过测试的样本数。
-
Pass@k 的无偏估计公式为:

- 这个公式通过组合数学,纠正了由于只生成有限 n 个样本而带来的选择偏差。计算的是“如果我们有无限预算,从模型分布中抽取 k 个样本,至少有一个通过的概率”。
k 的含义:
-
k 代表用户允许的最大采样次数或迭代次数。在应用中,如果模型生成的第一个代码不对,用户可以再要求生成一次,直至 k 次。
-
k 值越大,对问题的通过率容忍度越高。Pass@1 衡量模型“首次即对”的能力,是对模型直接解决问题能力的严格测试。Pass@10 或 Pass@100 则衡量模型在多次尝试后能够找到正确解的概率,体现了模型的潜在能力及测试时的搜索增益。
应用场景:
- 在 HumanEval 等基准中,常报告 Pass@1, Pass@10, Pass@100。Pass@1 最为关键,反映实际使用中的效率;较高的 Pass@k (k>1) 表明模型具有较强的“潜在”求解能力,可以通过后处理筛选或多次采样提升。
说明代码评测中“功能正确性”与“语义相似度”的差异,为何不能只看 BLEU?¶
功能正确性:代码是否满足指定的输入输出要求,即能通过所有测试用例。它关注的是执行结果,是代码质量的根本标准。
语义相似度:生成代码与某个参考代码在文本层面的相似程度,通常使用 BLEU、ROUGE 或 token 匹配来衡量。
关键差异:
-
表象 vs 本质:两段代码可能逻辑完全等价但写法迥异(例如,用
for循环代替while循环,变量命名不同),BLEU 等会给出极低的相似分,但它们在功能上完全正确。 -
错误等价性缺失:一个逻辑严重错误但碰巧与参考代码共享大量关键字的代码,可能获得较高的 BLEU 分数,但运行会完全失败。
-
唯一与多样:同一个编程问题有无数种正确实现。以单一(或几个)参考代码来衡量所有正确解,从根本上否定了编程的创造性和多样性。
为什么不能只看 BLEU:
仅看 BLEU 会导致:
-
鼓励复制而非创造:模型会被奖励去死记硬背训练集中的特定实现模式,而非学习通用编程逻辑。这将使其在面对稍有不同的新问题或需求时泛化能力极差。
-
误导优化方向:研发团队若用 BLEU 选模型,会选出一个“看起来像标准答案”但常编译不过、逻辑不通的模型,其实际可用性极低。
-
完全无法捕捉运行错误:BLEU 对语法错误、类型不匹配、边界条件处理失败等致命缺陷完全失明。
因此,代码生成领域的评测主流已转向以测试用例通过情况(Pass@k, 执行匹配)为金标准,辅以功能等价性验证和人工审查,文本相似指标仅作为极弱的参考或已基本被弃用。
HumanEval 是如何评测代码生成模型的?它的测试用例有什么特点?¶
HumanEval 是一个用于评估代码生成模型功能正确性的基准数据集,由 OpenAI 提出,已成为该领域事实上的标准之一。
评测方式:
-
问题描述:包含一个函数签名(签名、文档字符串)和自然语言描述。模型需要根据这些信息完成函数体。
-
代码生成:对每个问题,模型生成一段完整的代码(通常是函数体)。为避免因生成格式不同(如多余的解释)导致无法执行,通常通过匹配提取代码块。
-
执行验证:将生成的函数与预先编写好的多个测试用例一起执行。如果在所有测试用例上,函数的输出都与预期输出完全一致,则该样本被视为通过(Pass)。
-
指标计算:计算 Pass@k(通常 k=1,10,100),评估模型在单次或多次采样下的问题解决率。
测试用例的特点:
-
手写且高质量:每个测试用例都经过精心设计,不仅测试典型用例,还覆盖边缘情况和特殊输入,确保能够甄别出看似正确但实际有逻辑缺陷的实现。
-
隐藏测试:HumanEval 的测试用例通常分为公开的示例测试(在文档字符串中)和用于最终评分的隐藏测试。这防止了模型仅仅记忆或过拟合示例输入输出,迫使模型真正理解需求。
-
独立可执行:每个问题是一个独立的编程任务,测试用例使用Python标准库,确保了评测环境的干净和可复现。
-
侧重于语言理解和算法逻辑:测试不依赖外部库或复杂框架,重点考察模型将自然语言描述转化为正确算法的能力,以及处理基础数据结构、控制流和简单数学推理的能力。
局限与补充:HumanEval 主要覆盖基础编程能力,对于涉及外部API调用、复杂系统设计、并发处理等真实世界大规模编程任务的评估有限。因此常与 MBPP、APPS、CodeContests 等更复杂的基准联合使用,以全面评估代码生成模型的水平。
MBPP 与 HumanEval 的主要区别是什么?¶
MBPP(Mostly Basic Programming Problems) 和 HumanEval 都是衡量代码生成模型功能正确性的基准,但在设计哲学、题目构成和评测方式上存在明显差异。
主要区别:
总结:
-
HumanEval 题目更精心设计,测试用例更严格,是衡量模型“深度推理”的黄金标准。
-
MBPP 题目量大,覆盖面广,适合衡量模型在大量基础编程任务上的稳定性和通用编程能力。
-
两者常配合使用:HumanEval 评估上限,MBPP 评估底线和泛化。
GSM8K 和 MATH 分别侧重考查什么数学能力?各有何特点?¶
GSM8K 和 MATH 是两个广泛使用的数学推理基准,它们的设计理念和评测重点有显著不同。
GSM8K
-
侧重能力:多步算术推理与应用题解决。主要考察模型阅读一个用自然语言描述的数学情景,提取数量和关系,并执行多步计算以得出最终数值答案的能力。
-
特点:
- 题目全部是小学数学应用题,难度主要在于多步推理而非深层数学知识。
- 通常有明确的链式推理过程,被称为“Chain-of-Thought”的典型测试床。
- 答案是整数或简单小数,易于自动校验正确性。
- 评测指标:最终答案的准确率(Exact Match),通常配合思维链提示实现。
MATH
-
侧重能力:复杂数学问题解决,涵盖更广泛的数学领域(代数、几何、数论、微积分等)和更高难度(高中数学竞赛水平)。
-
特点:
- 题目难度高,需要扎实的数学知识和抽象推理能力,非简单算术累加。
- 答案形式多样,包括有理数、表达式、集合等,需要更复杂的归一化和等价判断。
- 通常需要模型进行多步的符号推导和公式运用,比GSM8K更考验真正的数学能力而非语言解析。
- 评测指标:答案的准确率,要求非常严格,自动判分较复杂。
对比总结:
-
GSM8K 是推理链的流动性测试,考察模型是否具备“慢思考”解决复杂文字题的能力。
-
MATH 是数学知识与深度推理的综合测试,考察模型对高等数学的掌握和问题解决力。从GSM8K到MATH,体现了从基础算术推理向高水平数学竞赛的跃迁。
如何评价一个模型在多语言任务上的表现?常用哪些基准?¶
评估模型的多语言能力需要跨语言覆盖、任务多样性,以及公平的比较机制。
评价方法:
-
多语言基准覆盖:选取覆盖多种语系、不同资源程度的语言的基准。
-
直接评分与跨语言迁移:对于有监督任务,评估模型在低资源语言上的零样本/少样本性能;对于生成任务,评估跨语言的一致性和翻译式幻觉。
-
公平比较:使用相同的提示模板和评估协议,或采用语言自适应的评估。关注模型在每种语言上的绝对得分和相对于英语的退化比例。
常用基准:
-
XGLUE / XTREME:覆盖分类、结构预测、问答、检索等多任务,包含数十种语言,是预训练多语言模型的标准评测套件。
-
Flores-200:机器翻译基准,支持200种语言,评估翻译质量和多语言生成的覆盖度。
-
MGSM:多语言小学数学,是GSM8K的翻译版,直接评估多语言推理能力。
-
XLSum:多语言摘要,涵盖多种语言新闻,评估生成质量。
-
Belebele:多语言阅读理解,专门设计来考察长尾语言。
-
Global-MMLU:MMLU的多语言翻译版,评估多领域世界知识的跨语言泛化。
关键点:好的多语言评测应不仅看总平均,更要关注语言间的公平性和低资源语言的表现,防止模型只是“西方语言专家”。
MMLU 如何涵盖多领域知识?为什么它成为通用评测的重要基准?¶
MMLU(Massive Multitask Language Understanding) 通过汇聚大量学科的选择题来测试模型的多领域知识掌握程度。
涵盖方式:
-
包含57个子任务,横跨STEM(科学、技术、工程、数学)、人文科学、社会科学及其他领域。
-
题目来源于各类教科书、考试(如律师资格考试、医学执照考试)等,确保知识的专业性和广泛性。
-
每个子任务有至少100道四选一的选择题,覆盖从基础概念到专业深度的不同难度。
为什么成为重要基准:
-
通用知识尺度:广泛的主题使得MMLU得分可以作为一个总体的知识水平指标,代表模型在多大程度上接近人类的百科知识广度与深度。
-
高区分度:题目的专业性和难度使得不同能力的模型之间分数差距显著,极少出现天花板效应,适合追踪模型进展。
-
客观与易于自动化:选择题形式使得评分完全客观、可自动化,适合大规模、快速评测。
-
社区认可度:已成为各大模型发布时的必报指标,具有极强的横向可比性。
因此,MMLU 在某种程度上已成为衡量大模型“知博”水平的标准标尺。
HellaSwag 测的是什么能力?它如何通过对抗性筛选构建难例?¶
HellaSwag 评估的是模型的常识推理和上下文后续预测能力,要求模型从四个候选句子中选出最可能合乎逻辑的下一句。
具体能力:理解一个日常情景描述(如视频片段或WikiHow步骤)后,推断出最符合物理世界常识的合理延续。这需要模型具备关于物体属性、人物意图、因果关系等的深层常识,而不是仅仅依赖语言统计线索。
对抗性筛选构建难例的方法:
-
初始数据集通过人工撰写或自动生成来获取大量正负例。
-
关键步骤是对抗性过滤(Adversarial Filtering):用一个较弱但具有一定能力的语言模型(如BERT)在这些负例中进行选择。经过多轮迭代,始终保留那些当前模型容易混淆、会赋予高概率的迷惑性负例,并剔除那些很容易被识别的低质量负例。
-
最终留下的负例在语言上极其通顺,语法上完美,但在常识上却存在细微的错误,只有真正理解了场景的内在逻辑才能区分。
-
结果是一个“人类觉得容易,模型觉得极难”的数据集,因此得名“HellaSwag”。
这种方法使得 HellaSwag 成为衡量模型是否具备稳健、深层常识理解的强有力工具。
解释 ARC 评测集的挑战性,它如何测试模型的常识推理?¶
ARC(AI2 Reasoning Challenge) 是一个极具挑战性的科学常识推理评测集,专门用于测量模型超越表面语言模式、进行深层推理的能力。
挑战性来源:
-
题目来自中小学科学考试,但经过精心挑选,剔除了那些仅靠简单的语料库共现或信息检索就能答对的题目。
-
问题需要综合常识、科学知识和逻辑推理,比如理解基本物理原理、生物过程、空间关系、实验设计等。
-
存在一个Challenge Set,专门由那些基于纯统计共现(如点互信息)无法正确回答的题目构成,直接考验模型的真推理能力。
如何测试常识推理:
-
给出一个科学相关的问题和四个候选答案,模型必须选出正确的一个。问题常常描述一个具体情景,并要求推理出原因、结果或可行的解决方案。
-
要求模型不仅知道单个事实,还能将它们串联成因果链。例如,需要理解“摩擦生热”的原理,并应用到“为什么雪地里走路会累”的情景中。
-
ARC 能有效区分“背诵知识的模型”和“会推理的模型”。
重要性:它表明即使在知识层面接近饱和,真正的推理能力仍是当前大模型的一大瓶颈,是通往更深层次理解的关键测试。
BIG-Bench 给大模型评测带来了哪些启示?它的任务多样性体现在哪里?¶
BIG-Bench(Beyond the Imitation Game Benchmark) 给大模型评测领域带来了范式性的启示。
启示:
-
突破传统基准:传统基准过于狭窄,不能反映大模型涌现出的多种能力。BIG-Bench 证明了大模型需要在极多样化的任务上评估。
-
发现涌现能力:通过包含超大规模任务,发现模型在某些能力上随规模增长出现断崖式提升(涌现),这是之前小范围评测无法观察到的。
-
社区驱动共建:由大量研究者众包贡献任务,汇集了远超任何一个机构能独立设计的评测广度。这种开放式协作是构建未来通用评测的关键模式。
-
超越性能分数:不仅测量分数,还分析模型的各种行为(如校准度、社会偏见、推理过程的自我一致性),推动了对模型行为和局限性的深层理解。
任务多样性体现:
-
涵盖超过200个任务,远远超过此前任何基准。
-
任务形式极度多样:传统NLP任务、逻辑谜题、棋类游戏、代码调试、幽默识别、物理模拟、道德推理、模因理解、概念构建等,几乎无所不包。
-
跨越多个模态(文本、少量图像)、语言(高资源和低资源)、以及认知能力(记忆、推理、创意、社会智能)。
BIG-Bench 的广度和深度使评测从“专业技能考试”升级为“通用智能体检”。
什么是“指令遵循”评测?IFEval 如何量化约束满足率?¶
指令遵循评测评估模型对给定自然语言指令中具体约束的执行能力,是考察模型“听不听话”的关键。例如,“用三段式回答,每段以标题开头”或“回答必须包含至少三个emoji”。
IFEval(Instruction-Following Eval) 是此类评测的代表作。它通过构造包含可自动验证的简单约束的提示词,来量化模型对指令的遵循程度。
量化方法:
-
设计大约20种不同类型的约束,如:长度限制(不少于X词)、关键词(必须包含“苹果”)、格式要求(必须用Markdown表格)、禁止项(不能使用“好”字)、语言切换(用中文回复)等。
-
对于每个提示,可以自动检查生成的回复是否满足这些约束,计算约束级别的满足率,然后对所有样本平均。最终指标是约束满足率。
-
这种量化完全自动化,避免了主观判断,使得对指令遵循能力的测评高度可靠和可复现。
价值:它将“指令遵循”这个原本模糊的能力,转化为精确、可计算的指标,使模型在任务执行可靠性上的比较成为可能。
MT-Bench 的设计思路是什么?多轮对话如何评分?¶
MT-Bench 是一个专为评估聊天模型多轮对话质量而设计的基准。
设计思路:
-
多轮场景:包含80个精心设计的多轮对话问题,覆盖写作、角色扮演、知识、推理等八大类常见用户场景。
-
两级对话:每个问题包含两个连续的轮次。第一轮提问后,模型作答;然后基于第一轮的回答追问一次,形成两轮交互。这考察模型在延续上下文时的理解、记忆和一致性。
-
强大模型裁判:使用GPT-4作为默认裁判,对每个回答以1-10分进行打分,评估维度包括有用性、相关性、深度、创造力以及细节水平等。通过提示词引导裁判给出精细评分和理由。
多轮对话评分:MT-Bench不是简单对单轮打分,而是评估模型在连续交互中的综合表现。它会评估模型是否记得前文,是否根据追问给出恰当且深入的回应,并保持风格与角色一致。这种多轮评分更能反映真实聊天场景下的用户体验,比单轮评测更具生态有效性。
AlpacaEval 2.0 的长度控制机制是怎样的?为何要做长度控制?¶
AlpacaEval 2.0 是一个基于强大模型裁判的自动评估基准,用于比较模型在开放式指令上的表现。它用裁判模型比较“待测模型的回复”与“参考模型(通常是GPT-4或text-davinci-003)的回复”哪个更好,输出胜率。
长度控制机制:
-
研究者和社区发现,原始的胜率指标严重受到回复长度偏差的影响:模型生成更长的回复往往会在裁判偏好中获得不公正的高分,即使额外内容没有实际信息量。这导致分数虚高,不能反映真实质量。
-
AlpacaEval 2.0 引入了一种基于回归的长度控制(Length-Controlled Win Rate, LC-WR)。基本思想是:通过统计模型学习一个“长度-胜率”曲线,然后将所有模型的胜率回退到假设它们在相同目标长度下的预期胜率。
-
具体做法是利用所有待测模型的样本数据,拟合一个逻辑回归模型,将回复长度作为协变量,以此来计算消除长度影响后的质量得分。
为何要做长度控制:为了剥离长度带来的混淆效应,让评测聚焦于模型回答的实质质量和正确性,而不是奖励“废话连篇”。这使比较更公平,防止模型通过简单堆砌字数来刷榜。
Chatbot Arena 依靠人类投票计算 Elo 分,其优势和潜在偏差是什么?¶
Chatbot Arena 是一个大规模在线平台,用户向两个匿名模型提问,并对他们的回复进行投票(更好/打平/更差),以此计算每个模型的Elo评分。
优势:
-
高生态有效性:真实用户在日常场景中评估,反映实际需求和满意度,比任何离线基准都更接近产品的真实价值。
-
大规模、动态:持续收集数据,不断更新,可以快速反映模型变化和社区偏好。
-
抗基准饱和:由于问题开放且持续更新,不存在固定题库被“刷爆”的问题,长期有区分度。
-
捕捉综合体验:不仅评估答案正确性,还涵盖流畅度、共情、安全性、格式等用户体验全貌。
潜在偏差:
-
用户群体偏差:投票者多为技术爱好者,其偏好和问法不一定代表普罗大众。
-
位置与呈现偏差:回复的顺序、格式美观度会影响选择,而非纯能力。
-
流行度偏差与风格偏好:模型可能因更“热情”、“话多”、“幽默”而获得虚高Elo,实际硬能力可能不如朴实但正确的模型。
-
安全与对齐的非专业评判:普通用户难以识别隐秘的幻觉或偏见,有害但“好听”的回复可能被选为胜者。
-
非控制变量:在线环境不可控,包括生成参数、系统负载等。
尽管有偏差,Arena通过庞大的数据量和盲评设计,仍成为当前最受关注的大模型众包评测之一。
什么是“自一致性”(Self-Consistency)在评测中的应用?它如何提升推理评测准确性?¶
自一致性是一种利用大模型随机性来提升推理任务准确率的集成方法,广泛应用于评测中。
原理:
-
对于同一个推理问题,使用非零温度让模型生成多条不同的推理路径和最终答案。
-
提取出各条路径的最终答案,然后进行多数投票(或按答案统计频率),选择最一致的答案作为最终输出。
在评测中的应用与提升准确性:
-
校准单次推理的随机波动:单次采样可能因随机性走入错误路径,产生幻觉。自一致性通过多路径聚合,将“低频随机错误”过滤掉,将模型隐藏的“高频正确理解”凸显出来,使得评测出的模型性能更接近其真实知识上限。
-
更稳定的分数:报告Pass@1(单次)的同时,报告自一致性下的准确率,能表明模型通过多次采样可达到的上限,体现模型的“潜能力”。
-
暴露不确定性:如果模型对一个问题毫无头绪,生成的多个答案会高度分散,低一致性也可以作为评估模型知识边界的一个信号。
注意:自一致性显著增加了推理成本,但作为评测工具,它能更准确地度量模型的深层推理能力而非碰运气,已成为数学和逻辑评测的标准实践。
在开放域问答中,如何衡量答案的正确性?精确匹配(EM)和 F1 的区别。¶
在开放域问答中,由于答案可能以多种形式表达,衡量正确性的主流指标是精确匹配(Exact Match, EM) 和 F1 分数,它们各有侧重,常配合使用。
精确匹配(EM):
-
定义:模型输出的答案经过标准化(如小写、去除标点、去除冠词)后,是否与任意一个标准答案完全一致。若完全一致则得1分,否则0分。
-
特点:评估极为严格,要求答案的表述与标准答案一字不差。这最适合事实类短答案,如人名、日期、地名等,能明确区分正确与错误。但它对同义表达完全不宽容(“USA” vs “美国” 等),会低估那些语义正确但措辞不同的回答。
-
优点:客观、易计算,排除了模糊判断。
-
缺点:过于死板,尤其不适合稍长的描述性答案。
F1 分数:
-
定义:计算模型输出与标准答案之间的词汇重叠情况。分别计算精确率(输出中的词有多少在答案中)和召回率(答案中的词有多少在输出中),然后取两者的调和平均。
-
特点:比 EM 更宽容,能够奖励部分正确的回答。通过衡量词级别重叠,可以捕捉到核心信息点是否被提及。通常使用 token 级别的 F1(如 SQuAD 的评估脚本)。
-
优点:能奖励同义短语或顺序不同的正确回答,对稍长答案更友好。
-
缺点:仍限于表面词汇,无法区分信息重要性(“不是”这样的词和专有名词权重相同),且对完全同义但用词不同的回答可能给出低分。
主要区别与选用场景:
-
EM 是“全或无”的精确评判,适用于评估模型精准输出简短事实的能力。F1 则是对正确性的软测量,适合长答案或允许释义的任务。
-
在许多 QA 基准(如 Natural Questions、TriviaQA)中,同时报告两个指标。EM 显示答案的完全正确率,F1 反映模型输出与答案的语义接近程度。实践中,F1 往往与人类判断的相关性更高,但 EM 更直观。
对于摘要任务,如何用事实一致性指标替代 ROUGE?举出至少两个专用指标。¶
ROUGE 基于词汇重叠,无法检测摘要是否忠实于原文(即事实一致性)。代替 ROUGE 的专用事实一致性指标主要有:
(1)SummaC
-
全称:Summarization Consistency。
-
原理:将源文和摘要句构成句子对,使用自然语言推理(NLI)模型判断源文是否蕴涵摘要句。它设计了两种粒度:零样本的句子级蕴涵判断和细粒度的片段级判断。分数越接近1,表示摘要越忠实于源文。
-
特点:无需人工标注训练,专门针对摘要的忠实度进行了优化,在多个摘要忠实度数据集上表现优异。它能检测出摘要中捏造的细节。
(2)FactCC
-
全称:Factual Consistency Checker。
-
原理:专门训练一个基于 BERT 的模型,输入(源文,摘要句)对,输出二分类(一致/不一致)或细粒度的错误片段。训练数据通过将真实摘要进行一系列自动扰动(如实体替换、反义词插入、数字修改)构造弱监督负例。
-
特点:能够进行细粒度错误定位,指出摘要中哪些词句与源文不一致。作为专用模型,比通用 NLI 对摘要中的幻觉更敏感。
其他重要指标:
-
QuestEval:结合问答(QA)和 NLI,通过自动生成问题并比较源文和摘要的答案来判断一致性,同时考虑精度和召回。
-
BARTScore 也可以用于忠实度评估,通过计算
P(摘要|源文)的概率来间接衡量。
这些指标共同点:均超越了表面词汇匹配,深入到语义推理层,直接检验“摘要是否说了源文中没有的话”,因此是替代 ROUGE 评估事实一致性的关键工具。
评测对话模型的多轮能力时,除了人工评判,有哪些可用的自动指标?¶
多轮对话的自动评测非常困难,但目前已有一些专门设计的指标和框架:
(1)基于强模型裁判的多轮评分
-
MT-Bench:使用 GPT-4 作为裁判,对每个两轮对话依次打分(1-10分),考察回答对对话历史的依从性和深度。它衡量了模型在多轮互动中的帮助性、连贯性。
-
Chatbot Arena 的自动代理:可以基于相同思想,用裁判模型在多轮交互中进行偏好比较。
(2)基于对话状态追踪(DST)的准确率
- 对于任务型对话,预先定义槽位(slot),通过自动模型抽取模型每轮回答中的槽值,与对话历史中用户确认的值进行比较,计算槽位一致性或状态更新准确率。这能量化模型是否“记住并正确更新”了关键信息。
(3)未来对话模拟与自洽性
-
Self-Consistency 扩展:让模型基于同一对话历史多次生成后续回答,检查关键事实的一致性。例如,在第二轮多次询问同一隐性问题,看答案是否稳定。
-
Factual Drift 检测:利用 NLI 模型检验模型的新回答是否与对话早期自己做出的陈述相矛盾。计算自我矛盾率。
(4)基于检索的上下文使用率
- 在 RAG 对话中,评估模型回复中是否有恰当引用,并通过计算回复中能在对话历史或检索文档中找到支撑的声明比例(类似忠实度)来衡量其多轮上下文利用能力。
(5)交互式自动评测环境
- 使用另一个强大的模型模拟用户,与待测模型进行多轮对话,然后根据任务完成情况和对话流畅度自动评分(如试购、预订场景)。这模拟了交互的真实动态。
目前,由于多轮对话的高度开放性,强模型裁判与特定任务的状态追踪是最实用的自动方案,但尚无法完全替代人工。
如何评估模型生成结果的多样性?Self-BLEU 和 Distinct-N 分别怎么用?¶
多样性是衡量生成模型避免重复、保持语言丰富度的重要指标,常用Self-BLEU和Distinct-N来衡量。
Self-BLEU:
-
用法:对一个模型生成的多个样本,计算两两之间的 BLEU 分数(类似衡量它们互相有多相似)。然后取平均值作为 Self-BLEU 分数。
-
解读:Self-BLEU 越低,多样性越高。如果模型总是生成相似的句子或模式,那么不同生成样本之间的 BLEU 会很高,Self-BLEU 高,表明多样性差。常用于评估故事生成、图像描述等。
-
优点:能整体反映生成集合的相似性。
-
局限:BLEU 本身的局限依然存在;计算量大(需要两两配对)。
Distinct-N:
-
用法:在生成的文本集合(或单篇文本)中,统计所有不重复的 n-gram 数量,除以总的 n-gram 数量。Distinct-1 看单词级别多样性,Distinct-2 看双词组多样性。
-
公式:
Distinct-N = 唯一n-gram数 / 总n-gram数 -
解读:Distinct-N 越高,多样性越好。高 Distinct-1 意味着模型用了大量不同的词汇,高 Distinct-2 表示短语模式多样,不是反复套用相同的搭配。
-
优点:计算简单,在句子或文档级别都容易使用。
-
局限:只反映词汇多样性,不能完全代表语义多样性(可能用不同词说同一件事),且极大值受长度影响。
综合使用:通常同时报告 Self-BLEU(评估样本间重复性)和 Distinct-N(评估词汇丰富度),并与人类对多样性的感知关联,形成较全面的多样性评估。
评估模型校准度(Calibration)的 ECE 指标是什么?大模型普遍校准度如何?¶
ECE(Expected Calibration Error,期望校准误差) 是衡量模型置信度是否准确的指标。一个完美校准的模型,当它说有80%把握时,实际应有80%的概率正确。
ECE 的计算:
-
将模型对所有样本的预测置信度(如正确选项的 softmax 概率)从小到大排序,划分入 M 个等宽的置信度区间(桶),如 [0,0.1], (0.1,0.2], ... , (0.9,1.0]。
-
在每个桶内,计算平均置信度与实际准确率的差值的绝对值,再按该桶样本数占总样本数的比例加权求和。

- ECE 越小,校准度越好,0 表示完美校准。
大模型普遍校准度:
-
普遍校准不佳,且出现“过度自信”:许多研究指出,经过预训练的大模型(尤其是未做针对性校准的)ECE 较高。它们在输出错误答案时的置信度往往与输出正确答案时一样高,甚至更高。也就是说,模型在“胡说”的时候并不知道自己在胡说,置信度虚高。
-
后训练对齐可能加剧校准恶化:RLHF 等虽然提升了输出质量,但有时会牺牲模型的校准度,因为人类偏好可能奖励那些语气肯定、确信的回答,导致模型为了高分而隐藏不确定性,进一步降低校准。
-
校准度与规模非单调:模型变大不一定提升校准度,有时更大的模型因为更强的记忆可能在某些错误知识上表现得更自信,导致校准更差。
改进:温度缩放(Temperature Scaling)是一种后处理方法,通过在一个保留集上调整 softmax 的温度参数,可以在不改变模型预测类别的情况下大幅改善 ECE。但对于生成式模型的自由文本输出,传统 ECE 需扩展到能处理开放式生成中的置信度表达。
如何评估模型对不确定性的表达?有没有专门基准?¶
评估模型表达不确定性的能力,不仅看它是否说“不知道”,更要看它能否在不确定时恰当使用模糊语言,在确定时给出肯定回答,且校准良好。
评估方法:
-
拒答率与恰当性:构造一批包含可回答问题和不可回答问题(如询问未来、虚构事物)的测试集。评估模型拒答或表达不确定性的比例,同时计算“误拒”(知道却说不知道)和“误答”(不知道却强行回答)的权衡。
-
口头置信度校准:要求模型在答案中附加其置信度(如“置信度:90%”),然后计算这些置信度的 ECE,看口头表达的概率是否与真实正确率一致。
-
语义不确定性检测:对同一问题多次采样,检查答案语义的一致性。若多次采样答案高度分散,而模型没有使用任何不确定措辞,则视为校准失败。
-
诊断测试集:专门设计题目,其答案具有固有的不确定性(如“明天的天气”),或信息不足无法确定,观察模型是否恰当表达。
专门基准:
-
TruthfulQA:虽然不是纯不确定性基准,但其评估框架区分了“真实”和“信息量”。模型一味说“我不知道”会因信息量低而得分低,这隐式地奖励了在已知和未知之间保持平衡的不确定性表达。
-
SelfAwareness / 知识边界数据集:一些研究构造了类似“Can you answer this question?” 的探测集,或利用知识库中的实体缺失构建问题,直接评估模型的元认知准确性。
-
Halueval 的某些子集:也包含对知识边界和不确定场景的评估。
核心挑战:如何让模型用自然语言输出可靠的置信度,以及如何将其与人类表达不确定性的方式对齐,仍是开放研究方向。
解释“检索增强评估”(RAG 评测)中的忠实度、相关性、上下文召回等指标。¶
在 RAG(检索增强生成)系统评测中,需要评估检索质量、生成质量以及二者协同的效果。常用框架如RAGAS定义了以下关键指标:
(1)忠实度
-
定义:生成的答案是否在事实层面上忠实于检索到的上下文文档,没有编造文档中不存在的信息。
-
计算:将答案分解为原子声明,对每个声明,验证它是否能从检索文档中推断出来。答案中被支持声明的比例即为忠实度得分。得分 1.0 表示答案完全基于检索材料,没有幻觉。
(2)答案相关性
-
定义:生成的答案与原始用户问题的相关程度,是否切题、回答了所问。
-
计算:利用答案反向生成若干问题(基于答案才能回答的问题),计算这些生成问题与用户原始问题之间的语义相似度(通过嵌入余弦相似度)。平均值即为答案相关性分数。得分高说明答案紧扣问题。
(3)上下文召回
-
定义:检索到的文档中,覆盖了真实答案所需信息的比例。衡量的是检索的全面性。
-
计算:需要有标准答案(参考)。将标准答案拆分为独立声明,对每个声明检查它是否能在检索到的文档中找到支撑。被支撑的声明比例即为上下文召回。得分低说明检索遗漏了关键信息。
其他常见 RAG 指标:
-
上下文精确度:检索到的文档中,有多少是真正相关的,衡量检索的精确性,惩罚无关噪声。
-
上下文相关性:检索文档整体与问题的相关程度,所有文档中相关文档的占比。
这些指标共同构成了对 RAG 管道端到端质量的细粒度诊断,帮助区分是检索没找对,还是模型没用好检索材料。
如果让你为一个新领域(如蛋白质设计)设计自动化评测指标,你会考虑哪些要素?¶
为蛋白质设计等专业性极强、有客观物理规律的领域设计自动评测指标,需要将科学真实性作为绝对核心,融合领域约束和任务特殊性。我会考虑以下要素:
(1)结构有效性与物理可行性
-
可折叠性与稳定性:利用蛋白质结构预测工具(如AlphaFold)评估生成序列能否折叠成稳定三维结构,计算pLDDT等置信度指标。不能稳定折叠的序列视为质量低下。
-
能量最小化:计算生成蛋白质的Rosetta能量、力场能量,更低且更稳定的能量反映更合理的物理设计。
-
无结构冲突:检查主链二面角(拉氏图)、空间位阻,评价是否落在允许区域。
(2)功能实现度量
-
功能位点匹配:若任务设计某种酶活性位点,必须使用结构比对算法(如TM-align)检查生成序列的关键残基是否在三维空间中正确排列,并与真实功能蛋白的保守距离模式匹配。
-
结合亲和力预测:对于设计结合特定靶标的蛋白,使用对接算法和结合自由能预测工具(如Rosetta的ddG)对生成结构进行评分,作为功能性的代理。
(3)序列多样性与新颖性
- 应用Distinct-N和Self-BLEU的衍生指标于氨基酸序列,评估模型是否能生成多样化且非天然的全新序列,而非总是复现训练集中的天然蛋白片段。结合与已知天然蛋白质数据库(如UniRef)的序列相似性搜索(BLAST),确保生成的新颖性。
(4)可合成性与实验约束
-
评估序列中是否含有难以合成的重复区段、低复杂度区域,或已知的有毒/致敏肽段模式。可以构建规则库和分类器进行过滤。
-
检查密码子优化、表达宿主偏好等实际合成可行性。
(5)多维度综合评测与帕累托前沿
- 上述指标(稳定性、功能性、新颖性、可合成性)往往相互冲突。最终设计一个多维度雷达图,并报告在关键维度(如功能-稳定性)上的帕累托最优集合,允许用户根据实际应用选择权衡方案。
通过这一套自动化指标,可以在不需要湿实验的情况下,对蛋白质设计的计算模型进行快速、多维且高度专业的评估,极大加速设计-测试-学习循环。