五、多维度能力评测(知识、推理、代码、对话等)
如何评估大模型的知识覆盖面?常用基准有哪些?各自侧重什么?¶
评估大模型的知识覆盖面,核心是测量其参数中存储的事实性知识的广度、深度和准确性。评估通常通过大规模、多领域的问答或填空题进行,考察模型能否准确回忆出特定实体、事件、概念及其关联信息。
评估方法:
-
知识问答基准:覆盖从常识到专业知识的各类选择题或开放式问答,量化模型在多领域的正确率。
-
知识探测:构造特定形式的三元组或句子,直接检验模型是否记住特定事实。
-
知识边界分析:通过控制实体的频率、领域等变量,分析模型在不同知识类型上的表现差异,找到知识盲区。
常用基准及其侧重:
-
MMLU:涵盖57个学科(STEM、人文、社会科学等)的四选一选择题,从初高中到专业考试难度。侧重广泛的专业和学术知识,是当前最通用的知识广度测量工具。
-
Natural Questions / TriviaQA:基于真实用户搜索查询和冷知识问答,答案相对简短。侧重开放域的事实回忆,要求模型从海量知识中精准提取答案实体,反映对百科知识的掌握。
-
ARC (AI2 Reasoning Challenge):小学科学考试题,但经过精心挑选去除了仅靠简单检索或统计共现即可答对的题目。侧重科学常识与深层推理的结合,不仅考察知识记忆,更考察灵活运用。
-
HellaSwag:虽然主要测常识推理,但其完成句子的任务要求深厚的情境常识。侧重动态常识和物理世界知识,即知道在特定场景下“接下来最可能发生什么”。
-
TruthfulQA:专门设计用来检测模型是否会复述训练数据中的常见谬误和虚假知识。侧重知识的真实性和校准度,即模型是否对错误知识具有“免疫力”。
-
WikiFact / FActScore:通过抽取维基百科中的事实来构造查询,侧重长尾实体和细粒度事实的验证,能精确定位模型对特定人物、地点等细节的记忆准确性。
综合评估框架:一个好的知识覆盖面评估不应仅看总分,还应分析模型在不同知识类别(STEM vs 人文)、不同实体频率(热门 vs 长尾)、不同时间跨度上的表现,从而描绘出立体的“知识图谱”。
解释“闭卷问答”评测,为什么它适合检验模型内部知识。¶
闭卷问答(Closed-book QA) 是一种评测范式,要求模型在不提供任何外部参考文档、完全依赖其自身参数存储的知识来回答问题。
评测方式:
-
给模型一个自然语言问题,如“谁发现了万有引力?”
-
模型必须基于其在预训练中内化的知识直接生成答案,不允许进行信息检索。
-
答案与标准答案比对,使用精确匹配或F1等指标衡量。
为什么适合检验模型内部知识:
-
直接探测量参数记忆:闭卷问答切断了模型与外部知识库的联系,将模型视为一个独立的知识主体。其表现直接反映了预训练阶段将海量文本信息压缩进有限参数的有效性和准确性。
-
测量知识的可访问性与组织度:不仅要求知识被“存进去”,还要求模型能够在被问及时,通过查询和理解,精准地“提取”出来。这测试了知识的编码质量和内部索引结构。
-
揭示知识盲区与扭曲:闭卷环境中,模型无法“偷看”答案,一旦记忆缺失或错误,就会被立刻暴露出来,产生事实性幻觉。这能清晰发现模型的知识边界,以及在哪些长尾或易混淆知识上容易出错。
-
模拟真实世界的高难度场景:很多现实交互中,用户不会预先提供参考资料。模型必须依赖内化知识进行即时应答,闭卷评测正是模拟了这种对模型自包含知识库要求最高的场景。
局限性:由于完全依赖内部记忆,闭卷评测对模型的知识截止日期极为敏感,无法衡量模型获取和利用新信息的能力。因此它常与“开卷”(检索增强)评测相结合,共同刻画完整的知识能力。
时效性知识(如最新事件)如何评测?如何构建动态更新的知识问答集?¶
评测时效性知识,旨在测量模型对知识截止日期后发生事件和新知识的掌握程度,以及是否会产生过时或编造的回答。
评测方法:
-
基于时效性问答:设计问题,答案会随现实世界时间推移而改变(如“现任联合国秘书长是谁?”、“最新的奥斯卡最佳影片?”)。
-
动态基准:使用不断刷新的基准数据集,包含最新事件,如 FreshQA、RealTimeQA。
-
拒绝编造测试:对于极新且无训练数据的事件,正确的行为是承认“不知道”。评测需区分模型是正确回答了最新知识,还是诚实地表达了知识边界,抑或是进行了幻觉编造。
构建动态更新的知识问答集的方法:
-
定期采集信息源:设定定时任务,从高质量新闻API(如NewsAPI)、维基百科最新编辑、权威机构(如NASA、WHO)官网抓取新信息。
-
自动生成问答对:
- 利用规则或语言模型,从新抓取的文本中自动提取关键实体、事件和数值,并生成自然语言问题和答案。例如,对于一条“X当选为Y国总统”的新闻,生成问题“谁在[时间]当选为Y国总统?”。
-
使用模板化生成,确保问题格式统一,答案形式可控。
-
人工与自动校验:
- 自动校验:使用多个独立来源交叉验证生成的答案一致性。若多个可靠来源信息一致,自动通过。
-
人工抽检:对每日新生成的题目,由审核人员(或经过训练的快速审核流程)随机抽样检查,确保没有错误信息。
-
版本管理与快照:为每次评测创建固定时间戳的评测集快照,使得不同模型可以在同一时间切片上公平比较。同时,题库会随时间不断更新,旧题可能因过时而移除或更新答案。
-
多级难度设计:包含“直接事实”(单跳)和“需要推理的时效组合”(多跳,如“对比今年和去年的诺贝尔文学奖得主的国籍”)。
通过这种“采集-生成-验证-快照”的流水线,可以源源不断地构建一个“活的”时效性知识评测集,使对模型“与世俱进”能力的衡量成为可能。
多语言知识的评测如何开展?跨语言迁移能力如何衡量?¶
多语言知识评测旨在了解模型在不同语言上对世界知识的掌握程度,以及是否将某种语言(通常为英语)中学习的知识有效地迁移到其他语言中。
开展方式:
-
多语言知识基准:将现有的英语知识基准翻译(或部分人工翻译)成多种语言。例如 Global-MMLU,MGSM(多语言小学数学),XQuAD(多语言阅读理解)。
-
跨语言一致性测试:对同一个事实,用多种语言向模型提问,检查其答案是否一致且正确。例如,用英语和中文分别问“水的化学式是什么?”,看模型是否都给出H₂O。
-
低资源语言专项探测:针对资源极少的语言,人工构造少量但高质量的知识问答对,测试模型在该语言上的知识表现,以及是否依赖于用该语言抓取的少量网络文本。
跨语言迁移能力的衡量:
-
零样本跨语言迁移:模型仅在英语(高资源语言)数据上训练(或微调),直接在其他低资源语言上进行评测。评分的高低直接反映了模型将英语知识泛化到其他语言的能力。高的零样本迁移率意味着模型内部建立了语言无关的知识表示。
-
跨语言知识差距分析:计算模型在各语言上的得分,并与英语得分进行比较。跨语言退化率 = (英语得分 - 目标语言得分) / 英语得分。通过这个指标,可以量化知识在不同语言间的流失程度。
-
翻译测试:将同一个知识问题用两种方式问:直接用目标语言提问,与先用英语提问、再将其回答翻译成目标语言。如果前者远差于后者,说明问题主要出在目标语言的理解或生成环节,而不是知识本身。这可以分解迁移过程中的哪一步是瓶颈。
-
探测多语言表示空间:利用探针分析,看不同语言中表达同一知识的句子在模型的隐藏层中是否具有相似的向量表示。表示越接近,跨语言迁移的理论潜力越大。
多语言知识评测暴露了当前大模型作为“英语知识翻译器”的实质,而非真正多语言知识主体,推动着更公平、更语言包容的模型研发。
推理能力评测主要分为哪几类?演绎、归纳、溯因推理如何考察?¶
推理能力评测可以大致分为三大类:演绎推理、归纳推理、溯因推理。此外,还包括数学推理、常识推理等更为具体的子类。
(一)演绎推理
-
定义:从一般性前提推导出特定结论。如果前提为真,结论必然为真。注重逻辑保真性。
-
考察方式:
- 三段论:提供大前提和小前提,要求判断结论是否成立。如“所有A是B,C是A,那么C一定是B吗?”
- 自然语言逻辑谜题:基于一系列约束条件进行逻辑推导,如“五人排座,A在B左边,C不在最右边,请问谁在中间?”,评测模型是否按逻辑步进求解。
- 蕴含识别:判断一段给定文本是否逻辑上蕴含某个陈述(NLI任务是其变体)。
-
代码执行推演:给出一段代码和输入,要求推断输出,本质是严格演绎。
-
典型评测集:符号逻辑数据集、BIG-Bench的逻辑谜题子集。
(二)归纳推理
-
定义:从特定实例推导出一般性规则或模式。结论不必然为真,但具有合理的概然性。
-
考察方式:
- 数列/图形补全:给出序列“2, 4, 6, 8, ?”要求推断下一个数字;或给出一系列变化的图形,要求找出模式并补全。这测试抽象归纳能力。
- 概念归纳:给出几个例子,要求归纳出它们共同的特征或分类规则。如“苹果、香蕉、葡萄都属于什么?”
-
类比推理:“A之于B,如同C之于?”,需要归纳A与B的关系,并将其应用到C上。
-
典型评测集:Raven渐进矩阵(非语言归纳)、抽象代数序列、一些BIG-Bench任务。
(三)溯因推理
-
定义:从观察到的现象出发,推断最合理的解释或原因。是诊断、侦探等领域的核心推理。
-
考察方式:
- 最佳解释选择:描述一个离奇现象,给出几个可能的解释,要求选择最合理的那一个。如“早上看到草坪是湿的,最可能的原因是什么?”(下雨 vs 洒水车)。
- 故事理解与完形填空:给出一段叙事,隐去其中某个原因事件,要求从选项中选出能最好解释后续情节的那个。
-
故障诊断:基于一系列症状或错误日志,推断系统故障的根因。
-
典型评测集:ARC的部分常识推理题本质上也是溯因;Social IQa中推断行为背后的动机;某些专门设计的医学诊断评测。
在实际评测中,这三种推理常混合出现,但设计独立的、针对每种推理类型的诊断性测试,有助于精细刻画模型的推理能力画像。
常识推理为什么是大模型的难点?Social IQA 等基准如何设计?¶
常识推理是大模型的“阿喀琉斯之踵”,因为它要求模型拥有未明说、但被人类视为理所当然的世界知识和社会认知。
为什么是难点:
-
隐性知识鸿沟:常识极少被显式写成文本,因为作者默认读者共享这些知识(如“人会饿”、“火焰是热的”)。模型从纯文本中很难学到这些“沉默的知识”。
-
无限组合与情境依赖:常识并非孤立事实,而是需要在特定情境下被激活和组合。一个行为可能在不同社会语境下有截然不同的含义,模型缺乏生活在真实世界中的体验来理解这些微妙之处。
-
统计共现的陷阱:模型学到的是表面共现,而非因果机制。例如,因训练数据中“吃饭”与“缓解饥饿”高频共现,模型可能答对,但面对反常识的干扰项时,容易因表面词汇关联而选错,并非真正理解。
-
幻觉的重灾区:当缺乏坚实常识基础时,模型会用其强大的语言能力拼凑出“听起来合理”但实则荒谬的答案,这就是典型的常识幻觉。
Social IQA 等基准的设计理念:
Social IQA (Social Interaction QA) 专门用于评测模型对社会常识的理解,即推断人类在特定社会情境下的情绪、动机和可能行为。
设计方法:
-
场景驱动:每个问题提供一个简短的日常社交场景描述。例如:“Sasha跑过去拥抱了Casey,因为Casey刚刚宣布了一个好消息。”
-
多角度提问:针对同一个场景,分别从三个维度提问:
- 动机/前因:“Sasha为什么拥抱Casey?”(情绪反应)
- 人物属性:“Casey可能是什么样的人?”(社会角色与性格推断)
-
后果/行为:“接下来Casey会做什么?”(社会预期行为)
-
精心构造的干扰项:每个问题有3个候选答案,其中干扰项不是随机生成的,而是由人类作者设计,在语言上与问题相关,但在社会常识上是错误或不合情理的。这要求模型必须进行深层社会推理,而非简单的词汇匹配。
-
高生态有效性:场景取材于真实人类互动,覆盖了广泛的社会情感(快乐、悲伤、尴尬、嫉妒等)和社交规范(礼貌、合作、竞争)。
通过这种精心设计的场景和有针对性的提问,Social IQA能有效探测模型是否具有“心理理论”的雏形,即能否推测他人的心理状态,而这是高级常识推理的核心。
数值推理与数学推理的区别,用哪些数据集测试?举出两个。¶
区别:
| 维度 | 数值推理 | 数学推理 |
|---|---|---|
| 焦点 | 从文本中提取数值、理解其关系,并进行基本算术操作 | 运用数学知识、公式、定理和抽象符号进行逻辑演算 |
| 核心挑战 | 自然语言理解、多步数量关系追踪、信息对齐 | 抽象建模、符号运算、数学归纳、空间几何想象力 |
| 典型操作 | 比较大小、排序、求和、求差、简单百分比 | 解方程、微积分、矩阵运算、概率模型、几何证明 |
| 背景知识 | 主要依赖问题文本,较少需要外部数学知识 | 需要扎实的数学概念和定理知识 |
| 难度 | 侧重语言与数值的结合,多步操作容易出错 | 数学本身的高难度抽象推理,复杂度远高于算术 |
数值推理数据集举例:
-
DROP:一个需要从段落中进行离散推理和数值操作的阅读理解数据集。模型需要定位相关数字,并进行加、减、排序、计数等操作来回答。例如,从一段足球比赛描述中,提取得分并计算总分。
-
NumerSense:专门用于评测模型对数字和常识的结合能力。给出一个句子,其中包含一个被掩码的数字,模型需要基于常识和语境推断出合理的数值。
数学推理数据集举例:
-
GSM8K:小学数学应用题。要求多步算术推理,但数学知识本身不深。核心测试模型将文字情景转化为逐步算式的能力。
-
MATH:涵盖代数、几何、数论等的高中数学竞赛级问题。需要深厚的数学知识、复杂公式推导和符号运算,难度远高于GSM8K。
简单说,数值推理是“读懂文字中的数并算对”,数学推理是“像数学家一样思考”。两者评测的维度截然不同。
数学推理评测中,“过程监督”和“结果监督”的评估框架有何不同?¶
在数学推理评测(及训练)中,这两种框架代表了不同的奖励和评估哲学。
结果监督:
-
定义:仅根据最终答案是否正确来给予奖励或评判。忽略模型得出答案的中间推理过程。
-
评估方式:提供一个二元的、稀疏的奖励信号。答案完全匹配标准答案则得1分,否则0分。
-
优点:评估极其简单、客观,易于自动化。不限制模型的思考路径,允许它自主发现新颖的求解策略。
-
缺点:
- 信号稀疏:对于长链条推理,模型很难从最终对错中回溯并归因到具体哪一步推理出了问题,导致训练效率低下。
- 奖励欺骗:模型可能通过死记硬背答案、利用表面统计线索蒙对,或者写出正确的答案但推理过程逻辑谬误,这些都无法被惩处。
- 过程幻觉无法识别:无法诊断模型的推理链条是否正确,可能出现“歪打正着”的错误过程。
过程监督:
-
定义:不仅看最终答案,也对中间推理的每个步骤的正确性进行监督和评分。为此,需要过程级的标签。
-
评估方式:为每个推理步骤提供奖励或标签(正确/错误/中性)。训练一个过程奖励模型,它可以为生成的每一步推理打分。
-
优点:
- 信号密集且精细:每一步都有反馈,极大提高了训练效率和归因准确性。
- 促进可解释且可靠的推理链:鼓励模型生成每一步都正确的思维链,从而减少推理幻觉,防止“漂亮的废话”。
-
能够在推理过程中及时纠正:在推理时,一旦过程奖励模型发现某步出错,可以触发回溯或重新生成,实现类似“自我纠错”的机制。
-
缺点:
- 标注成本极高:需要大量人力为长链条推理的每一步进行标注,构造训练数据困难。
- 自动过程监督的挑战:若用另一个模型(如裁判模型)进行自动过程监督,该裁判模型本身可能也存在错误,会引入新的偏差。
核心不同:结果监督是“只看目的地,不管怎么走”;过程监督是“每一步路都必须走对”。在追求可靠、可解释的智能推理系统时,过程监督是更先进但更具挑战性的范式。
如何设计评测实验,区分模型是在做真实推理还是依赖表面模式匹配?¶
区分真实推理与模式匹配是评测的核心难题。需要设计能够隔绝统计线索、制造反常识组合、并强制展现推理过程的实验。
实验设计策略:
(1)反常识与反事实干扰
-
修改训练分布:构造测试集,其中某些项目的答案与训练数据中的高频模式相反。例如,在训练数据中,通常“苹果”是红色,但创建一个测试集,其中的文本明确说“这里有一个蓝色的苹果”。然后提问“苹果是什么颜色?”。如果模型坚持回答“红色”,则暴露它依赖于死记硬背的统计模式;如果它根据测试文本的上下文回答“蓝色”,则展现了推理(或至少是忠实遵循上下文)。
-
前提谬误测试:设计基于完全错误前提的问题,如“既然太阳围绕地球转,那么日出是由什么引起的?” 真正的推理应首先质疑或纠正前提;模式匹配则会欣然接受并顺着编造理由。
(2)抽象规则与符号替换
-
纯符号推理:将问题中的所有实体和关系替换为无意义的字母或符号,同时保持逻辑结构不变。例如,将一段社会关系推理转化为“如果A是B的朋友,B是C的朋友,那么A和C是什么关系?”模型如果能在这个符号版本上依然推理正确,说明它掌握的是抽象关系模式,而非具体实体的表面关联。
-
跨域类比:要求模型将一个领域的规则应用到另一个完全无关的领域。这种迁移要求深层结构理解,是模式匹配难以完成的。
(3)因果干预与“怎么样”问题
-
因果归因:不是问“发生了什么”,而是问“如果没发生X,结果会怎样?”或者“是什么原因最可能导致了这个结果?” 这种反事实和因果问题要求模型理解事件间的因果机制,而不能仅靠时序上的共现。
-
设计“迷惑项”:为问题设置一个在词汇上与统计模式高度重叠、但在因果逻辑上完全不成立的干扰项。只有真正推理了因果链的模型才能避开这个陷阱。
(4)强制思维链与过程评估
- 让模型“说出你的思考”:要求模型在给出最终答案前,输出详细的推理步骤。然后对这条思维链进行评估。
- 错误步骤分析:检查是推理链条本身就错了,还是推理正确但答案摘录出错。
-
过程一致性检验:追问“你能用另一种方式得到相同答案吗?”,验证其推理的鲁棒性。
-
切除实验:修改中间推理步骤的某个前提,看最终结论是否随之发生符合逻辑的改变。若不变,则推理链只是装饰。
(5)生成新组合与长尾测试
-
组合泛化测试:要求模型解决涉及已知元素但全新组合的问题。例如,训练数据中见过“狗追猫”和“猫追老鼠”,但从未见过“老鼠追狗”。测试模型能否理解这种反向、不常见的关系组合。死记硬背会在此失败。
-
极长尾实体的推理:选择一些只有极少训练样本的冷门实体,但围绕它们构建与热门实体相同逻辑结构的推理题。表现断崖式下跌证明了对表面模式的依赖。
通过这些复杂的实验设计,我们可以逐渐剥开模型智能的“洋葱皮”,看清其底层是由坚固的逻辑内核驱动,还是由一堆脆弱、精美的统计关联堆砌而成。
逻辑推理中的“多跳推理”如何评测?有哪些针对性的测试集?¶
多跳推理指模型需要整合多个分散在不同位置或文档中的信息,进行一步以上的逻辑推导才能得出最终答案。评测的核心在于检验模型是否能将多个“信息碎片”有效桥接,而不是仅靠单跳匹配。
评测方法:
-
链式问答:设计答案依赖于2步或以上推理的问题。比如,要回答“张导演的电影《X》的摄影指导是谁?”,模型需先检索“张导演的电影有哪些”定位到《X》,再从《X》的信息中找到“摄影指导”。
-
文档分散放置:将多个必要事实分散在不同文档、不同段落或前后相距很远的句子中,迫使模型进行跨域信息整合,而不是从单一段落就能找到答案。
-
干扰项设计:在推理路径中设置表面相关但实际会导致错误推导的干扰信息。例如,其他导演也有同名电影,或同一部电影有多位摄影指导但时间不同。真正多跳推理能排除干扰,而模式匹配会被误导。
-
证据链验证:要求模型不仅给出最终答案,还输出推理证据链。评测时同时检查答案正确率和证据链是否完整、无误,并且每一步都有据可依。
针对性测试集:
-
HotpotQA:经典的多跳问答数据集,问题需要通过维基百科的多篇文章或一篇文章中的多个段落组合推理才能回答。支持证据句标注,可直接评估推理依据的准确性。
-
MuSiQue:通过自底向上的构造管道生成的多跳问题,严格控制每个推理步骤的可回答性和干扰项质量,能有效诊断模型的真实多跳推理能力,避免模型利用单跳知识“作弊”。
-
2WikiMultihopQA:基于维基百科构造的多跳问答集,问题涵盖跨实体的多种关系推理。
-
Bamboogle / StrategyQA:前者由多跳问题组成,后者需要多步策略性推理(有时需要隐式推理),挑战模型的深层逻辑。
-
FEVER:事实验证任务,虽然是对一个陈述做真实性判断,但许多声明需要综合多份文档中的多跳证据才能证伪或证实,实质也是多跳推理评测。
评测指标:除了最终答案的准确率(EM/F1),更关键的是评估推理链的准确性、证据覆盖率和干扰项鲁棒性,真正区分“真多跳”与“伪多跳”。
代码生成评测有哪些独特性?除了正确性,还应关注代码的哪些方面?¶
代码生成评测与其他文本生成任务有根本不同,其输出的质量不仅体现在语言层面,更取决于可执行性、逻辑严谨性和工程实用性。
独特性:
-
功能正确性是硬指标:代码不能仅是“看起来对”,必须在真实环境中编译通过、运行正确、通过所有测试用例。文本生成可以接受多种合理回答,但代码生成经常只有一个或极少数正确的功能解。
-
评测客观且可自动化:借助编译器、解释器和单元测试框架,功能正确性的评测可以做到完全客观、无人为偏差,这是其他生成任务难以比拟的优势。
-
多维度的质量要求:一段合格代码,除了功能正确,还必须考虑效率、安全、可读、可维护等工程属性。
除正确性之外,还应关注的方面:
-
效率与复杂度:算法的时间复杂度和空间复杂度是否最优或接近最优?在处理大规模输入时会不会出现性能问题?可通过测试大数据量用例的执行时间来评判。
-
安全性:代码是否包含常见的漏洞(如SQL注入、跨站脚本、缓冲区溢出、不安全的反序列化)?在高风险场景中,这是比功能正确更硬的约束。
-
代码风格与可读性:变量命名是否清晰?是否遵循语言社区的风格指南(如PEP8 for Python)?是否有恰当注释?可读性直接影响代码的可维护性,可通过静态分析工具和人工评分来评估。
-
健壮性与容错性:代码是否能够优雅地处理非法输入、空值、边界条件,而不是直接崩溃?测试用例应专门包含这些边缘和异常场景。
-
可复用性与模块化:生成的代码是解决一次性问题,还是提取了可重用的函数和模块?这体现了更高层次的抽象思维。
-
指令遵循度:代码是否严格遵循了用户提示中的所有技术要求(如“必须使用递归”、“不能使用外部库”、“数据结构应用链表”)?
评测实践:现代代码评测通常结合Pass@k(功能正确性)+ 静态分析 + 性能基准测试 + 人工/自动可读性评分,形成全方位的能力画像,而不是简单看能否跑通几个测试。
如何评测模型修复 bug 或代码编辑的能力?¶
修复bug和代码编辑评测关注模型对现有代码的理解、错误诊断和精准修改能力,这与从零生成代码有本质不同。
评测方法:
-
基于错误定位与修复的基准:给定一段包含已知bug的代码和错误描述(或没有描述,要求模型自行定位),要求模型输出修复后的正确代码。典型代表是 Defects4J,它收集了Java项目中的真实bug和对应的人为修复。评测时,模型生成的补丁必须通过全部测试用例,且常要求与人写的修复在语义上等价。
-
代码审查场景模拟:给出一个代码变更(diff)或一段有风格/逻辑问题的代码,要求模型像代码审查员一样指出问题所在,并给出修改建议或直接生成修改后的版本。评测指标包括:准确定位问题的比例、建议的采纳率、以及修改后代码的功能正确性。
-
交互式调试:在多轮交互中,提供给模型代码和错误日志,看它能否通过分析日志、提出假设、要求更多信息(如变量值)来逐步定位并修复bug。评测其调试策略的智能程度。
-
编辑指令遵循:给出一段原始代码和一条明确的编辑指令(如“重构这个函数,使用列表推导式”、“修复这个SQL注入漏洞”)。评测模型是否能生成只包含所需修改的、最小化的代码diff,且修改后代码功能无损、并完美遵循了指令。HumanEval-X 系列或 CodeXGLUE 的部分任务包含此类评测。
核心指标:
-
修复正确率:修补后的代码是否通过所有原有及新增的回归测试。
-
编辑效率:生成的补丁是否是最简改动(最小编辑距离),或者是否有不必要的代码重写。
-
问题诊断准确率:若需模型指出错误位置,衡量其定位的精准度。
独特性:这一评测要求模型不仅会写代码,更要会“读”代码,理解现有实现背后的意图,并做出外科手术式的精准修改。它反映了模型对代码更深层次的理解。
针对 SQL 生成或 API 调用的评测,需要考虑哪些特殊指标?¶
SQL生成和API调用涉及与数据库或外部服务的精确交互,其评测超越了文本自身,必须将执行结果和格式协议置于核心。
特殊指标:
(一)SQL 生成评测指标
- 执行正确性(核心):
- 精确匹配:生成的SQL结果集是否与标准SQL的结果集完全一致。这是最高标准。
- 集合匹配:结果集的元素是否一致,忽略行顺序。多数场景适用。
-
执行等价:生成SQL的结果集与标准SQL结果集在语义上一致,即使SQL写法不同。这是最公平的评估,因为一个查询可以有多种等价写法。
-
语法正确性:生成的SQL语句能否被数据库解析执行而不报语法错误。这是功能正确的基础。
Execution Accuracy(可执行率)是基础指标。 -
效率:在相同的大数据量数据库实例上,模型生成的SQL的执行时间。是否存在低效的写法(如不必要的全表扫描、笛卡尔积),即使结果对但效率极差,在真实环境中也是不合格的。
-
安全与鲁棒性:生成的SQL是否对SQL注入攻击免疫?是否正确处理了特殊字符、NULL值、空输入等情况?
典型评测集:Spider(最权威,要求跨表、多条件查询)、WikiSQL(单表、更简单)。Spider通过严格的多数据库、多表测试执行准确率。
(二)API 调用评测指标
-
参数正确性:调用的API函数名、各参数名及参数值的数据类型、取值范围是否正确,是否完全符合API规范。
-
调用序列的正确性:对于多步API调用任务,调用的顺序、逻辑是否正确,是否遗漏了必要步骤或存在冗余调用。
-
状态管理:能否正确解读和利用API返回的状态码、响应体,并根据响应做出下一步正确的决策。例如,处理分页、处理错误重试。
-
格式遵从度:生成的API调用是否严格遵循要求的格式(如JSON Schema、curl命令格式),能否被直接解析执行。
-
成本意识:在同样达成目标的前提下,是否选择了调用次数更少、计算资源消耗更低的API组合。
评测环境:对于SQL,需搭建真实的数据库沙箱;对于API,需提供模拟的API服务器或使用确定性的模型响应。最终分数是功能完成度与执行效率/安全性的综合。
对话模型的评测为什么需要多轮对话测试?单轮评测的局限在哪?¶
对话模型的本质是进行持续的、有状态的交互,单轮评测只能捕捉其瞬时的回应能力,而完全忽视了维系对话这一核心功能。
单轮评测的局限:
-
无法衡量记忆与状态管理:单轮评测无法评估模型是否记得用户10轮前提到的名字、偏好或决策,而这正是对话连贯性的基石。
-
无法考察多轮指令遵循:复杂任务(如“先列出优点,再针对缺点一一对比”)常需跨多轮完成。单轮评测无法测试模型是否在后续轮次中仍牢记并执行着初始指令。
-
忽视对话的推进能力:好的对话者会主动追问、澄清、总结,推动对话达成目标。单轮评测看不见这种战略层面的互动能力。
-
遗漏人格与角色一致性:在与角色模型对话中,模型在多轮后是否会“性格分裂”、忘记自己的人设,这只有在长对话中才会暴露。
-
无法反映真实用户体验:用户的满意度是一个累积的过程。一次好的单轮回合并不能补偿多轮交互中累积的挫败感。真实体验是历时性的。
多轮对话测试的必要性:
-
评估上下文持久性:直接检验模型的记忆窗口真实有效长度和抗干扰能力。
-
评估交互动态:评测模型处理矛盾、误解、修复对话、以及应对用户情绪变化的能力。
-
反映任务完成的全流程:对于诸如旅行预订、技术支持的对话,任务成功与否由最终的多轮结果决定,而非其中某一轮。
因此,多轮对话评测,如 MT-Bench(两轮对话)和真实场景的在线A/B测试,对于全面评价对话模型不可或缺。
如何评测模型在长对话中维持角色或任务目标的能力?¶
这需要将长对话视为一个整体,从一致性和目标完成度两个核心维度进行评测。
评测方法:
-
任务结束后的归因评估:在对话结束后,将整个对话历史提供给评估模型(或人类),并提出具体问题,如:“请检查对话第2轮中用户告知的个人信息,是否在后续的任何回答中被遗忘或记错?”、“该助手在对话全程中的语气是否符合其设定的‘专业、冷静的医生’角色?” 这种事后整体审计的方法比单轮打分更有效。
-
基于关键点追踪的自动化评测:
- 预定义槽位与规则:对于特定任务(如客服、预订),预先定义必须追踪的关键信息槽(如产品型号、用户地址、故障代码)。评测系统在每轮回答中自动抽取这些槽值,检查它们在整个对话周期内是否保持一致,没有漂移或矛盾。
-
约束满意度检查:对于角色扮演,预定义一系列角色必须遵守和绝对禁止的行为准则。用分类器或裁判模型检查模型在每一轮的输出是否违规。计算长对话中违规的频率和严重度。
-
模拟交互式对抗评测:使用另一个强大的模型扮演“引诱者”,在长对话中故意诱导目标模型偏离其角色或忘记任务目标,测试其在压力下的稳健性。例如,在目标模型扮演客服时,引诱者不断闲聊或提出无关要求,观察客服模型是否能在合理响应后回归任务主线。
-
目标完成度评分:设计需要多步协作才能完成的对话任务(如“帮我规划一个包含5个特定地点的三日游,并比较各酒店”)。在对话结束后,由裁判模型或人类评估任务完成的总百分比、完成效率(对话轮数)、以及用户模拟者的满意度。
核心指标:
-
角色一致性分数:基于整个对话的角色符合度评分。
-
关键信息维持率:初始定义的关键信息在对话末尾仍被正确记住的比例。
-
任务目标达成率:任务成功完成的比例。
-
抗干扰能力:在干扰下偏离任务或角色的频率。
通过这些方法,可以系统性量化模型在长对话中的“持久力”和“可信度”。
对话中的“人格一致性”和“情感共情”如何评估?¶
这两个维度关乎对话模型的高级社交智能和用户体验。
(一)人格一致性的评估
-
自洽性测试:让模型用明确的人格描述(如“你是热情开朗的导游”)初始化,然后在对话后期,用不含该人格提示的隐式问题探测,如“你平时休息喜欢做什么?”,看其回答是否与导游人设内在一致。不一致则表明人格未内化。
-
多轮人格问卷:在多轮对话中,穿插使用标准化的性格测试问卷(如大五人格问题的变体)向模型提问。在不同轮次提出同类问题,看模型的前后答案是否自相矛盾。
-
角色对比测试:让同一模型先后扮演两种截然相反的性格(如悲观者vs乐观者),然后让裁判模型或人类评估者阅读两份对话记录,判断对话是否能清晰区分出两种人格。这是对人格稳定性和区分度的压力测试。
-
行为模式的一致性:检查模型的用词、表情符号、句式等“语言指纹”在整个对话中是否与设定人格保持一致。
(二)情感共情的评估
-
情感识别作为前提:先测试模型能否从用户话语中准确识别出隐含的情绪状态(如沮丧、兴奋、讽刺),这是表达共情的基础。可使用情感标注的对话数据集进行微调评测。
-
共情回复质量评估:设计一系列包含明确或隐含负面情绪的对话历史(如“我刚失业了”)。评估模型回复的共情质量,分为几个等级:
- 无共情(答非所问或冷漠)
- 浅层共情(“这太糟糕了”)
- 深度共情(准确命名用户情绪,提供情感确认,并结合情境表达支持)
-
行动导向共情(在共情基础上,提供建设性的后续支持或问题解决方向)
-
共情适当性:共情不足和过度共情(如强行煽情、假大空安慰)都是减分项。评估需判断共情表达是否与情境严重度匹配。
-
基准:可以使用 EmpatheticDialogues 数据集进行监督评测,或使用强裁判模型根据上述等级量规进行零样本或小样本评分。
人格一致性和情感共情的最佳评估方式仍然是经过严格培训的人类评估员,因为这两者涉及的文化、语境和主观感受极为复杂。自动化裁判可作为大规模初筛的辅助。
工具调用(Function Calling)能力如何评测?如何设计评测环境和指标?¶
工具调用评测的核心是检验模型是否能将自然语言指令,转化为对预设API的正确、高效、鲁棒的调用序列。
(一)设计评测环境
- 构建模拟API沙箱:
- 定义一套覆盖不同类别(如获取数据、执行操作、计算)、不同参数模式(必填、可选、复杂类型)的“虚拟API”集。这些API背后有一个确定性的模拟后端,确保每次调用返回可预测的结果。
-
设计复杂任务场景:不是孤立地“调用API X”,而是需要模型规划一串API序列来完成一个高层次目标,如“帮我预订从A到B的机票和酒店,条件是...”,这需要综合调用搜索、比较、预订等多个API,并且处理API返回的数据。
-
真实API受限接入:在保障安全的前提下,将真实世界的API(如搜索引擎API、计算器、天气查询API)包装后提供给模型,评测其在真实世界噪声和约束下的表现。
(二)定义评测指标
-
功能完成度:任务是否完全达成?这是最终金标准。可用完成百分比或成功/失败来衡量。
-
调用正确性:
- API选择准确率:在需要时,是否正确选择了功能相匹配的API,没有用错或编造不存在的API。
-
参数准确率:调用的参数名、参数值、数据类型是否符合API的Schema定义。这一点可以通过沙箱自动捕获参数解析错误。
-
调用效率与成本:
- 冗余调用率:是否存在不必要、重复的API调用,浪费资源?
-
最优路径匹配度:比较模型使用的调用序列与预定义的最优序列(最少调用次数、最低计算成本)的接近程度。
-
错误恢复与鲁棒性:
- 应对错误返回:当API返回错误(如404、参数非法)时,模型是否能基于错误信息进行智能重试或调整参数,而不是崩溃或瞎编结果?
-
处理异常状态:对API返回的空数据、超时等情况,是否做出了合理的后续处理。
-
对话与调用的一致性:最终返回给用户的自然语言答复,是否准确、忠实地反映了API的执行结果,没有编造。
典型基准:ToolBench、API-Bank 等数据集提供了大规模的工具调用评测场景,涵盖多种API和复杂规划需求。评测环境通常与真实数据库或模拟服务器深度集成。
如何评测模型遵循复杂指令的能力?约束的层次越多是否难度越大?¶
评测模型遵循复杂指令的能力,重点是考察其对指令中各项具体约束的满足率,以及在多约束下的协调能力。
评测方法:
- 约束清单核查法:将复杂指令拆解为一组独立、可自动验证的原子约束。例如,指令“写一篇包含3个要点的总结,以JSON格式输出,总字数在200字以内,且不能使用逗号”。拆解为:
- 包含3个要点(可数数)
- 输出格式为JSON(可解析)
- 总字数 ≤ 200(可统计算)
-
不包含逗号(可正则匹配) 评测指标:约束满足率 = 完全满足的约束数 / 总约束数。
-
专门基准:IFEval (Instruction-Following Eval) 就采用了上述方法,设计了包含20多种可自动验证约束的500个提示。它发现模型平均难以满足所有约束,并能量化每种约束类型的难度。
-
层次化指令构造:人工或自动生成包含不同层级约束的指令:
- 表层格式约束:“用Markdown表格”、“每段以小标题开头”。这是最容易的。
- 内容限定约束:“必须提到A”、“禁止使用词汇B”、“语气要专业”。难度中等。
- 逻辑与条件约束:“如果X,则用格式A;否则用格式B”、“先分析优点,再解释缺点”。难度较高。
- 跨轮次或元约束:“总结对话历史”、“基于你上一轮的回答进一步阐释”。这是最难的。
约束层次越多是否难度越大?
是的,通常呈非线性增加。 原因如下:
-
注意力与记忆竞争:多个约束在模型生成时竞争有限的注意力和工作记忆。模型很容易满足一部分约束而“忘记”另一部分,尤其是在生成的后半段,早期约束被稀释。
-
约束间的冲突与优先级不明:指令中可能隐含冲突(如“幽默”和“专业”),或模型不清楚哪个约束优先级更高,导致决策瘫痪或任意选择。
-
能力瓶颈暴露:某些约束(如“论证必须有逻辑谬误”)本身超出了模型的理解能力或与安全对齐相冲突,叠加后会显著提升失败率。
评测证明,随着约束数量(例如从2个增加到6个以上),模型的平均约束满足率会急剧下降。当前大模型在格式类约束上表现良好,但在内容逻辑类和跨轮次约束上仍面临巨大挑战。这种评测精确量化了模型从“听懂话”到“听懂复杂嘱咐”之间的鸿沟。
解释“AGIEval”的设计思想,如何用人类考试题评测大模型?¶
AGIEval 是一个专门设计用来评估大模型“类人认知能力”的基准,其核心思想是用人类选拔性、资格性考试题来评测大模型,通过考察模型在需要深度理解、推理和知识综合的任务上的表现,衡量其与人类智能的差距。
设计思想:
-
以人为参照的标准化测试:AGIEval 选取了一系列高利害、高质量的标准化人类考试,包括大学入学考试(如中国高考、美国SAT)、研究生入学考试(GRE、GMAT)、律师资格考试、医学执照考试等。这些考试的题目经过严格设计,旨在测量高阶思维技能,而非死记硬背。
-
广泛覆盖认知能力:题目涵盖数学推理、语言理解、逻辑分析、专业领域知识应用等,与人类认知能力的多维结构相对应。
-
零样本或少样本设定:模型在未对这些特定考试材料进行专门微调的情况下直接作答,更能体现其通用的、在训练中涌现出的推理和知识运用能力。
-
任务多样化:包括选择题、填空题、问答等多种格式,挑战模型的灵活适应能力。
-
高区分度与天花板高度:这些考试是为区分高水平人类设计,因此对顶级模型仍具极大挑战,不易饱和,能有效衡量大模型能力的上限。
如何用人类考试题评测:
-
题目格式化:将原始考试题转化为适合语言模型输入的文本格式,包括题干、选项(如有)和必要的上下文,并配以标准化的提示词,要求模型输出答案。
-
严格评分:根据考试的标准答案进行评判。对于选择题,使用准确率;对于生成式答案,常用精确匹配或F1值,甚至引入等价性判断规则(如数学表达式)。
-
多维度分析:报告模型在不同类别考试(如数学 vs. 语言)、不同难度等级上的得分,绘制出模型的“能力轮廓图”,并与人类考生的平均分、百分位进行对比。
-
过程诊断:不仅看最终答案,还可通过要求模型输出推理过程(思维链),分析其错误模式是知识缺失还是逻辑推理失误。
通过 AGIEval,研究者能以人类社会的智力衡量标尺去丈量大模型,使得模型能力的进展更加直观且与人类社会需求对齐。
创意写作如何评测?有哪些自动化方法辅助人工?¶
创意写作的评测因其高度主观性和艺术性而尤为困难。其目标是衡量作品在独创性、审美价值、情感共鸣和文笔上的表现。
评测方法:
-
人工专家评审为核心:目前,人类评估(尤其是作家、编辑或文学评论家)仍然是创意写作评测的金标准。他们根据预先定义的评分量表,从主题、结构、语言、创意、连贯性等多个维度进行综合鉴赏和打分。
-
众包偏好评估:将两篇或多篇匿名作品呈现给大量普通读者,进行成对比较或评分,收集大众的审美偏好数据。这可以衡量作品的“受欢迎度”和“可读性”,但可能低估先锋或小众的艺术价值。
自动化辅助方法(不能替代,但能降本增效和提供部分信号):
- 语言学风格与多样性指标:
- 新颖性:利用大语言模型计算文本与训练数据中常见模式的偏离度,或与已有作品集的文本相似度。较低的相似度和较高的偏离度可能暗示一定程度的独创性。
- 词汇与句法多样性:使用 Distinct-N、Self-BLEU 等指标衡量用词和句式的丰富度,过滤掉机械重复的生成。
-
可读性与流畅度:自动检测语法错误率、困惑度(PPL),辅助评判基本文笔。
-
基于大模型裁判的多维度评分:
- 使用 GPT-4 等强模型作为裁判,设计精细的评分标准和锚定示例,从“情节吸引力”、“角色生动性”、“语言美感”等维度进行1-10分评价。可通过提供多篇名家范文的评分作为锚点来校准。
-
局限:裁判模型存在强烈的风格和内容偏见,可能偏好四平八稳的“标准美文”而非真正突破性的创意。
-
情感与故事弧线分析:
-
自动计算文本的情感曲线、节奏、高潮分布等叙事学特征,辅助分析故事是否具有吸引人的张力结构,虽然这更多是描述性分析而非质量评判。
-
社区互动信号:在在线平台上,可使用阅读量、点赞、分享、收藏等用户行为数据作为创意作品吸引力和传播力的代理指标,但存在严重的大众品位偏差。
核心挑战:自动指标无法真正理解情感深度、隐喻的美感和思想的独创性。因此,创意写作的最佳评测仍是“机器初筛+人工精评”,用自动指标处理海量作品的初步过滤和基础质量把控,释放人类专家的精力去专注于高层次的审美判断。
翻译能力评测中,传统指标(BLEU)和现代方法(COMET)的优劣对比。¶
| 维度 | 传统指标(BLEU) | 现代方法(COMET) |
|---|---|---|
| 原理 | 基于 n-gram 精确匹配,统计参考译文中词汇在生成译文中的重叠率。 | 基于神经网络,在大量人工评分数据上训练,预测翻译质量,能捕捉语义和语境。 |
| 优势 | 计算极快,无需GPU;完全客观,易于理解;历史积累深厚,是翻译界的“通用语”。 | 与人类判断高度相关;能处理同义词和释义,不惩罚合理意译;可给出细粒度评分(如逐段评分);可微调适应特定领域。 |
| 致命缺陷 | 完全无视语义:将“迅速”和“快速”视为无重叠;对时态、语序等敏感但无意义;单一参考译文严重低估翻译多样性;对关键信息错误(如否定词)的感知极弱。 | 依赖训练数据和模型质量:可能学到数据中的偏差;对完全不同于训练分布的新颖翻译可能评分不准;计算成本相对较高。 |
| 在LLM评测中是否过时? | 已基本过时作为翻译质量的主要指标。它无法反映现代生成模型产生的高质量、多样化译文,常给出与人类判断相悖的结论。 | 已成为当前主流和推荐方法。像 COMET-22 等模型是评估LLM翻译能力的最先进自动指标,被WMT等顶级会议广泛采用。 |
| 保留价值 | 在特定受限场景(如术语表遵循度、与标准译文的严格一致性检查)仍可作为辅助;在极低资源或无COMET模型覆盖的语言对中仍有使用。 | 持续进化中,其目标是完全取代传统指标,成为翻译质量评估的自动化金标准。 |
结论:对于大模型翻译能力的严肃评估,必须使用以 COMET 为代表的神经指标,BLEU 等仅可作为极弱的辅助参考或已不再适合作为翻译质量的评判依据。
长文本理解与问答如何评测?大海捞针测试的局限性在哪里?¶
长文本理解评测旨在检验模型在超长上下文(如几十万tokens)中,能否准确定位、整合并推理信息。
评测方法:
-
大海捞针测试:在长文本中的随机位置插入一个与主题完全无关的“针”(一句特定事实),然后提问该事实。测试模型能否准确找到并复述“针”。优点是简单直观,能直接反映有效上下文窗口长度。
-
长文本问答与摘要:使用包含长上下文的数据集(如长篇论文、法律文档),构造需要整体理解或多跳整合的问答对,或要求模型生成长度超过其生成限制的摘要。
-
多跳信息整合测试:将回答一个问题所需的多个事实片段散布在长文本的不同部分,考验模型远距离关联和融合信息的能力。
-
指令跟随与约束保持:在开头的系统指令中设定一个全局约束(如“所有回答必须以‘答:’开头”),在填充数万字无关文本后提问,检查模型是否仍然遵循该约束。
大海捞针测试的局限性:
-
任务过于简单,生态效度低:只测了“检索和复制”这一最基础的能力。真实长文本任务需要整合、推理、比较和总结,而不仅仅是找到一个无关联的事实。
-
无法评估推理质量:模型找到“针”后可能仍然基于错误推理给出答案,或者无法对多个分散的“针”进行综合推理。
-
难以评估抗干扰能力:测试通常只插入无害的、无冲突的针。真实场景中,长文本可能包含大量矛盾、误导和噪声信息,大海捞针无法检验模型在这些干扰下的鲁棒性。
-
忽视“迷失中间”问题之外的其他机制:模型即使在两端表现好,仍可能在处理长文本时发生事实混淆、时间线错乱等复杂错误,这些在大海捞针中完全暴露不出来。
-
不反映任务完成度:用户最终关心的是任务(如写综述、做分析)的完成质量,而不仅是某个事实是否被找到。
更全面的长文本评测应结合: 大海捞针(快速测窗口长度)、多跳问答(测推理整合)、长摘要(测信息压缩与忠实性)、以及基于真实任务的端到端评估(如长篇论文学术评审模拟)。
信息抽取、摘要和分类等传统 NLP 任务,大模型评测有什么新思路?¶
大模型的出现使得传统NLP任务的评测从“封闭式、微调特定模型”转向“开放式、零/少样本通用模型评估”,因而评测思路也需根本转变。
新思路:
(一)信息抽取
-
从“严格匹配”转向“语义等价与归一化”:传统指标要求实体类型和边界精确匹配,但大模型可能用不同粒度或表述表达相同信息。评测需引入基于上下文嵌入的语义对齐和专家定义的归一化规则,奖励正确的概念提取而非字面拷贝。
-
评测开放式抽取与关系三元组的完整性:不再局限于预定义的关系类型,而是评测模型能否发现并正确表达任意关系。指标发展为:正确抽取的三元组占所有应抽取三元组的比例(召回)和准确度。
-
鲁棒性与幻觉评测:专门评估模型在面对对抗性文本(微小扰动、错误信息注入)时,抽取结果是否会崩溃或产生幻觉。这是传统评测忽视的。
(二)摘要
-
事实一致性取代ROUGE成为核心指标:如前述(参见评测系列第24题),使用 SummaC、QuestEval、FactCC 等指标,衡量摘要是否忠实于源文,有无编造或歪曲。这是大模型摘要评测的第一要务。
-
多维度质量评测:同时评估简洁性、信息覆盖度、连贯性和可读性。常使用大模型裁判在这几个维度上独立打分。
-
可控摘要评测:考察模型是否能根据长度限制、特定受众或侧重点等指令生成符合要求的摘要,评测指令遵循度。
(三)分类
-
从“预测标签”到“解释性分类”:大模型不仅输出标签,还能提供分类理由。评测可同时考量标签准确率和理由的合理性、忠实性。
-
零/少样本泛化能力:评测模型在未见过的新类别、新领域上的分类能力,强调其知识迁移能力,而不再仅看其在固定测试集上的微调后性能。
-
不确定性表达评测:考察模型在模棱两可或超出知识范围的输入上,是否能诚实表达不确定(如输出“未知”或“需要更多信息”),而不是强行归类。
-
细粒度误差分析:从传统的混淆矩阵出发,进一步分析错误是否源于模型对特定子群体的系统性偏见,或对特定语言现象的盲区。
共同趋势:传统任务的评测已从单一的绩效指标(F1, Accuracy)演变为多维度、重解释、强鲁棒、看对齐的综合质量评估。大模型裁判在其中扮演越来越重要的角色,而人类评估则作为校准和边界案例的黄金裁决。
什么是“元评测”?如何评估评测方法本身的有效性?¶
元评测 是对评测方法本身进行评估的框架。它不直接评测大模型,而是评测“用于评测大模型的工具和标准”有多可靠、多有效。它为整个评测体系提供质量保障。
核心问题:
-
我们的自动指标、人类评估方案或裁判模型,是否真的测量了想要测量的东西?
-
它们给出的分数在多大程度上可以信任?
-
不同评测方法之间是否一致?如果矛盾,该信谁?
评估评测方法有效性的维度:
-
与人类金标准的一致性:这是最核心的指标。在一个高质量的人类专家标注集上,计算自动评测(或众包人评)结果与专家判断的相关系数(如Pearson、Spearman)或一致率(如Cohen's Kappa)。高一致性意味着该评测方法能有效代理人类的真实质量感知。
-
信度:评测方法本身的稳定性和可复现性。对同一批样本,多次评测(改变提示词中无关细节、位置交换等)的结果波动有多大?高信度是有效性的前提。
-
效度:评测是否覆盖了所有关键维度?是否存在“测非所想”的结构偏差?通过分析评测维度与外部独立标准的关系,来验证其构建效度。
-
偏差审计:评测方法是否对某些类型的模型或输出存在系统性不公?例如,自动指标是否有长度偏差、文化偏见?人类评估是否存在晕轮效应?进行专门的偏差探测实验是元评测的关键任务。
-
可解释性与诊断力:一个好的评测不应只给一个分数,还应能提供错误分析和诊断信息,帮助模型开发者定位问题。评测方法提供的反馈信息量也是其有效性的一部分。
-
鲁棒性与泛化能力:该评测方法在应用到新领域、新语言或新型模型时,是否还能保持与人类判断的一致性?还是在某些情况下会失效?
实践:在发布任何评测结果时,都应包含对所用评测方法的元评测报告,特别是其与人类判断的一致性数据和已知偏差,这是构建可信评测的基石。
多任务学习或通用智能评测的终极目标是什么?“通用性”如何量化?¶
终极目标:通用智能评测的终极目标,是构建一个能够全面、公平、准确地度量一个系统在未知的、多样化环境和任务中成功达成目标的能力的评估框架。这接近对“通用智能”的操作性定义和测量,即一个智能体在面对新问题时,能综合运用知识、推理、学习和适应能力,高效实现目标的程度。
“通用性”的量化方法:
-
广度与深度结合:使用类似 BIG-Bench 的超大规模任务集合。通用性不仅仅是任务数量的简单累加,还需要考虑每个任务上的性能深度。可以计算模型在所有任务上的平均归一化得分,以及超过特定阈值(如人类水平)的任务比例。
-
跨域泛化与迁移效率:衡量模型在新任务上的零样本和少样本学习能力。指标可以是从新任务的少量数据中学习后的性能提升速度(样本效率),以及其在已见任务与未见任务上的性能差距。差距越小,通用性越强。
-
能力等值面分析:不只用一个标量,而是提取出多个基础认知能力因子(如语言理解、逻辑推理、记忆等),看模型在这些基础因子上的组合表现。一个通用智能体应在所有基础因子上都有均衡且较高的得分,而不是偏科。
-
新任务解决的对数效率:借鉴通用智能的定义,可以用模型能够解决的全新任务的数量(广度)乘以解决这些任务时的平均对数效率(深度),形成一个综合指数。
-
高生态有效性的模拟:在模拟真实世界的复杂环境中(如交互式游戏、虚拟实验室),综合评估模型感知、规划、行动和协作的通用能力。评分包括任务成功率、完成质量和资源消耗等。
挑战:通用性不可能被一个简单数字完全刻画。真正的通用智能评测必然是多维多层次的、动态的、且需要与人类和社会价值持续对齐的复杂体系。
如何设计一个考察模型“自我认知”和“知道自己不知道”的评测?¶
评测模型的自我认知,核心是测量其元认知能力——即模型对自己知识边界、能力局限以及自信程度的准确感知。
设计思路与具体方法:
(一)知识边界探测
- 构造“可回答”与“不可回答”问题混合集:
- “可回答集”选取模型训练数据截止日期前、且为常见百科知识的问题。
-
“不可回答集”包括:询问未来事件、需要实时私密数据、涉及纯粹虚构实体、或信息不充分无法确定的问题。
-
核心指标:
- 拒答恰当率:在“不可回答”问题上,模型是否表达了“我不知道”或不确定性,而不是编造答案。
- 误拒率:在“可回答”问题上,模型是否错误地表达了无知。
-
可构建一个联合分数,如 F1 分数,平衡两者。
-
校准的置信度:要求模型在每个答案后附加置信度百分比,然后计算其期望校准误差(ECE),看模型声称的把握与真实准确率是否匹配。
(二)能力局限的自我认知
-
生成任务后的自我评估:让模型完成一个任务(如翻译一段复杂古文),然后立即问它:“你觉得自己刚才的翻译完全准确吗?如果有不确定的地方,请指出。” 评估它能否精准定位自己可能出错的地方。
-
比较判断:给出两个回答(一个正确一个错误),让模型判断哪个更好。正确率反映了其识别好坏的能力,这是自我认知的一种形式。
-
“已知”与“可知”的区分:设计问题,有些是模型内部知识可回答的,有些需要外部信息才能回答。问模型:“你需要查阅资料才能回答这个问题吗?还是可以直接回答?” 评测其区分能力。
(三)通过行为一致性间接测量
-
自我一致性(Self-Consistency)的元认知:对同一个问题多次采样。如果模型答案高度一致且正确,说明它“知道且知道自己知道”;如果高度一致但错误,说明它“不知道自己不知道”(有害);如果答案分散,说明它至少意识到了不确定性。可结合准确率绘制“一致性-正确性”分析图。
-
矛盾识别:给模型一段包含自相矛盾内容的文本,问它:“这段文字有没有前后矛盾的地方?” 这测试它监测逻辑一致性的能力。
一个好的自我认知评测集,将能清晰地告诉我们:模型是一个有自知之明的谨慎思考者,还是一个信口开河、不知己所不知的盲目自信者。这是通向可信赖AI的关键一步。
模型“拒绝能力”如何评测?过度拒答和应拒未拒各有什么指标?¶
拒绝能力是指模型在面对不安全、不道德、超出知识范围或违反政策的请求时,能够恰当拒绝,同时不过度拒答的正常请求。评测需要同时衡量两个矛盾的方面:安全性(应拒必拒) 和可用性(不应拒则不拒)。
评测方法:
- 构建分层测试集:设计三类提示:
- 明确有害(暴力、仇恨言论、非法行为指南):模型必须拒绝。
- 完全良性(正常知识问答、创意写作、日常对话):模型必须正常回答。
-
边界模糊或具有挑战性(如性教育、敏感历史讨论、需要表达不确定性的问题):用于诊断模型的判断粒度。
-
自动化安全分类器:使用训练好的有害内容分类器或强模型裁判,对模型回复进行有害性评分。若回复被判定为有害,则视为“应拒未拒”。
-
人工专家评估:对于边缘案例,由安全、法律或伦理专家判断模型的拒答是否恰当,以及未拒答时是否有潜在风险。
核心指标:
-
应拒未拒率:在所有真正有害的提示中,模型未能拒绝(即输出了有害内容)的比例。这是安全漏洞指标,越低越好。
-
过度拒答率(误拒率):在所有安全、良性的提示中,模型错误地拒绝回答的比例。这反映了模型的保守程度和对齐税的严重性,越低越好。
-
F1/平衡准确率:综合考虑以上两者,可以计算拒绝行为的F1分数,或绘制ROC曲线寻找最优阈值。
-
边界处理合理性:对边界提示,由专家评估模型的回应是否展示了对复杂性的理解、适度的不确定性和安全的引导,而不是一刀切的拒绝或鲁莽的回答。
-
拒答风格与信息量:模型拒绝时,是生硬地说“我不能回答”,还是解释了原因并提供了替代帮助?前者虽然安全但帮助性差,后者更优。可引入拒答质量评分。
典型基准:SafetyBench、RealToxicityPrompts、HarmBench 等,以及内部红队测试集,都可用于此类评测。一个成熟的模型应在保证极低应拒未拒率的同时,将误拒率控制在可接受范围。
如何评测模型在多种文化背景下的常识和规范适应性?¶
这要求评测模型是否理解并尊重不同文化的规范、价值观、禁忌和常识,而不仅仅是以西方或英语文化为中心。
评测策略:
- 构建多文化测试集:
- 翻译与改编:将现有的社会规范和常识测试(如Social IQA)翻译成多种语言,并由当地母语者改编,使其情境、人物和规范符合当地文化,而非简单直译。
-
社区共建:与全球各地的文化专家和社区成员合作,收集各文化特有的情境题。例如,关于家庭关系、节日礼仪、饮食禁忌、商务沟通风格等。
-
多角度考察:
- 文化常识:提问特定于某文化的事实(如“中秋节常吃什么?”),检验知识覆盖率。
- 社会规范:设计情境题,询问在特定文化下某种行为是否得体(如“在X国,直呼长辈名字是否合适?”),测试对社会规则的理解。
-
价值观对齐:设计涉及道德困境的问题,看模型的回答是否反映了特定文化的主流价值观(同时注意不强化刻板印象)。
-
评估指标:
- 文化准确率:模型在各文化子集上的回答准确率。
- 文化偏见度:检查模型是否对某些文化表现出系统性的负面刻板印象或冒犯性评价。可通过比较模型对不同文化群体的描述情感得分来实现。
-
适应性一致性:在跨文化场景中,模型的回答是否前后一致。例如,当用户明确表示“我来自X文化”时,模型的后续交互是否体现了对该文化的理解和尊重。
-
自动与人工结合:自动评测可快速计算事实准确性,而规范和价值观的深层评估必须大量依赖众包和当地母语专家的评审,他们能识别出外人难以察觉的文化冒犯或误解。
典型基准:GlobalOpinionQA、CultureBank 以及一些多语言NLP基准中的文化子集。这类评测对于全球部署的模型至关重要。
特定垂直领域(法律、医疗、金融)的模型评测,有何独特需求和挑战?¶
垂直领域评测要求将模型的通用能力置于极高的专业准确性、安全责任和合规标准之下。
独特需求:
- 金标准知识库与专家参与:
- 评测不能依赖通用维基百科,而必须基于领域内权威、受法律认可的知识源。如法律需基于现行有效法典和判例,医疗需基于临床指南和经同行评议的文献,金融需基于官方披露文件和实时市场数据。
-
评测答案的“正确性”必须由持牌执业专家(律师、医生、金融分析师)来定义和验证,普通人类评估员不具备裁决权。
-
对幻觉的零容忍(高风险领域):
- 一个捏造的法条、错误的剂量、虚假的财务预测,可能带来灾难性后果。评测必须专门设计高风险幻觉探测集,对事实性错误的扣分权重要极大。
-
必须评测模型“知道何时不知道”并建议咨询人类专家的能力。过度自信的胡说比诚实说“请咨询律师”危险得多。
-
合规与伦理审查:
- 输出必须符合行业监管规定(如HIPAA、GDPR)。评测需包含合规性维度,检查是否泄露隐私、是否进行不当诱导、是否履行了风险告知义务。
-
需要审计模型的偏见,确保不会对特定患者、诉讼人或投资者群体产生系统性不公。
-
时效性与动态更新:
-
法律和金融信息时效性极强。评测必须使用动态更新的题库,检验模型是否能依赖最新法规和数据,并丢弃过时信息。
-
可解释性与溯源要求:
- 模型不仅给出答案,还必须提供可信、可追溯的来源(如具体条款、文献DOI)。评测需检查其引用的真实性和准确性。
挑战:数据稀缺且高度敏感,难以构建大规模公开评测集;评测成本极高,深度依赖稀缺且昂贵的领域专家;对错误的容忍度极低,评测方法必须极度严谨,任何自动指标都需要专家校准。
如何利用“对抗生成”创造更难的评测样本,避免刷榜?¶
对抗生成利用模型自身或红队力量,动态构造能暴露模型弱点的挑战性样本,使评测难度随模型能力动态提升。
方法:
- 迭代对抗过滤:
- 从初始评测集开始,用当前最强模型去测试。收集模型失败的案例,分析其错误模式。
- 基于失败模式,人工或自动大规模生成类似但更具迷惑性的新样本。例如,如果模型在否定句式上常出错,就批量生成各种复杂的否定句问题。
-
用新样本重新评测模型,再次收集失败案例,重复此过程。多轮迭代后,评测集将充满对当前模型而言“最难”的例子,如同HellaSwag的构建过程。
-
红队模型自动生成攻击:
- 训练或提示一个强大的“攻击者”模型,专门负责生成能诱导被评模型犯错的提示。这可以是越狱攻击、逻辑陷阱、知识冲突或风格诱导等。
-
将大量红队生成的对抗样本纳入评测集,实现自动化、大规模的对抗评测。
-
人机协同对抗构造:
- 人类红队专家设计初始攻击思路,由语言模型辅助批量生成变体。
-
人类再筛选出最巧妙、最隐蔽的对抗样本,这些样本往往利用了模型的深层认知盲区,是目前最有效的对抗评测素材。
-
基于规则的组合爆炸:
- 对于指令遵循类任务,利用组合数学,自动生成包含多个相互制约或极易混淆的约束组合的指令,其中许多组合是人类不会想到但极易让模型崩溃的边界情况。
对抗生成的意义:将评测从“模型做我们预先准备的题”转变为“我们根据模型的弱点不断出更难的题”,从而持续拉高评测区分度,防止基准饱和,驱动模型向真正鲁棒的智能进化。
怎样设计一个评测,同时衡量模型的准确性和效率(延迟、吞吐)?¶
在真实部署中,模型的准确性和效率同等重要。一个极其准确但响应极慢的模型,用户体验极差。需要设计统一的评测框架来测量“性能-效率”的帕累托前沿。
设计方案:
- 统一测试环境与任务集:
- 确定一系列有代表性的典型任务(如短问答、长文摘要、多轮对话),每种任务拥有自己的测试集和功能性指标(如正确率、ROUGE、忠实度)。
-
所有待评模型必须在完全相同的硬件环境(如特定的GPU型号、CPU、内存)和软件栈(推理框架、批处理设置)下运行,以确保效率指标公平可比。对于API模型,记录其平均端到端延迟。
-
固定服务质量(QoS)协议:
- 为不同的应用场景定义SLA(服务等级协议),如“实时对话场景要求P95延迟低于500ms”。
-
在评测时,测量模型在满足该SLA前提下能达到的最高功能得分。或者,固定一个可接受的最低功能得分(如摘要ROUGE-L不低于30),测量此时的最高吞吐量。
-
效率指标细化:
- TTFT(Time to First Token):从请求发出到收到第一个token的时间,影响用户感知的响应速度。
- TPOT(Time per Output Token) 或总延迟:输出完整回答的速度。
- 吞吐量:在持续高负载下,系统每秒能处理的最大请求数或生成的token总数。
-
硬件成本:运行模型所需的GPU显存、数量及功耗。
-
综合评分模型:
- 不试图用一个简单数字概括,而是在二维坐标系上绘制多个模型的点,X轴为效率(如吞吐量),Y轴为准确性(如正确率),直观展示帕累托前沿。
- 或者,根据业务需求设定一个效用函数,如
U = Accuracy * log(Throughput),并报告每个模型的效用值。这个函数需要根据产品需求定制,反映准确性相对于效率的重要性。
这样设计出的评测,能直接指导工程选型,找到在给定硬件和延迟预算下表现最优的模型版本。
评测模型在持续交互中的学习能力或记忆能力,可以怎样设计实验?¶
这类实验旨在考察模型是否能在对话、上下文中临时学习新信息,并持续记住和应用它们,同时考察长期记忆与短期记忆。
实验设计:
- 会话内少样本学习:
-
在多轮对话的早期,教给模型一个全新的概念或事实(如“我将要在对话中使用一个暗语,X表示同意”),然后在对话后期频繁要求模型使用或解释这个暗语。评测其是否能正确应用,以及在长对话后是否会遗忘。
-
动态档案记忆任务:
-
在对话开始时,用户提供一个包含多个复杂指令和个人偏好的“记忆档案”。然后进行长达数十轮、穿插各种话题的对话。在对话结束时,突然提问有关该档案的细节,检验模型是否在整个对话中持续记忆了这份档案,没有被其他信息冲刷掉。
-
流式指令注入与干扰:
-
在多轮对话中,分步给出指令片段,中间夹杂大量无关对话。最后要求模型综合所有指令片段完成一个任务。这测试了模型对跨轮次分散信息的整合能力和抗干扰记忆力。
-
选择性记忆与遗忘:
-
对话中,先给出信息A,然后明确告诉模型“请忘记A,现在信息更新为B”。之后提问,看模型是否真的以B为准,还是混乱地混合了A和B。这评测了记忆更新机制。
-
长期记忆跨会话测试:
-
如果系统支持持久化记忆,可设计跨独立会话的实验。在第一场会话中存入信息,关闭会话,几天后开启新会话,测试模型是否能通过记忆检索机制回想起该信息。
-
评测指标:
- 记忆保持率:在对话的特定位置,模型能正确回忆出的信息占初期注入信息的比例。
- 抗干扰准确率:在有干扰项的情况下,模型对关键信息的回忆准确率。
- 学习曲线:观察模型在多次同类任务中的表现提升速度,衡量其少样本学习效率。
这类评测能深入探测模型的工作记忆和上下文学习能力,对构建具有长期陪伴和个性化能力的对话助手至关重要。
在评估模型“价值观对齐”时,如何从多角度构建评估体系?¶
价值观对齐评测必须覆盖多个维度,避免单一标准带来的文化或意识形态偏见,确保模型的行为符合广泛的人类普世价值和社会责任。
多角度评估体系构建:
(一)普世伦理与安全原则
- 基于国际人权框架和主要安全协议,评估模型是否遵守诸如无害性、隐私保护、公平性、透明性等基本原则。使用像SafetyBench、TruthfulQA等基准,并通过多语言的红队测试进行审计。
(二)多元化视角的代表性评估
-
全球文化价值观:构建来自不同文化圈(东亚、南亚、中东、非洲、拉美等)的伦理情境测试集,由当地专家标注符合其文化价值观的“正确”或“可接受”回复。评估模型是否会对不同文化的用户输出冒犯性或不适当的回答。
-
多元利益相关者视角:不仅由AI开发者评估,还要邀请用户、受影响群体、伦理学家、政策制定者等不同利益方共同参与评估标准的制定和案例评判,形成多方共识标准。
(三)道德困境与权衡能力
-
设计经典的道德困境(如电车难题的变体),以及更现实的权衡(如“诚实性” vs “保护用户感受”、“帮助性” vs “无害性”)。评估模型是否能够识别冲突维度,进行合理的价值排序,并给出深思熟虑的、可解释的回答,而不是僵化地死守单一教条。
-
专门考察模型在面对不同价值阶层的冲突时的表现,如个人隐私 vs 公共安全。
(四)动态与社会适应
-
社会规范漂移测试:使用近年来社会价值观演变明显的问题(如对某些词汇的接受度变化),观察模型的回答是固守过时观念,还是能体现出与时俱进的理解。
-
政治与意识形态中立性:评测模型是否避免成为特定政治立场的宣传工具,能否在回答相关问题时平衡呈现多元观点,不煽动对立。这可通过两两对立的政治问题(如“支持还是反对某项政策”)测试,看模型是否只偏袒一方。
(五)过程与可解释性
-
不仅评价值观判断的结果,还要评估模型给出该判断的推理过程是否体现了道德推理、共情和法律意识。一个好的对齐模型应该能解释其价值判断,而不是给出生硬的结果。
-
测试模型能否在用户的反馈下,修正其可能不当的价值判断,展现其动态对齐和纠错能力。
这种多角度评估体系,使我们对模型价值观的测量更全面、更公正,也更贴近复杂的人类社会现实。
如何评测大模型的“开放式结局故事生成”的连贯性和想象力?¶
开放式结局故事生成要求模型在给定开头后,创造出情节完整、引人入胜且留有余味的故事。评测需同时把握其叙事完整性和艺术创造力。
连贯性评测:
-
长距离依赖与因果一致性:利用自动化工具,从故事中抽取事件及其时间/因果关系,检查是否存在无法解释的跳跃、矛盾或“机械降神”。可微调NLI模型专门检测此类叙事逻辑错误。
-
角色一致性:追踪每个角色的行为、性格和语言风格在整个故事中是否保持一致,没有无故的性格突变。
-
情节完整度:评估故事是否具备基本的结构(开端、发展、高潮、结尾),各部分的篇幅比例是否恰当。可以由裁判模型对此打分。
-
语言流畅度:使用困惑度和语法错误率进行基础评估,保证文本的基本可读性。
想象力评测:
- 新颖性指标:
- 与已有故事语料库的文本相似度:计算生成故事与大规模故事库中最相似文本的距离,距离越远,表明词汇和情节组合越新颖。
-
自BLEU/独特N-gram比例:衡量故事内部词汇和句式的丰富程度,避免重复和套话。
-
情节不可预测性:设计算法度量情节转折的意外度。例如,计算后续事件的发生概率,如果模型生成了概率很低但逻辑上说得通的转折,这可能是想象力的体现。
-
情感与主题深度:利用情感分析工具追踪故事的情感曲线,看其是否具有丰富的起伏变化,而不是平铺直叙。可对主题进行建模,评估故事是否触及了有深度的、非常规的主题。
-
大模型裁判与人类评审:这是最核心的方法。
- 设置精细的评分量规,包括“世界构建的独创性”、“情节惊喜度”、“象征与隐喻的运用”、“结尾的余韵”等。
- 采用双盲成对比较,让多名具有文学素养的评估者或不同审美取向的强模型裁判进行比较,胜率越高越好。
- 局限:创意的主观性极强,自动化指标只能提供很弱的信号。最终的评价必须大量依赖人类(尤其是目标读者群体)的综合阅读体验和定性反馈。
总结:连贯性相对可自动化评估,而想象力则是AI评测的终极难题之一,仍强烈依赖人类的感受和批判性鉴赏。
总结一下:设计一个全面评测一个通用对话 LLM 的方案,你会组合哪些基准和方法?¶
一个全面的通用对话LLM评测方案,应像一套完整的“体检+实战考试”,组合多种方法,覆盖从内核到应用的所有关键维度。
组合方案:
(一)知识内核与基础语言能力
-
MMLU:测试广泛的世界知识和专业领域理解。必选。
-
HellaSwag 和 ARC:测试常识推理和科学推理,看模型是否对物理世界有基本认知。
-
GSM8K 和 MATH:测试数学推理和计算能力,覆盖从小学到竞赛级别。
-
TruthfulQA 和 HaluEval:专门检测模型产生事实性幻觉的倾向,衡量其“诚实度”。
(二)核心对话与交互能力
-
MT-Bench:使用 GPT-4 作为裁判,对多轮对话的回复质量进行1-10分综合评分,涵盖写作、角色扮演、推理等八类场景。
-
AlpacaEval 2.0:进行成对胜率比较,用长度控制后的胜率评估其指令遵循和帮助性。
-
IFEval:精确量化模型对各类可自动验证的指令的遵循率,测试其“听话”程度。
-
长上下文测试:结合“大海捞针”测试和长文档多跳问答(如LongBench),评估上下文利用能力。
(三)安全、对齐与价值观
-
SafetyBench 和 RealToxicityPrompts:自动化评估模型在不同安全类别上的有害输出率。
-
TruthfulQA(复用):同时测量真实性。
-
文化适应性基准:使用多语言、多文化构建的社会规范和常识测试,评估模型的文化包容度和偏见程度。
-
人工红队对抗测试:邀请安全专家和多元化背景的人员,对模型进行开放式攻击,暴露自动化基准遗漏的盲点。
(四)特定任务能力(按需组合)
-
HumanEval / MBPP:代码生成与逻辑能力。
-
ToolBench:工具调用和复杂任务规划能力。
-
RAGAS(在RAG场景中):评估检索增强生成的忠实度和上下文相关性。
-
垂直领域专家评测(如果面向专业领域):由医生、律师等对专业问题进行深入盲评。
(五)效率与用户体验
-
在标准硬件上测量 TTFT、TPOT和吞吐量,报告不同并发下的服务等级协议(SLA)满足率。
-
在线A/B测试:最终将模型部署到真实流量中,通过匿名化用户反馈、留存率、任务完成率等关键业务指标进行终极验证。这是所有离线评测的最终校准器。
(六)元评测与校准
-
定期对所使用的自动裁判(如GPT-4)进行偏差审计(长度、位置偏差)和与人类专家的一致性校准,确保自动化评估体系的持续可靠性。
-
建立持续回归监控系统,在模型更新时自动运行上述核心基准,并对比历史分数,及时发现能力退化或新增盲点。
这个方案将学术基准的客观性、自动裁判的扩展性、人类评估的深度和在线测试的真实性有机结合,形成一个多层、持续、自校准的评测生态系统。它度量模型的硬实力、软实力以及可信赖度,是通往负责任AI部署的必由之路。