跳转至

Transformer 与大型语言模型

Transformer 的注意力机制公式,为什么要缩放?自注意力的计算复杂度。

注意力机制公式 Transformer的核心是缩放点积注意力(Scaled Dot-Product Attention)。给定查询(Query)矩阵 Q、键(Key)矩阵 K 和值(Value)矩阵 V,注意力输出为:

image.png

为什么要缩放?

image.png

image.png


BERT 和 GPT 的预训练目标分别是什么?Masked LM vs Autoregressive LM。

BERT:Masked Language Model (MLM)

  • 预训练目标:随机遮盖输入序列中的一部分词(如15%),让模型预测被遮盖的词。训练目标是复原被遮盖的词,利用上下文双向信息。

  • 具体操作:在输入句子中,对选中的token:

  • 80%概率替换为特殊标记 [MASK]
  • 10%概率替换为随机词。
  • 10%概率保持不变(但仍需预测)。 这种策略缓解了预训练和微调时 [MASK] 标记不匹配的问题。

  • 双向建模:BERT的Transformer编码器可以同时看到被遮盖词左右两边的上下文,因此能融合双向信息,对理解类任务(如文本分类、问答、命名实体识别)非常有效。

  • 辅助任务:除MLM外,BERT还使用下一句预测(NSP),判断句子B是否是句子A的下一句,以学习句子间关系。后续变体(如RoBERTa)移除了NSP,仅靠MLM即可。

GPT:Autoregressive Language Model (AR LM)

image.png

  • 单向建模:GPT使用Transformer解码器,带有因果掩码(Causal Mask),确保每个位置只能看见自身和之前的token,不能看未来信息。这使得GPT天生适合文本生成任务(如对话、续写、翻译)。

  • 自回归生成:推理时,模型逐词生成,每一步将已生成的词作为上下文预测下一个词,直到输出结束符。

对比:

特性 BERT (MLM) GPT (AR LM)
建模方向 双向 单向(从左到右)
预训练任务 还原掩码词 预测下一个词
架构 Transformer编码器 Transformer解码器
下游适应 微调(加分类头) 微调 或 提示/上下文学习
擅长任务 理解(分类、QA、NER) 生成(对话、摘要、代码)
代表模型 BERT, RoBERTa, ALBERT GPT-1/2/3/4, LLaMA, PaLM

后续融合:T5等模型将文本任务统一为文本到文本的格式,使用Encoder-Decoder架构,整合了双向编码和自回归解码。近年来,GPT系列的生成式预训练由于其在对话和通用任务上的卓越表现成为主流。


大型语言模型的涌现能力指什么?可能的原因是什么?

涌现能力(Emergent Abilities) 指模型在达到一定规模(参数量、计算量或数据量)后,突然展现出在较小模型中不存在或极弱的能力,且这些能力并非被显式训练或设计。这些能力的增长通常呈非线性,当模型尺寸超过某个阈值时性能急剧上升。

典型涌现能力表现:

  • 复杂推理:大模型可以进行多步算术推理、常识推理、逻辑推理,如思维链提示(Chain-of-Thought)显著提升数学题和推理题的正确率。

  • 上下文学习 (In-Context Learning):GPT-3 展示了只需在提示中加入几个示例(few-shot),无需微调,就能完成新任务。这种能力在小模型上很弱。

  • 角色扮演与指令遵循:能够理解并遵循复杂的、开放式的用户指令,维持对话角色和风格。

  • 代码生成与执行:不仅能生成代码,还能模拟代码执行过程,进行逻辑推断。

  • 语言理解和生成的飞跃:如对幽默、隐喻的理解,多语言翻译,生成高度连贯和有创意性的长文本。

可能的原因:

  • 规模定律 (Scaling Laws):模型损失随参数、数据、计算量的幂律下降。当损失降到足够低时,模型能够学习到更高阶的模式和结构,从而解锁新能力。

  • 隐式元学习:海量数据和超大参数提供了巨大的记忆和组合空间,模型在预训练过程中隐式学习了“学习算法”(如梯度下降、模式匹配)的内部回路,使其在面对新任务时能通过上下文快速“微调”自身行为。

  • 数据中的潜在结构:网络文本中天然存在大量推理链、问答对、代码注释、教程等结构化数据。当模型足够大时,不仅能记忆这些知识,还能归纳出通用的推理模式。

  • 平滑与相变:性能随规模的提升在某些任务上表现为突然的“相变”,可能与高维空间中损失的曲面结构有关——在某个临界点,模型找到了能泛化到特定任务的最优表示。

  • 稀疏激活与模块化:大模型内部可能自发形成了模块化的计算回路,某些神经元组合专门处理特定类型的推理,当规模足够时这些模块协同工作,产生涌现能力。

争议:部分研究者认为某些涌现能力是评估指标的非线性变化导致的(如使用不连续的评测指标),而并非模型行为真正的突变。但多数实验支持规模带来的质变。


什么是 RLHF(基于人类反馈的强化学习)?它在 ChatGPT 中的作用。

RLHF (Reinforcement Learning from Human Feedback) 是一种将人类偏好注入语言模型训练的范型,用于使模型对齐人类价值观、意图和审美。

RLHF 的三个阶段:

  1. 监督微调 (SFT, Supervised Fine-Tuning) 收集人类标注的高质量指令-回答对,对预训练语言模型进行微调。这一步让模型初步学会遵循指令,输出格式正确、风格自然的回答。

  2. 奖励模型训练 (RM, Reward Model Training)

  3. 对于给定提示,使用SFT模型生成多个候选回答(通常4-9个)。
  4. 标注人员对这些回答进行偏好排序(A > B > C > D),形成比较数据。

image.png

  1. 强化学习微调 (RL Fine-Tuning, PPO算法)

  2. 使用强化学习对SFT模型进行进一步优化。目标不仅是最大化奖励,还要防止模型过拟合奖励模型或偏离太远。

image.png

在 ChatGPT 中的作用:

  • 对齐人类意图:RLHF使ChatGPT能理解并遵循复杂指令,而不是只延续文本。它学会了何时拒绝回答不当请求、承认不知道、纠正错误前提。

  • 提高有用性和安全性:通过人类偏好排序,模型被训练得更加有帮助、更少产生有害输出、更符合社会规范。

  • 改善生成质量:回答变得更详细、条理清晰、减少废话,且能进行多轮对话。

  • 减少幻觉:虽然不能根治幻觉,但通过奖励模型,模型被鼓励生成与事实更一致、更谨慎的回答。

RLHF是ChatGPT成功的关键技术之一,将大语言模型从“强大的文本续写器”转变为“交互式的、有帮助的AI助手”。


指令微调(Instruction Tuning)是如何让模型对齐人类意图的?数据如何构造?

指令微调 是在自然语言指令表述的任务上对预训练模型进行微调,使模型能理解和遵循人类的各种指令,而不仅限于特定格式的任务。

如何对齐人类意图:

  • 传统微调通常将每个任务格式化为特定结构(如分类加softmax头)。指令微调将所有任务统一为“指令-回答”的文本到文本格式,例如:

  • text

  • [指令] 将以下句子翻译成英文:今天天气真好。[回答] The weather is really nice today.

  • 通过大量多样化的指令数据,模型学会了泛化到未见过的指令,具备零样本任务执行能力。模型内化了“理解指令 → 执行任务 → 生成符合要求的回答”的元能力。

  • 这种训练使得模型不再需要针对每个任务进行单独微调,单一模型即可处理成百上千种任务,真正实现“一个模型做所有事”。

数据构造方法:

  1. 人工标注:聘请标注人员根据给定任务编写指令和高质量回答。这是质量最高的数据,但成本高、数量有限。早期工作如FLAN、InstructGPT即依赖人工。

  2. 利用现有数据集转换:将已有NLP数据集的标签和输入自动转化为指令模板。例如,将情感分类数据集转化为“判断以下评论的情感是积极还是消极:{text}”。可使用多个模板增加多样性。此方法可规模化,但指令多样性不足。

  3. 利用强大LLM自生成(Self-Instruct):

  4. 用少量人工示例作为种子,让LLM生成新的指令、输入实例和输出。
  5. 对生成的数据进行过滤(去除低质量、重复、有害内容)。
  6. Alpaca、Vicuna等模型即通过这种方式从GPT-3.5/GPT-4生成训练数据,取得了令人瞩目的效果。

  7. 迭代式数据改进:使用模型生成回答,人工或自动评分,筛选高质量数据加入训练集,循环提升模型。

  8. 多任务与多语言融合:融入多种语言、多种任务类型(生成、分类、推理、代码等),提升泛化性。

关键挑战:

  • 指令多样性覆盖:要覆盖真实用户各种可能的提问风格和任务类型。

  • 回答质量:自动生成的数据可能包含幻觉或错误,需要过滤。

  • 模型能力平衡:避免在某一类任务上过拟合,导致其他能力下降(灾难性遗忘)。高质量指令微调通常也混合预训练数据一起训练。

指令微调是连接通用预训练模型与实用AI助手的关键桥梁,极大提升了大模型的交互体验和实用性。


LoRA 等参数高效微调方法的原理是什么?低秩分解如何减少可训练参数?

参数高效微调 (PEFT) 旨在不修改原模型大部分参数的情况下,仅训练少量额外参数,使大模型适应下游任务,大幅降低存储和计算成本。

LoRA (Low-Rank Adaptation) 是一种代表性的PEFT方法。其核心假设:模型在适应下游任务时,权重矩阵的更新(增量)是低秩的。

原理:

image.png

参数效率:

  • 原始参数数量 d×kd×k,LoRA 参数数量 r(d+k)。当 r 很小时,参数量大幅减少。例如,对于 d=k=4096,r=16,LoRA参数量约为 16×8192≈131k,而原始参数约 16.8M,仅占 0.77%。

  • 大大减少了存储空间(只需保存一个小的LoRA模块而非完整模型副本)和训练显存(无需存储大部分参数的梯度)。

其他 PEFT 方法:

  • Adapter:在Transformer层中插入小型神经网络模块,通常为瓶颈结构(降维→激活→升维)。仅训练这些适配器和输出层。

  • Prefix Tuning / Prompt Tuning:在输入或每层的前面添加可学习的虚拟token(软提示),仅训练这些token的嵌入。

image.png

LoRA在实践中非常成功,因其实现简单,可与原模型无缝切换,支持多任务(每个任务保存独立的LoRA权重),在语言和视觉领域广泛应用。


大模型的幻觉问题有哪些表现形式?如何评估和缓解?

幻觉 (Hallucination) 指模型生成的内容与事实不符、与输入上下文矛盾、或逻辑上荒谬。表现形式包括:

  • 事实性幻觉:编造不存在的人物、事件、数据、引用。例如,生成一篇关于某项研究的摘要,但论文实际不存在。

  • 忠实性幻觉:输出偏离用户的输入指令或上下文。例如,要求总结一段文字,却添加了原文没有的信息。

  • 连贯性幻觉:前后矛盾,逻辑混乱,同一回答内自相矛盾。

  • 知识截断:对于训练数据截止后的事件或信息,模型可能错误推测。

  • 过度泛化:将特定领域的知识错误应用到不相关领域。

评估方法:

  • 人工评价:标注人员判断回答是否包含幻觉、是否事实正确。成本高,主观。

  • 基于自然语言推理 (NLI):将生成陈述与参考知识库比对,判断是否蕴含(Entailment)或矛盾。

  • TruthfulQA:包含专门设计的问题,测试模型是否模仿人类错误认知。

  • HaluEval / FACTOR 等基准:自动或半自动评估幻觉。

  • 检索增强评估:让模型生成答案时附带引用,然后验证引用是否支持所述内容。

缓解策略:

  1. 检索增强生成 (RAG):在生成前从外部知识库检索相关文档,作为生成的证据,大幅减少事实错误。

  2. 强化学习对齐 (RLHF / DPO):通过人类偏好数据,让模型学习更谨慎、更诚实,学会说“我不知道”。

  3. 事实性微调:在高质量、事实准确的数据上微调,降低模型对模糊知识的依赖。

  4. 约束解码:在解码时禁止生成与已知事实相悖的token。

  5. 后处理验证:用另一个验证模型检查生成内容,或使用事实验证管线。

  6. 提示工程:在系统提示中要求模型“仅基于已知事实回答,不确定时表明不确定性”。

幻觉是大模型从统计数据中学习而不是真正“理解”世界的内在局限,当前尚无根治方法,需要多层防护。


思维链(Chain-of-Thought)提示如何增强模型推理能力?

思维链 (Chain-of-Thought, CoT) 是一种提示方法,通过让模型在生成最终答案之前,显式地生成中间的推理步骤,从而显著提升复杂推理任务的准确率。

工作原理:

  • 传统提示直接要求模型输出答案,对于需要多步推理的问题(如数学应用题、常识推理、符号推理),模型容易出错。

  • CoT 在提示中提供示例时,不仅给出最终答案,还给出详细的分步推理过程。例如:

Q: 罗杰有5个网球。他又买了2罐网球,每罐3个。他现在有多少个网球?
A: 罗杰一开始有5个球。2罐网球每罐3个,共6个球。5+6=11。答案是11。
  • 模型在回答新问题时,会模仿这种模式,自动输出推理步骤,然后给出最终答案。这个过程被称为“思考链”。

为何增强推理:

  • 分解复杂问题:将复杂问题分解为一系列简单子问题,逐步求解,降低了认知负荷。

  • 提供可解释性:用户可以看到模型的推理过程,便于检验和信任。

  • 引导模型计算:对于数学问题,CoT 让模型有机会显示中间计算结果,避免“跳步”导致的错误。

  • 激发涌现能力:大模型在配合CoT时展现出小模型没有的复杂推理能力,可以说CoT是解锁涌现能力的一把钥匙。

变体:

  • 零样本CoT:不提供示例,仅添加“让我们一步步思考”这样的提示,也能激发模型推理。

  • 自一致性 (Self-Consistency):多次采样生成多个CoT回答,然后取出现频率最高的最终答案,进一步提升鲁棒性。

  • 思维树 (Tree-of-Thoughts):不只生成一条思维链,而是探索多条推理路径,评估并回溯,实现更系统的探索。

CoT简单而有效,已成为提升大模型推理性能的标准技巧,广泛应用于数学、代码、规划等领域。


大模型的知识边界:何时会胡说八道?如何通过检索增强(RAG)补充知识?

知识边界与胡说八道的诱因:

大语言模型的知识来自其训练数据,存在明确边界:

  • 训练数据截止:模型知识停留在训练数据收集的时间点,此后发生的事件完全未知。

  • 长尾实体:对罕见实体、冷门专业知识覆盖不足,容易生成错误的属性或关系。

  • 数据噪声与偏见:训练数据中存在的错误信息会被模型学习并复现。

  • 推理失败:即使相关事实在训练数据中出现过,模型在组合推理时可能出错,生成不合逻辑的结论。

  • 过度自信:模型被训练为总是提供答案,当遇到未知信息时,倾向于编造听起来合理但实际上错误的内容(幻觉)。

RAG (Retrieval-Augmented Generation) 如何补充知识:

RAG 在生成回答前,先从外部知识库(如维基百科、公司文档、数据库)中检索与当前查询最相关的文档或片段,将这些检索结果作为额外的上下文,与用户查询一起输入给语言模型,再由模型生成回答。这样,模型不必完全依赖自身权重中记忆的知识,而是可以基于最新、最权威的外部信息进行回答。

RAG的流程:

  1. 查询编码:将用户问题编码为向量。

  2. 检索:使用该向量在向量数据库中进行相似度搜索,取回 top-k 个最相关的文本片段。

  3. 上下文增强:将这些片段与原始问题拼接,形成提示:“根据以下信息回答问题:[文档内容] \n 问题:[用户问题] \n 回答:”

  4. 生成:大模型基于增强的提示生成回答,通常会附上引用。

RAG的优势:

  • 知识实时更新:无需重新训练模型,只需更新外部数据库即可获得最新信息。

  • 降低幻觉:生成内容受检索到的证据约束,大幅减少胡说八道。

  • 可验证性与可解释性:回答可附带来源链接,便于用户核实。

  • 领域专业化:可以使用专业语料库,将通用模型转化为领域专家。

  • 记忆卸载:将大量事实知识卸载到数据库,模型专注于推理和生成,更加高效。

RAG已成为部署可靠、可更新、事实性强的AI系统的关键架构范式,广泛应用于企业知识库问答、搜索引擎、医疗法律辅助等场景。


缩放定律(Scaling Law)揭示了模型性能与参数、数据、计算量之间的什么关系?

缩放定律 (Scaling Laws) 是由OpenAI、DeepMind等发现的关于大模型性能随规模提升的经验规律,主要描述了模型测试损失(loss) 与参数量 (N)、训练数据量 (D)、计算量 (C) 之间的幂律关系。

经典关系(以Kaplan et al., 2020为代表):

image.png

这些指数 α 通常为正数,意味着随着资源投入,loss 以幂律形式持续降低(但边际收益递减)。重要结论:

  • 计算最优分配:在给定计算预算下,参数与数据量应同比例增长(如增加一倍参数应配合增加一倍数据),否则会存在“欠训练”或“过参数化”。

  • 超越幂律的可能:当模型极大时,有观察表明某些任务性能可能出现相变式飞跃(涌现),但整体损失仍遵循幂律。

Chinchilla 缩放定律 (Hoffmann et al., 2022):

DeepMind的Chinchilla更精确地指出,之前的许多大模型(如GPT-3)是训练不足的。在固定计算预算下,最优的参数与数据量应大致相等(token数 ≈ 20倍参数量)。例如,70B参数的模型应在约1.4T tokens上训练。这一发现促使后续模型(如LLaMA)采用更多数据来训练较小参数的模型,以取得更佳性价比。

揭示的关系:

  • 性能可预测性:在训练早期,可以通过较小规模的实验外推预测大模型在更大资源下的最终性能,指导资源规划。

  • 资源瓶颈:揭示了要实现特定性能,所需的计算资源和数据量级,推动更大规模基础设施的建设。

  • 数据为王:Chinchilla强调,高质量的数据量比单纯增加参数更重要,引发了数据筛选和合成数据的浪潮。

缩放定律是驱动基础模型规模不断扩大的理论基础,也为高效分配资源提供了指导。


MoE(混合专家)架构如何实现大模型的条件计算?Switch Transformer 等。

MoE (Mixture of Experts) 是一种神经网络架构,它通过条件计算来大幅增加模型总参数量,而每次前向传播只激活其中一小部分参数,从而在保持计算开销可控的同时提升模型容量。

基本工作原理:

  1. 多个专家:将传统Transformer中的FFN层替换为多个并行的“专家”子网络(通常也是FFN,但不同专家学习不同模式)。每个专家都是独立的参数。

  2. 门控网络 (Router/Gating):一个可训练的门控模块,根据输入token的表示,输出每个专家的得分,选择其中最合适的少数专家(如Top-2)来处理该token。

image.png

  1. 稀疏激活:每个token只路由给少量专家(如2个),因此虽然模型总参数极大(如MoE版本的Switch Transformer有上万亿参数),但每个输入token实际使用的计算量(有效参数量)与一个Dense模型相当。

  2. 负载均衡损失:为了防止门控总选择少数几个专家导致负载不均和训练崩溃,需要添加辅助损失,鼓励token均匀分配到所有专家。

Switch Transformer (Fedus et al., 2021):

  • 在MoE基础上进行了简化:每个token只路由给单个专家(Top-1),进一步减少计算。

  • 设计了高效的负载均衡损失,以及在大规模分布式训练中的专家并行策略。

  • Switch-C模型拥有1.6万亿参数,在训练速度和下游任务上相比传统T5模型有显著提升,证明MoE在大规模训练中的有效性。

MoE的优势:

  • 用相同的计算预算获得更大模型容量,性能更强。

  • 由于不同专家倾向于学习不同领域或模式,可以实现一定程度上的知识专门化。

  • 有利于终身学习和多任务学习,增加新知识时可添加新专家而不破坏旧专家。

挑战:

  • 负载均衡困难,部分专家可能“死掉”。

  • 分布式训练中跨设备通信开销大(需要将token路由到可能位于不同设备上的专家)。

  • 推理时显存占用大(需存储所有专家参数)。

MoE架构是实现万亿参数级大模型的关键技术,广泛应用于GPT-4(据传)、GLaM、Mixtral等模型。


KV Cache 在推理中的作用?如何通过 GQA、MQA 等降低其内存占用?

KV Cache 是自回归Transformer模型推理时的关键显存优化技术。在自回归生成中,每生成一个新token,模型需要用到所有之前生成的token作为上下文。如果不加缓存,每次都要将完整的当前序列重新输入模型,重新计算所有历史token的Key和Value矩阵,计算量会随序列长度平方增长。

KV Cache 原理:

image.png

降低KV Cache的方法:GQA 和 MQA

为了减少KV Cache的大小,可以减少K和V的“头”的数量,即多个查询头共享同一组键值头。

  • MQA (Multi-Query Attention):所有查询头共享同一组 K 和 V。KV Cache大小变为原来的 1/h(h为头数),极大压缩缓存,但可能限制注意力表达能力。

  • GQA (Grouped-Query Attention):将查询头分为若干组,每组共享一组 K 和 V。例如,32个查询头分为8组,每组4个查询头共享同一组KV。这样在压缩缓存的同时,保留了比MQA更多的灵活性。GQA在LLaMA 2等模型中被广泛采用。

其他优化:

  • 量化KV Cache:将缓存的K、V值量化为INT8或FP8,大幅降低内存。

  • 滑动窗口注意力:只缓存最近的一部分token,丢弃较远的历史。

  • PagedAttention (vLLM):将KV Cache分页管理,减少显存碎片,提高利用率。

  • 多级缓存:利用GPU的共享内存和寄存器层级缓存部分KV。

KV Cache和针对它的优化是提升大模型推理吞吐、支持更长上下文的关键。


大模型对齐的挑战:有害输出、偏见、安全问题如何应对?

对齐挑战:大语言模型(LLM)在预训练阶段从互联网文本中学习,这些数据包含偏见、仇恨言论、虚假信息、隐私等不适宜内容。此外,模型强大的生成能力可能被滥用生成有害内容。对齐旨在使模型的行为符合人类价值观、法律和伦理规范。

主要挑战与应对:

  1. 有害输出(Toxic, Harmful Content)

  2. 表现:生成暴力、色情、歧视性言论,或协助非法活动(如制造武器、黑客攻击)。

  3. 应对:

  4. 数据过滤:在预训练阶段就过滤掉有害内容,但难以穷尽。
  5. 监督微调 (SFT):使用安全的指令数据训练模型拒绝回答不当问题。
  6. RLHF / DPO:通过人类偏好数据让模型学习安全的回答模式。
  7. 安全提示词:在系统级添加强调安全的指令前缀。
  8. 内容审查API:在输入和输出端部署额外的检测模型进行过滤和阻止。

  9. 社会偏见(Social Bias)

  10. 表现:在性别、种族、宗教、职业等方面表现出刻板印象或歧视。例如,将“护士”默认与女性关联,或将某些族裔与负面特质关联。

  11. 应对:

  12. 去偏数据:平衡数据中的代表性,使用反事实数据增强。
  13. 去偏微调:在包含去偏示例的数据集上微调。
  14. 偏见评估基准:使用 WinoBias、StereoSet、BBQ 等评估,持续监控。
  15. 可控生成:允许用户指定或调整生成内容的属性。
  16. 透明度和解释:让模型解释其推理依据,暴露潜在偏见。

  17. 安全问题(Safety, Misuse)

  18. 表现:生成钓鱼邮件、虚假信息(Disinformation)、诱导自我伤害、泄露训练数据中的隐私等。

  19. 应对:

  20. 红队测试 (Red Teaming):专门团队持续尝试突破模型安全防线,发现漏洞后迭代修复。
  21. 指令层次化:设置不可逾越的系统级安全准则。
  22. 安全与有用性权衡:通过RLHF中的奖励塑形,在安全性和实用性之间找平衡。
  23. 数字水印:对生成内容嵌入不可见标记,追踪滥用来源。
  24. 访问控制与速率限制:防止大规模恶意使用。

  25. 过度依赖与欺骗性

  26. 模型可能表现出过度自信的权威语气,用户容易过度信任其错误建议。

  27. 通过校准不确定性、训练模型承认未知、提供引用来源等来缓解。

大模型对齐是一个持续的、动态的过程,需要技术手段、政策法规和行业自律的结合,没有一劳永逸的方案。


从 GPT 到 LLaMA,开源大模型的趋势和影响。

趋势演变:

  1. 闭源主导期:以GPT-3 (2020) 和 GPT-4 (2023) 为代表的闭源模型,通过API提供服务,性能遥遥领先,但透明度、可定制性和数据隐私方面存在局限。

  2. 开源追赶期:

  3. LLaMA (Meta, 2023):推出了7B到65B系列,在公开数据集上训练,其较小模型性能就超过了GPT-3,且因为开源权重,迅速点燃了全球研究者和开发者的热情。LLaMA-2 (2023) 进一步开源了经过RLHF对齐的聊天版本,并允许商用。

  4. Falcon, Mistral, Mixtral, Qwen等纷纷涌现,模型性能不断逼近闭源模型。

  5. 社区创新:围绕LLaMA权重,社区开发了LoRA等高效微调方法,可在消费级硬件上微调大模型;产生了Vicuna、Alpaca、Guanaco等指令微调变体。

  6. 开源生态繁荣:

  7. 工具链成熟:Hugging Face Transformers、PEFT、Accelerate等使得模型加载、微调、部署极为便捷。

  8. 垂直领域应用:开源模型被微调用于医疗、法律、教育、代码等专业领域,构建专有知识库问答系统。

  9. 边缘部署:量化(如GGUF)和优化(如llama.cpp)使得大模型能在手机、笔记本电脑本地运行,隐私和离线使用成为可能。

深远影响:

  • 民主化AI:小型公司和个人开发者也能使用和定制最先进的大模型能力,降低了行业门槛。

  • 创新加速:透明开放的研究环境促使全球学术机构和企业协同改进模型架构、训练方法、安全对齐,创新速度远超单个闭源实验室。

  • 安全与审计:开源模型可被独立审计和红队测试,其风险和偏见更易被发现和解决。

  • 数据隐私与自主性:企业可以在自己的基础设施上部署开源模型,保障敏感数据不出域。

  • 削弱垄断:避免AI能力被少数商业实体完全控制,形成多元化的技术生态。

挑战:开源也可能使恶意行为者更容易获取强大模型用于欺诈、虚假信息等,增加了滥用风险。因此,负责任的发布和持续的安全研究至关重要。

现状:开源大模型正以前所未有的速度缩小与闭源模型的差距,在多个基准上已达到可竞争的水平,成为推动AI普及的核心动力。


你如何看待大模型通往通用人工智能(AGI)的道路?

大语言模型的出现为AGI的实现提供了令人振奋的路径,但当前模型仍存在显著局限,距离真正的AGI尚有距离。

大模型的巨大潜力:

  • 通用知识引擎:在海量文本上学到的世界知识覆盖面极广,展现了某种“宽泛的智能”。

  • 涌现能力:上下文学习、思维链推理、代码生成等能力表明,随着规模扩大,模型能从统计模式中涌现出类思考的行为。

  • 多模态融合:GPT-4V、Gemini等将视觉、听觉与语言结合,向全面感知发展。

  • 工具使用:模型能调用API、搜索引擎、计算器,与环境交互,弥补自身不足。

  • 学习范式突破:从监督学习到自监督预训练,再到RLHF对齐和检索增强,学习框架越来越完善。

目前的根本局限:

  • 缺乏真正的理解和因果推理:模型本质上是“序列预测机器”,基于模式匹配而非因果模型。它可能在语法正确的情况下做出不合逻辑的推理。

  • 没有持续的自我意识和记忆:模型的世界模型是静态的,不能像人类一样持续学习和更新个人经历,容易遗忘或混淆。

  • 幻觉与可靠性不足:模型在不能确定时仍自信生成错误内容,且缺乏自省能力。

  • 缺乏身体和物理世界经验:智能可能需要在物理世界中交互才能真正理解基本概念(如空间、重量、意图),即所谓的“具身智能”。

  • 能源与效率:人脑以极低的功耗完成复杂智能活动,而当前大模型能耗巨大,效率极低。

通往AGI的可能路径:

  • 世界模型与仿真:构建能够预测环境行为的世界模型,结合强化学习在模拟或真实环境中学习。

  • 神经符号结合:将神经网络的模式识别能力与符号系统的逻辑推理、知识表示结合,实现更可靠的推理。

  • 持续学习与元学习:赋予模型从少量样本持续学习新概念而不遗忘旧知识的能力。

  • 多智能体协作:多个专业化的AI智能体协作完成任务,展现更复杂的群体智能。

  • 脑科学与人工智能的交叉启发:从人类认知架构中获取灵感,如全局工作空间理论、预测编码等。