跳转至

NLP高频面(53)LLM中激活函数详解

NLP高频面(53)LLM中激活函数详解

本文讨论了大型语言模型(LLM)中激活函数的原理、特点、应用及选择方法,旨在为开发者在实际应用中提供激活函数的选择与组合指导。关键要点包括:

激活函数的重要性:激活函数为线性变换结果引入非线性,赋予模型表达复杂语言模式的能力,影响训练稳定性、收敛速度、计算效率与模型性能。

经典激活函数:Sigmoid 将输入压缩到 (0, 1) 区间,Tanh 将输入映射到 (-1, 1),二者均存在梯度消失问题;ReLU 计算简单但可能出现 “死亡 ReLU” 现象,Leaky ReLU / ReGLU 可缓解该问题。

平滑可导激活:GELU 通过与高斯累积分布函数结合实现输入的平滑裁剪,被 GPT-3、BERT 等广泛采用;Swish 兼具线性与非线性特征,收敛表现优于 ReLU。

门控激活:GLU系列将激活函数与门控机制结合,包括GEGLU、SwiGLU、ReGLU,能选择性保留信息、抑制冗余特征,提升模型表达能力。

新兴方案:多项式组合激活(PolyCom)通过高阶多项式映射增强模型对复杂函数的拟合能力,在预训练实验中表现更优。

选择因素:实际开发中需综合考虑任务类型与规模、计算成本、模型架构,并通过实验验证来选择激活函数。

发展趋势:传统激活函数有历史贡献,新的激活函数不断涌现,未来研究可能为模型效能带来更多突破。

引言

在现代大型语言模型架构中,激活函数是贯穿神经网络各层的关键组件。它们通过为线性变换结果引入非线性,从而赋予模型表达复杂语言模式的能力。选择合适的激活函数,不仅影响训练的稳定性与收敛速度,还在推理阶段决定了计算效率与模型性能。本文将系统梳理常见激活函数的原理与特点,并探讨新兴方案在实际 LLM 中的应用。

激活函数概述

激活函数(Activation Function)是一种非线性映射,将神经元的加权输入及偏置进行转换后再传递给下一层。没有激活函数,无论网络有多少层,都将退化为线性模型,无法拟合复杂的自然语言规律。激活函数需满足可导性(以便反向传播)与计算效率(以利大规模模型训练与推理)等基本要求。

经典激活函数

Sigmoid与Tanh


Sigmoid将输入压缩到 $ (0,1) $区间,适合二元分类输出;但梯度在极端值区域接近零,容易导致梯度消失。

Tanh将输入映射到 $ (-1,1) $,相较于Sigmoid中心对称,对特征归一化有帮助;但同样存在梯度消失问题。

ReLU 及变种

ReLU(Rectified Linear Unit)若输入大于零则原样输出,否则输出零;计算简单且具备稀疏激活优势,但可能出现“死亡ReLU”现象。

Leaky ReLU / ReGLU对负值区域引入一个小斜率以缓解神经元“死亡”。ReGLU将ReLU与门控机制结合,兼具稀疏与门控优势。

平滑可导激活:GELU 与 Swish

GELU (Gaussian Error Linear Unit)

GELU 通过与高斯累积分布函数相结合,实现输入的平滑裁剪,能够在保留梯度流的同时弱化不必要的激活。它已被 GPT-3、BERT 等主流 LLM 广泛采用,大幅提升训练稳定性。

Swish / SiLU

Swish(或称 SiLU)定义为(x\cdot \sigma(x)),兼具线性与非线性特征,不仅在零点处连续可导,还在多项任务上展现出比 ReLU 更优的收敛表现。

门控激活:GLU系列

在 Transformer 的前馈网络(FFN)中,将激活函数与门控机制结合可以进一步提升表达能力。典型变种包括:

GEGLU:将 GELU 与线性变换输出进行逐元素相乘。

SwiGLU:用 Swish 代替 GELU,同样实现门控。

ReGLU:结合 ReLU 的稀疏激活与门控。

这种设计既能选择性地保留信息,又能抑制冗余特征,已在多个稠密与稀疏 LLM 预训练配置中取得效果提升。

新兴方案:多项式组合激活(PolyCom)

最新研究提出了“多项式组合激活”(PolyCom),通过高阶多项式映射进一步增强模型对复杂函数的拟合能力。该方法在理论上可达到最优近似速率,并在若干大规模预训练实验中相较传统激活获得更快的收敛与更高的性能指标。

激活函数的选择与实践

在实际 LLM 开发中,激活函数的选取需综合考虑以下因素:


任务类型与规模:文本生成、理解或推理任务可能对非线性能力与稳定性有不同侧重。

计算成本:平滑激活(如 GELU、Swish)往往计算量更大,需平衡硬件资源。

模型架构:门控激活更适合FFN层,而简单的ReLU则在注意力层以外可获得加速优势。

实验验证:应在目标数据集与框架中进行对比实验,确定最优组合。

小结

激活函数是大型语言模型性能的隐形功臣。传统的 ReLU、Sigmoid 与 Tanh 在深度学习史上功不可没,而平滑可导的 GELU、Swish 以及门控 GLU 系列则在 LLM 领域大放异彩。随着 PolyCom 等新方法的提出,未来激活函数研究可能为模型效能带来更多突破。在实际应用中,研发者应结合任务需求与计算预算,通过实验不断优化激活函数的选择与组合。