NLP高频面(57)DeepSeek系列概览与发展背景¶
大型模型浪潮背景¶
近年来,大型语言模型(Large Language Model, LLM)领域发展迅猛,从GPT-3等超大规模模型的崛起到ChatGPT的横空出世,再到GPT-4的问世,模型参数规模和训练数据量呈指数级增长。以GPT-3为例,参数高达1750亿,在570GB文本数据上训练,显示出模型规模、数据量和算力对性能的巨大提升作用。研究表明,LLM的性能随模型大小、数据规模和计算量呈幂律上升关系。更重要的是,当模型在海量数据上训练后,往往会出现“小模型不具备而大模型涌现”的新能力——即使在未见过的任务上,大模型也能展现出零样本或少样本学习的能力。
在这一浪潮中,开源社区同样功不可没。早期有EleutherAI等组织尝试复现 GPT-3 的开源版本(如 GPT-Neo、GPT-J等),而2023年Meta发布的LLaMA模型提供了高质量的基础模型,使研究者能够在此基础上微调出诸如Vicuna等各类开源对话模型。参数规模从几十亿到上千亿不等的开源模型相继出现,验证了规模、数据对模型能力的关键影响。同时,关于 $ ^{} $“Scaling Laws” $ ^{} $(规模定律)的研究进一步系统阐明:模型越大、训练语料越充足,性能提升越显著,但也需要平衡训练计算成本和数据规模,以避免浪费模型容量。这一系列进展奠定了大模型时代的基础,也让学术界和工业界认识到参数和数据量对于催生模型涌现智能至关重要。
DeepSeek的定位¶
在大模型蓬勃发展的背景下,DeepSeek系列模型应运而生。DeepSeek由中国团队于2023年创立。与OpenAI等公司的闭源策略不同,DeepSeek选择走开源道路,立志打造开源界的顶尖大模型,对标当时最强的闭源模型如GPT-4。DeepSeek团队自研了高效的大模型训练框架和超大规模智算集群(拥有万卡级别算力),为训练超大参数模型提供了坚实保障。其发布的每个模型版本均公开了模型权重、代码和技术报告,展现出高度的学术含量和严谨性。在业界看来,DeepSeek系列模型背后的论文技术深度“含金量”不亚于OpenAI GPT系列,实现了学术前沿探索与开源共享的有机结合。这种定位体现了DeepSeek的野心:在开放领域实现与闭源旗舰模型比肩的性能,以开源协作加速通用人工智能的发展。
系列版本沿革¶
DeepSeek自推出以来,已经发布了多个系列的大模型版本。以下简要列出主要的版本演进(包括通用模型V系列、推理增强的R系列、多模态VL系列和代码领域Coder系列),并概括各版本的发布时间和技术亮点,供读者纵览其发展路线图:
DeepSeek-V1(2023年):DeepSeek的首个通用大语言模型,于2023年底开源发布。模型参数规模为67B,采用Transformer架构并在中英文混合的超大规模语料(约2万亿Token)上从头训练。DeepSeek-V1借鉴了LLaMA的设计并作出改进,例如采用预范数化的RMSNorm、SwiGLU激活函数和
旋转位置编码等,支持较长上下文窗口并引入分组查询注意力(GQA)优化推理效率。作为DeepSeek开山之作,V1奠定了基础模型的能力水平,证明了大参数规模配合海量数据在中文与英文任务上的强大潜力。
DeepSeek-V2(2024年5月):第二代通用模型,2024年5月发布。DeepSeek-V2引入了创新的混合专家(Mixture-of-Experts,MoE)架构,总参数达2360亿,其中每个输入Token仅激活约210亿参数。得益于MoE稀疏计算和多头潜在注意力(MLA)等技术,V2在保持或提升性能的同时显著降低了资源消耗:相比V1,训练成本节省42.5%,KV缓存需求减少93.3%,最大生成吞吐量提高5.76倍。V2支持128K超长上下文并提供标准版和精简版两个规模(精简版160亿参数,有效激活24亿),满足不同算力需求。在多个权威基准上,DeepSeek-V2实现了与OpenAI GPT-4-Turbo相当的性能,而推理API价格仅为后者的1/70,“性能对标GPT-4-Turbo、成本大幅降低”使其一举成名,成为开源大模型的新标杆。
DeepSeek-V3(2024年12月):第三代通用模型,2024年12月正式推出并开源。DeepSeek-V3是大规模MoE架构的集大成者,拥有总参数6710亿(每个Token激活37亿)。模型在约14.8万亿Token的海量语料上进行了预训练,规模远超前代。凭借先进的架构和训练策略,V3在各项评测中全面领先于同期开源模型,如Qwen2.5-72B和LLaMA-3.1-405B等;其综合性能已经媲美当时世界顶尖的闭源模型,包括OpenAI的GPT-4o及Anthropic的Claude-3.5等。DeepSeek-V3展示了在超大规模数据和参数下开源模型逼近甚至追平闭源模型的可能性,同时因为采用MoE技术,其实际计算开销仅相当于同等能力稠密模型的一小部分,这凸显了架构创新在大模型发展中的价值。
DeepSeek-R1(2025年1月):强化推理能力的旗舰模型,于2025年初发布并完全开源。R1中的“R”代表““Reasoning”**(推理),体现该模型专注于复杂推理任务的设计初衷。DeepSeek-R1建立在V3-Base模型之上,采用了大规模强化学习(RL)策略进行后期训练:首先推出未经过监督微调直接RL训练的实验版本R1-Zero,显示了强大的数学推理涌现能力,但伴随输出重复、可读性差等问题;随后在RL前引入少量冷启动监督数据微调,得到正式版本DeepSeek-R1。这种两阶段训练使R1在避免模式崩溃的同时,将模型推理能力发挥到极致。结果表明,DeepSeek-R1在数学、代码推理和常识问答等任务上的表现已可与OpenAI同级别的闭源模型相媲美。值得一提的是,R1的研发成本约为600万美元—远低于业界训练同规模顶尖模型的普遍投入,体现了DeepSeek在效率上的卓越追求。DeepSeek-R1的诞生标志着开源大模型在复杂推理能力上取得里程碑式突破,为通向通用人工智能的推理能力奠定了基础。
DeepSeek-VL系列(2024年):多模态视觉语言模型系列。DeepSeek-VL(Vision-Language)于2024年推出,旨在融合视觉和语言信息,实现跨模态的智能。初代DeepSeek-VL提供了约70亿和13亿参数规模的两个变体,通过在图像-文本对数据上的训练,能够执行图像描述生成、视觉问答(VQA)、光学字符识别(OCR)和文档理解等任务,拓展了大模型的多模态认知能力。2024年12月,DeepSeek团队发布升级版本DeepSeek-VL2。VL2引入了混合专家架构,包含Tiny、Small和Base三种规模(激活参数分别为1.0B、2.8B、4.5B)。与前代相比,VL2在各项视觉语言任务中表现卓越,许多指标达到当时国际最先进水平。同时,VL2在保持高性能的情况下大幅压缩了有效参数量,以更低的计算开销实现了与其他更大规模开源多模态模型相当或更优的效果。DeepSeek-VL系列的演进展示了开源模型在多模态智能领域的探索成果,为图文结合的AI应用奠定了模型基础。
DeepSeek-Coder系列(2023-2024年):面向编程领域的大语言模型系列。DeepSeek-Coder是针对代码生成与理解任务专门优化的模型,可用于代码自动补全、代码解释和错误修复等应用。首个
DeepSeek Coder模型于2023年11月发布,作为DeepSeek问世的第一款开源模型,预示着开源大模型在程序语言处理上的新起点。2024年6月,DeepSeek-Coder-V2发布,带来了代码模型的重大升级([DeepSeekV2:这个新的开源的模型在多个基准测试中击败了GPT-4、Claude-3和Llama-3!以降低部署门槛。新版本在约8万亿Token的混合代码/文本语料上进行了预训练,大幅提升了编程和数学领域的能力。据多项权威评测显示,DeepSeek-Coder-V2在HumanEval等代码基准上取得了超过GPT-4-Turbo的成绩,在MBPP、GSM8K等任务上表现出色,整体代码和数学能力已跻身全球第二,仅次于最强闭源模型GPT-4o)。此外,Coder-V2支持长达128K的代码上下文窗口,并兼容多达338种编程语言(远超旧版支持的86种)。DeepSeek-Coder系列为开发者提供了强大的开源代码大模型工具,其问世标志着开源社区在专业编程智能领域实现了对闭源模型的首次超越)。