从 GPT 到 GPT-2:解密生成式预训练模型的架构演进
摘要在如今大语言模型LLM百花齐放的2026年我们回望过去OpenAI 提出的 GPTGenerative Pre-trained Transformer系列无疑是这一领域的奠基之作。本文将深入剖析 GPT 和 GPT-2 的核心技术架构探讨它们如何通过单向 Transformer 解码器实现强大的文本生成能力并揭示两者在模型规模与细节上的关键差异。1. 引言生成式模型的崛起在自然语言处理NLP的发展史上2018年是一个分水岭。在此之前BERT 等双向模型主导了自然语言理解NLU任务。然而OpenAI 发表的论文《Improving Language Understanding by Generative Pre-Training》提出了一个截然不同的方向——GPT。与 BERT 利用双向上下文预测掩码词不同GPT 采用传统的**自回归Autoregressive方法即利用上文预测下一个单词。这种设计使得 GPT 在自然语言生成NLG**任务上具有天然优势。随后OpenAI 在论文《Language Models are Unsupervised Multitask Learners》中发布了GPT-2。虽然架构上没有颠覆性的创新但 GPT-2 通过使用更大的数据集和更庞大的模型参数证明了“缩放法则Scaling Law”的威力。2. 核心架构Transformer 解码器的独奏GPT 和 GPT-2 的核心架构完全基于 Transformer 的**解码器Decoder**模块。为了理解它们的工作原理我们需要明确它们与经典 Transformer 的区别。2.1 为什么选择解码器经典的 Transformer 由编码器Encoder和解码器Decoder组成。BERT仅使用Encoder擅长理解NLU。GPT/GPT-2仅使用Decoder擅长生成NLG。GPT 系列模型对 Decoder Block 进行了特定的改造子层名称经典 Transformer DecoderGPT / GPT-2 Decoder多头注意力Masked Multi-Head AttentionMasked Multi-Head Attention交互注意力Encoder-Decoder Attention(已移除)前馈网络Feed ForwardFeed Forward关键改动GPT 模型移除了“Encoder-Decoder Attention”层。因为 GPT 是一个纯语言模型不需要像机器翻译那样关注编码器的输出它只需要关注输入序列本身。2.2 单向性的奥秘Masked Self-Attention为了让模型在预测单词uiu_iui时只能看到上文[u1,...,ui−1][u_1, ..., u_{i-1}][u1,...,ui−1]而不能看到未来的信息GPT 引入了Masked Self-Attention机制。原理在计算注意力分数Attention Score进行 Softmax 之前将未来位置右侧的数值替换为一个无穷小的数−∞-\infty−∞。结果经过 Softmax 后未来位置的权重变为 0。例如在预测单词 “C” 时模型只能利用 “A” 和 “B” 的信息从而保证了生成的因果性。3. 深度解析GPT 与 GPT-2 的细节对比虽然两者架构相似但 GPT-2 在细节处理和规模上进行了显著的升级。3.1 模型规模的跃迁GPT 最初的版本采用了12 层Decoder Block 堆叠。而 GPT-2 为了追求更强的性能设计了多个不同规模的版本通过堆叠更深的层数来提升模型容量GPT-2 版本层数 (Blocks)模型维度 (Dimension)存储空间Small (最小版)12768 500MBMedium (中号)241024-Large (大号)361280-Extra Large (超大号)481600 6.5GB注GPT-2 的最大版本参数量远超初代 GPT这也是其能处理更复杂任务的关键。3.2 输入表示与位置编码GPT-2 继承了 GPT 的输入处理方式输入张量h0h_0h0是词嵌入Token Embeddings与位置编码Positional Encodings的加和h0UWeWph_0 U W_e W_ph0UWeWp词嵌入 (WeW_eWe)查找表将单词映射为向量。位置编码 (WpW_pWp)由于 Transformer 没有循环或卷积结构必须显式地加入位置信息。GPT-2 细节GPT-2 的词表大小扩充到了 50,257且能处理最长1024个 Token 的序列。3.3 自注意力机制的运作QKVGPT-2 的核心运算逻辑依然遵循 Query (查询), Key (键), Value (值) 的机制。我们可以用一个形象的比喻来理解Query (Q)就像一张便利贴写着你当前正在研究的课题当前单词。Key (K)像档案柜上文件夹的标签。Value (V)文件夹里实际存放的文件内容。计算流程计算当前单词的 Query 向量与所有单词的 Key 向量的点积得到注意力分数相关度。将分数归一化Softmax。用归一化后的分数对 Value 向量进行加权求和。输出向量作为当前单词在上下文中的新表征。4. 训练范式预训练与微调GPT 系列模型遵循典型的“两阶段”训练过程。4.1 第一阶段无监督预训练目标是最大化给定上文下的单词似然概率。L1(U)∑ilogP(ui∣ui−k,…,ui−1;Θ)L_1(U) \sum_{i} \log P(u_i | u_{i-k}, \dots, u_{i-1}; \Theta)L1(U)i∑logP(ui∣ui−k,…,ui−1;Θ)任务给定句子的一部分预测下一个单词。数据海量的无标注文本GPT-2 使用了 40GB 的互联网数据集。4.2 第二阶段有监督微调 (Fine-tuning)在特定下游任务如文本分类、问答上利用带标签的数据对预训练参数进行微调。输入单词序列[x1,...,xn][x_1, ..., x_n][x1,...,xn]和标签yyy。目标最大化预测标签yyy的概率。5. 生成策略Top-K 采样GPT-2 是一个自回归模型它一次只生成一个 Token。在生成过程中如何从输出的概率分布中选择下一个单词至关重要。贪婪搜索 (Greedy Search)每次都选择概率最高的单词Top-1。缺点容易陷入循环或生成重复、无意义的文本。Top-K 采样从概率最高的 K 个单词中进行随机抽样。例如设置K40K40K40模型会从得分前 40 的单词中按概率选取下一个词。优势增加了生成的多样性避免了死板的重复是 GPT-2 推荐的生成策略。6. 结论回顾 GPT 和 GPT-2 的发展历程我们可以清晰地看到简单的架构仅解码器 大规模的数据 巨大的参数量能够涌现出惊人的语言理解和生成能力。GPT 确立了单向生成的范式而 GPT-2 则证明了通过扩大模型规模可以无需针对特定任务微调Zero-shot就能在多种任务上取得优异表现。这两个模型不仅是技术上的里程碑更是通向如今通用人工智能AGI探索道路上的关键基石。