资讯动态

Transformer 学习篇 六 —— 完整的 Transformer 宏观网络结构

发布时间:2026/8/25 11:42:09 来源:尧图企业网站定制
完整的 Transformer 宏观网络结构经过前面我们对 QKV、多头注意力、位置编码和解码器机制的拆解现在是时候把这些“乐高积木”拼装起来看看完整的 Transformer 宏观网络结构了。Transformer 的经典架构源自 2017 年那篇著名的论文 Attention Is All You Need分为左右两座大山左边是 Encoder编码器右边是 Decoder解码器。经典 Transformer 架构图 (源自论文)宏观架构数据流动的全过程你可以通过下面的交互式图表直观地梳理数据是如何在编码器和解码器中一步步流转的。第一部分Encoder编码器—— 榨干原文的信息编码器的唯一目的就是把输入的源文本比如英文转换成一个富含上下文语义的高维矩阵。输入处理Input Embedding Positional Encoding先把输入的词汇转成词向量然后加上位置编码让模型知道词的顺序。进入 N 个堆叠的编码块Block模型通常会把下面这个流程重复 N 次比如 6 次多头自注意力层 (Multi-Head Attention)让句子里的每个词互相认识提炼上下文。残差连接与层归一化 (Add Norm)XLayerNorm(XAttention(X))XLayerNorm(XAttention(X))XLayerNorm(XAttention(X)) 防止梯度消失稳住数据分布。前馈神经网络 (Feed-Forward Network)两个线性层中间夹一个ReLUReLUReLU激活函数对每个词的特征进行非线性升维和降维进一步提取高级特征。再次残差连接与层归一化 (Add Norm)。输出经过 N 层后编码器输出一个“终极特征矩阵”即前面提到的提供给解码器的KKK和VVV。第二部分Decoder解码器—— 蒙眼作诗解码器的任务是根据编码器提取的特征结合自己已经生成的前半句话预测下一个词。它同样也是 N 个块堆叠而成的。目标输入处理Output Embedding Positional Encoding把已经生成的词汇训练时是目标句子的平移版本转化为向量并加上位置编码。进入 N 个堆叠的解码块Block掩码多头自注意力层 (Masked Multi-Head Attention)算自注意力但严格遮挡未来的词防止模型偷看答案。残差连接与层归一化 (Add Norm)交叉注意力层 (Cross-Attention)核心桥梁 这里的QQQ来自下面的掩码自注意力输出而KKK和VVV来自编码器的最终输出。解码器在这里向原文“要线索”。残差连接与层归一化 (AddAddAddNormNormNorm)。前馈神经网络 (FFNFFNFFN) 及随后的AddAddAddNormNormNorm与编码器完全一样。第三部分输出预测Output线性层 (LinearLinearLinear)把解码器最后一层输出的高维向量拉伸成一个长度等于“词汇表大小”的超长向量比如 50,000 维。SoftmaxSoftmaxSoftmax层将这个超长向量转化为概率分布所有概率相加等于 1。选词概率最高的那一维对应的词就是模型预测出的下一个词。现代大模型的架构变迁了解了上面这个经典架构后你必须知道今天的大语言模型如ChatGPTChatGPTChatGPT、LlamaLlamaLlama等发生了怎样的演变目前行业内基本放弃了这种“对称”的结构走向了三个不同的分化分支Decoder-Only仅解码器代表作 GPT 系列 (ChatGPTChatGPTChatGPT), Llama,QwenQwenQwen。做法 彻底砍掉左边的 Encoder也砍掉中间的交叉注意力层。只保留右边的 Decoder。把问题和回答当成一句话从头到尾只做“掩码自注意力预测下一个词”。事实证明规模做大后这种架构生成能力无敌。Encoder-Only仅编码器代表作 BERT, RoBERTa。做法 彻底砍掉右边的 Decoder。只用来做阅读理解、文本分类、情感分析和完形填空。它不擅长写长文在理解已有文本的深度上极其出色。Encoder-Decoder经典保留代表作 T5, BART, 多数机器翻译模型。做法 依然保留原始的完整架构。在“输入一段话翻译/总结成另一段话”如翻译、文本摘要的任务中效率最高。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价