一文学会大模型Transformer架构

概述

Transformer模型架构是在论文Attentions is All you need 中提出的模型,其使用 Self-Attention 结构取代了在 NLP 任务中常用的 RNN 网络结构。相比 RNN 网络结构,其最大的优点是可以并行计算。

架构设计

Transformer模型架构

Transformer本质上是一个Encoder-Decoder 架构,因此Transformer模型主要由两个部分组成:左侧的编码器(Encoder)和右侧的解码器(Decoder)。
每个部分由多个层组成(重复 N 次),编码器的输出会作为输入传递给解码器。

编码器(Encoder):

输入嵌入(Input Embedding): 输入的文本(或序列)首先被转换成嵌入向量,这些嵌入是词或标记的向量表示。
位置编码(Positional Encoding): 由于Transformer没有循环或卷积结构来建模序列的顺序,因此加入了位置编码,以提供序列中标记的位置信息。

编码层(Layers): 每一层编码器包含以下模块:
  • 多头注意力机制(Multi-Head Attention): 这一层使模型能够同时关注输入序列的不同部分。多个注意力头(heads)独立计算注意力,然后连接在一起并进行线性变换。
  • 加法和归一化(Add & Norm): 每个子层周围有残差连接,随后进行层归一化,以稳定训练过程。
  • 前馈网络(Feed Forward): 这是一个两层的全连接网络,独立应用于序列中的每个位置。
  • 层叠结构: 编码器由多个相同的层叠加而成(重复 N 次)。

解码器(Decoder):

输出嵌入(Output Embedding): 与编码器类似,解码器也接收输出序列(右移一个位置)的嵌入表示,以及位置编码。
带掩码的多头注意力机制(Masked Multi-Head Attention): 这是解码器的第一个注意力层,与编码器的多头注意力不同。在这里使用掩码,以防止每个位置看到序列中的后续位置(这对自回归解码非常重要)。
编码器-解码器注意力(Multi-Head Attention with Encoder Outputs): 这一层关注编码器的输出,使解码器在生成每个输出标记时能够聚焦于输入序列的相关部分。
前馈网络和加法归一化层(Feed Forward and Add & Norm Layers): 与编码器类似,解码器也有前馈网络和残差连接及归一化。
层叠结构: 解码器也由多个相同的层叠加而成(重复 N 次)。

输出层:

在最后的解码器层之后,有一个线性变换层,接着是一个softmax层,用来生成输出的概率分布。softmax层会为每个可能的词或标记输出一个概率,使模型能够预测序列中下一个最有可能的标记。

注意力机制(Attention Mechanism):

注意力机制是Transformer模型的核心。它通过计算输入特征的加权组合,使模型能够捕捉到输入和输出序列中不同词语之间的关系。
多头注意力机制允许模型同时关注序列的不同部分,从而增强模型理解上下文关系的能力。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容