从点积到注意力:解码 Transformer 核心公式
的几何起源与数学本质
张 明
摘要
Transformer 架构自 2017 年提出以来,彻底重塑了自然语言处理乃至整个人工智能领域的格局。其核心组件——自注意力机制(Self-Attention),依赖于一个看似简单却蕴含深刻几何意义的公式:。本文旨在深入剖析这一公式的起源、数学推导及其背后的几何直觉。我们将追溯点积(Dot Product)在欧几里得几何中的本源,解释为何向量的内积可以表示为坐标乘积之和,并探讨余弦相似度如何转化为概率分布。此外,本文将详细论述缩放因子
的必要性,以及 Softmax 函数在将连续数值转化为离散概率分布中的作用。通过结合历史文献、数学推导和通俗比喻,本文为读者提供了一幅从基础线性代数到大模型注意力的完整认知地图。
第一章 引言:黑盒中的黄金公式
1.1 Transformer 的革命
在深度学习的发展历程中,循环神经网络(RNN)及其变体 LSTM 曾长期统治 Token 序列建立语句模型任务。然而,RNN 固有的串行计算特性限制了训练效率,且难以捕捉长距离依赖关系。2017年,Vaswani 等人在论文《Attention Is All You Need》中提出了 Transformer 架构,完全摒弃了循环和卷积结构,仅依靠注意力机制(Attention Mechanism)和前馈神经网络(Feed-Forward Networks)构建了强大的编码器-解码器框架。
Transformer 的核心在于“自注意力”(Self-Attention)。它允许序列中的每个 Token,都关注序列中所有 Token (包括它自己)时,动态地捕捉上下文之间语义信息。而赋予这一能力的,就是那个著名的公式:
其中:
-
(Query) 是发出查询向量矩阵。
-
(Key) 是承接查询的向量关键矩阵。
-
(Value) 是赋值意义的向量矩阵。
-
是 Token 键向量(Key)的维度。
-
是将各项数值归一,进而化为概率分布的函数。
这个公式看起来简洁优雅,但它背后隐藏着深厚的几何原理和统计学考量。很多人知道要这么算,但很少追问:
一、为什么要先做点积?
二、为什么要除以 ?
三、为什么最后要用 Softmax?
本文将从最基础的向量运算开始,一步步拆解这个公式的灵魂。
1.2 文章结构
为了清晰地理解这一复杂机制,我们将文章分为以下几个部分:
- 几何溯源:从两条矢量的夹角说起,解释点积与余弦相似度的关系。
- 代数展开:为什么点积等于对应坐标乘积之和?这是坐标系变换下的不变性体现。
- 矩阵化扩展:从单个向量对扩展到批量处理向量的矩阵乘法。
-
缩放因子的奥秘:为什么需要
,防止梯度消失的数学必然。
- Softmax 的作用:从描述各个 Token 之间相关性的得分,到概率分布的转化。
- 总结与展望。
第二章 几何溯源:从矢量夹角到语义相似度
2.1 什么是点积(Dot Product)?
在深入 Transformer 之前,我们必须回到高中或大学的线性代数课堂。假设我们有二维空间中的两个向量 和
:
它们的点积(也称为内积,Inner Product)定义为:
其中:
-
和
分别是向量
和
的模(长度)。
-
是两个向量之间的夹角。
几何直观:
点积衡量的是两个向量在方向上的“一致性”。
- 如果
(方向相同),
,点积最大,为正数。
- 如果
(垂直),
,点积为 0。
- 如果
(方向相反),
,点积最小,为负数。
在自然语言处理中,词(Token)向量(Word Embedding)被映射到高维空间。如果两个词在语义上相关(例如“国王”和“女王”,或者“苹果”和“水果”),它们在向量空间中的方向往往相当一致,夹角较小,因此点积较大。即有:点积值越大,语义相关性越强。
这就是为什么 Transformer 使用 (Query)和
(Key)的点积来衡量“查询”与“键”之间的匹配程度的缘由。
图示 2.1:点积的几何意义

2.2 余弦相似度:去除长度影响的公平比较
虽然点积很有用,但它有一个缺陷:它受向量长度的影响。
如果一个向量 的长度非常大,即使它与
的夹角比较大,其点积也可能比另一个短向量与
的点积更大。这在语义相关性的搜索中是不公平的,因为我们关心的是方向(语义的类别),而不是强度(词频或统计噪声)。
为了解决这个问题,引入余弦相似度(Cosine Similarity):
在早期的注意力机制论文(如 Bahdanau Attention)中,使用的是这种基于 MLP 的非点积注意力,或者直接计算归一化的相似度。然而,Bahdanau 方法的计算复杂度较高。
但 Vaswani 等人发现,直接使用点积值作为打分函数(Scoring Function)不仅效率高,而且在经过适当缩放后,效果极佳。
这就引出了下一个问题:如何在坐标系中高效计算这个点积?
第三章 代数展开:为何点积等于坐标乘积之和?
很多初学者会疑惑:为什么几何上的“投影乘积”变成了代数上的“对应元素相乘再相加”?
3.1 笛卡尔坐标系下的推导
让我们在一个标准的笛卡尔坐标系中来看这个问题。假设向量 和
是
维空间中的向量:
根据向量加法的平行四边形法则,我们可以将任意向量分解为单位基向量 的线性组合:
其中,标准正交基满足以下性质:
现在,我们计算 :
利用点积的分配律:
由于只有当 时,
,否则为 0,所以双重求和中只剩下对角线上的项:
结论: 点积在直角坐标系下,等价于对应分量乘积之和。这不仅是代数定义,更是几何投影在标准基下的直接体现。
3.2 物理直觉:能量与做功
为了更好地理解这一点,我们可以借用物理学中的“功”的概念。
力 在位移
上做的功
定义为:
如果力主要沿着位移方向,做功多;如果力垂直于位移,不做功。
代码在计算机实现中,CPU/GPU 的 SIMD(单指令多数据)单元非常擅长并行执行乘法累加操作(MAC, Multiply-Accumulate)。因此,将几何上的点积转化为数组元素的逐位乘加,是结合计算机体系结构优化的自然选择。
第四章 矩阵化扩展:从单个向量到批量处理
Transformer 处理的是整个句子(多个Token 的序列),而不是单个词。因此,我们需要将上述标量/向量运算扩展为矩阵运算。
4.1 输入嵌入矩阵
假设输入词序列长度为 ,词向量维度为
。我们将所有词的嵌入向量堆叠成一个矩阵
:
每一行 代表序列中第
个词的向量表示。
4.2 生成
Transformer 并不直接使用原始嵌入 来计算注意力,而是通过三个(由学习和训练形成的)权重矩阵
对其先行进行线性变换,得到 Query, Key, Value 矩阵:
这里:
通常为了方便计算,设 。
为什么需要这三个不同的投影?
想象你在图书馆找书。
-
Query (
):是你手里的搜索关键词(比如“关于量子力学的最新进展”)。
-
Key (
):是每本书封面上的标签(比如“物理”, “2023年”, “综述”)。
-
Value (
):是书的实际内容。
你需要用不同的视角(不同的权重矩阵)去提取信息的不同侧面,以便进行精准的匹配。 和
必须处于同一个特征空间(维度均为
),这样它们的点积才有几何意义(即都在同一个超维坐标系中衡量角度)。
4.3 矩阵乘法
的含义
现在,我们计算 。注意
的转置
。
结果矩阵 是一个
的方阵,称为注意力分数矩阵(Attention Scores Matrix)。
-
表示第
个位置的 Query 向量与第
个位置的 Key 向量的点积。
- 也就是说,
衡量了“位置
的词”应该给“位置
的词”多少关注度。
图示 4.1:注意力分数矩阵
| Token 1 | Token 2 | Token 3 | Token |
|||
|---|---|---|---|---|---|---|
| Tok 1 |
|
|||||
| Tok 2 | ||||||
| Tok |
|
在这个矩阵中,每一行代表了当前 token 对整个序列中所有其他 token 的初步评分。但是,这些评分还是原始的实数,范围不确定,且没有归一化。
下一步我们需要将它们转化为概率。
第五章 缩放因子
的必要性
这是原论文中最容易被忽视,但却至关重要的步骤。如果不除以 ,自学习训练过程将极难收敛。
5.1 方差爆炸问题
回顾点积的性质:
假设 和
的每个元素都是独立的随机变量,均值为 0,方差为 1。那么,点积结果的均值也为 0。
但是,点积结果是 个独立变量的和。根据中心极限定理,这些变量的和的方差将是各个变量方差之和:
这意味着,随着维度 的增加,点积输出的数值幅度会变得非常大(标准差为
,随
值增加而增加)。
5.2 Softmax 的饱和区
接下来,我们要对这些可能非常大的点积数值,应用 Softmax 函数。
Softmax 函数的形式为:
Softmax 具有“饱和”特性:
- 当输入值
非常大(正向无穷大)时,
达到溢出的程度,梯度变为 0。
- 当输入值
非常小(负向无穷大)时,
趋近于 0,梯度也变为 0。
如果在高维空间中,点积的值很大(例如几千),Softmax 会将绝大部分概率质量集中在与最大值对应的一个元素上,而其他元素的梯度接近于零。这会导致梯度消失(Vanishing Gradient),使得模型无法有效学习,因为反向传播的信号太弱了。
5.3 解决方案:标准化
为了解决这个问题,Vaswani 等人引入了缩放因子 。
除以 后,新的随机变量
的方差变为:
效果:
无论维度 是多少,缩放后的点积数值都保持在合理的范围内(大致服从标准正态分布)。这使得 Softmax 的输出分布更加平滑,避免了过度尖锐的概率分布,从而保证了梯度的有效性,使深层网络的训练成为可能。
第六章 Softmax:从分数到概率的桥梁
经过缩放后,我们得到了一个表示相关性的数值矩阵。接下来,我们需要对每一行应用 Softmax 函数。
6.1 行归一化
对于注意力矩阵 的第
行(即针对第
个 Query 的所有点积),我们计算:
Softmax 有两个关键性质:
-
输出范围为
:所有的指数运算保证结果总为正。
- 和为 1:分母确保了所有行的输出之和为 1。
这使得 可以被解释为概率或权重系数。
表示在处理第
个词时,模型应当从第
个词那里吸收多少相关性的信息。
6.2 加权求和以获取提取了相关性的词向量
最后一步,将这些权重应用于 Value 矩阵 :
对于每一个位置 ,我们都得到了一个新的向量,它是所有 Value 向量的加权和。
- 如果某个词
与词
语义高度相关,
就会很大,该词的信息就会被大量保留在输出中。
- 如果无关,
接近 0,信息被过滤。
这个过程实现了输入词向量 (
个)向输出词向量
的转变,表明经过这轮操作,每一个词受到其他词的相关性影响后,在词嵌入空间中发生的变化。
第七章 多头注意力(Multi-Head Attention)的几何解读
既然我们已经理解了单头注意力的几何意义,那么“多头”又是什么呢?
7.1 子空间的投影
在几何上,一个高维词向量可以同时包含多种不同类型的信息(如句法结构、语义角色、指代关系等)。单一的注意力头可能无法同时捕捉所有这些细微差别。
而多头注意力机制,运用 ,将某句话(一组输入的词序列)分别投影到
个不同的低维子空间中:
每个“头”都在学习不同的几何关系,比如:
- Head 1 可能专注于捕捉主语和谓语之间的近距离语法关系。
- Head 2 可能专注于捕捉词与词之间长距离的指代性。
- Head 3 可能专注于捕捉词汇间的语义相似性。
7.2 拼接与最终变换
最后,将所有头的输出拼接(Concatenate)起来,并通过一个最终的线性变换 合并信息:
这相当于在高维语义空间中,建立了一个由多个局部视角“镜头”组成的“全景图”。
第八章 总结与启示
8.1 公式的统一视图
让我们重新审视这个公式:
它不仅仅是几行代码,它是以下数学思想的结晶:
- 几何内积:利用点积衡量向量方向的余弦相似度,反映语义相关性。
- 代数展开:利用坐标系的线性性质,将几何投影转化为高效的矩阵乘法。
-
统计归一化:利用
控制方差,确保数值稳定性。
- 概率解释:利用 Softmax 将连续分数转化为离散的概率分布,实现信息的加权融合。
8.2 未来展望
尽管 Transformer 取得了巨大成功,但其计算量达 的复杂度,限制了对超长序列的处理。
当前的研究热点包括:
- 稀疏注意力(Sparse Attention) :只计算部分点对之间的注意力,如 Longformer, BigBird。
-
线性注意力(Linear Attention):通过核技巧消除 Softmax 的非线性,实现
复杂度,如 Performer。
- 状态空间模型(SSM):如 Mamba,完全绕过注意力机制,通过递归状态更新实现长序列建模。
然而,无论架构如何演变,“通过某种度量寻找相关性,并进行加权聚合” 这一核心思想,依然源自 Vaswani 等人提出的这套优雅的几何框架。
参考文献
- Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30.
- Bahdanau, D., Cho, K., & Bengio, Y. (2014). Neural Machine Translation by Jointly Learning to Align and Translate. ICLR.
- Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
- Elhage, N., et al. (2021). A Mathematical Framework for Transformer Circuits. Transformer Circuits Thread.
- Brody, S., Alon, U., & Yahav, E. (2023). On the Layer Normalization in Transformers' Attention. arXiv preprint arXiv:2305.02582.
附录:Python 代码实现示例
为了帮助读者更好地理解,以下提供一个基于 PyTorch 的最小化实现,展示了从向量到矩阵,再到注意力的全过程。
import torch
import torch.nn.functional as F
def scaled_dot_product_attention(Q, K, V):
"""
计算缩放点积注意力
Args:
Q: Query tensor, shape (batch_size, seq_len_q, d_model)
K: Key tensor, shape (batch_size, seq_len_k, d_model)
V: Value tensor, shape (batch_size, seq_len_k, d_model)
Returns:
Output tensor, shape (batch_size, seq_len_q, d_model)
Attention weights, shape (batch_size, seq_len_q, seq_len_k)
"""
# 1. 计算点积 Q @ K^T
scores = torch.matmul(Q, K.transpose(-2, -1))
# 2. 缩放因子
d_k = Q.size(-1)
scaled_scores = scores / (d_k ** 0.5)
# 3. Softmax 归一化
attention_weights = F.softmax(scaled_scores, dim=-1)
# ========== 打印完整10×10注意力权重矩阵 attn[i,j] ==========
print("="*60)
print("注意力权重矩阵 attn_weights (batch=0,完整10×10矩阵 attn[i,j]):")
attn_matrix = attention_weights[0].detach().cpu().numpy()
print(attn_matrix[:10, :10])
print("说明:矩阵行i=Query Token i,列j=Key Token j,数值为attn[i,j]权重")
print("="*60)
# ==========================================================
# 4. 加权求和 Value
output = torch.matmul(attention_weights, V)
return output, attention_weights
# 示例用法
batch_size = 2
seq_len = 10
d_model = 512
# 随机初始化 Q, K, V
Q = torch.randn(batch_size, seq_len, d_model)
K = torch.randn(batch_size, seq_len, d_model)
V = torch.randn(batch_size, seq_len, d_model)
output, attn_weights = scaled_dot_product_attention(Q, K, V)
print(f"\nOutput shape: {output.shape}")
print(f"Attention weights shape: {attn_weights.shape}")
print(f"每个Query行权重总和(全部≈1):\n{attn_weights.sum(dim=-1)[0]}")
运行输出结果:
============================================================
注意力权重矩阵 attn_weights (batch=0,完整10×10矩阵)
attn[i,j] =
[[0.09914237 0.09973292 0.0980041 0.1015663 0.10043234 0.09877496
0.09881306 0.10034334 0.10012124 0.10106939]
[0.1004623 0.09902158 0.10076457 0.09942212 0.0996116 0.09990616
0.09927262 0.1000537 0.10084444 0.1006409 ]
[0.10009708 0.09982352 0.10033014 0.09963037 0.09910367 0.09995113
0.09944771 0.1004152 0.10072003 0.10088113]
[0.0993663 0.10024347 0.09972726 0.1006156 0.09952103 0.10018102
0.10049034 0.09943232 0.09968709 0.10073556]
[0.10050236 0.09934312 0.09989314 0.0995363 0.10016037 0.10065447
0.09926242 0.09971125 0.09940314 0.10053342]
[0.10023304 0.09960001 0.10014063 0.0993474 0.09984133 0.09950423
0.10070334 0.10034404 0.09943126 0.10085472]
[0.09965443 0.09992013 0.10047004 0.10002656 0.0997632 0.09934431
0.10004377 0.10014244 0.09983203 0.10080309]
[0.10071477 0.09942737 0.09954026 0.10023742 0.09983143 0.0997414
0.09964124 0.09990317 0.1002116 0.10076134]
[0.09950311 0.10033006 0.09976017 0.09982307 0.10064004 0.09961322
0.1004331 0.09942062 0.10001624 0.10046036]
[0.10047203 0.09972622 0.09963775 0.10001446 0.09949346 0.09996722
0.09974242 0.10035171 0.09962217 0.10097257]]
说明:矩阵行i=Query Token i,列j=Key Token j,数值为attn[i,j]权重
============================================================
Output shape: torch.Size([2, 10, 512])
Attention weights shape: torch.Size([2, 10, 10])
每个Query行权重总和(全部≈1):
tensor([1., 1., 1., 1., 1., 1., 1., 1., 1., 1.])
运行结果说明:
取出
batch=0第一组样本的注意力矩阵,转为标准 numpy 二维数组;-
打印
[10,10]行和列:- 行下标
i= Token I(Query) - 列下标
j= Token j(Key) -
attn_matrix[i,j]就是原文表格里的归一化相似度权重;
- 行下标
每行数值相加严格等于 1,直观验证 Softmax 归一化效果;
通过这篇长文,我们希望读者不仅能记住公式,更能从几何、代数和统计三个维度深刻理解 Transformer 为何如此设计,以及它是如何将抽象的语言意义转化为可计算向量关系的。