一、什么是PCA
- PCA(principal component analysis)中文称作主成分分析。
是一种降维方法。在生物学数据中,每个样本都有成千上万个基因的测量指标,每个基因就是一个特征(也可称为维度),因此该数据就有成千上万个特征/维度。我们肉眼无法对那么高维度的数据进行直观的观察,挑选几个最重要的维度可以直观地考察样本之间最重要的区别,这几个最重要的维度就是“主成分”。
二、示例解读:

- 横坐标,第一主成分及贡献率:
贡献率最高的主成分,贡献率是该主成分的方差在整体方差中的占比,占比越高,代表总体数据的权重越高。 - 纵坐标,第二主成分及贡献率:
贡献率次高的主成分。 - 样本:
样本在主成分空间中的位置,样本之间距离表示在主成分空间中的差异大小。如果样本之间聚集在一起,说明这些样本差异性小;反之样本之间距离越远,说明样本之间差异性越大。 - 分组信息:
根据实验需求设置的样本分组,在图中按不同颜色区分以明显看出不同组间的差别。 - 样本分布的置信区间:
圆圈表示95%置信区间内的样本分组。圆圈大小反映样本点分布集中程度,而圆圈之间的距离则体现了样本组之间的离散程度。
三、如何理解PCA分析
- 为了更好地区分样本,挑选最重要主成分/维度的过程不是直接按现有的特征/维度去挑选,而是进行一些数学变换。我们用一个二维数据(人的身高和体重这两个特征)去理解这过程。下表是AI随机生成的3个男性和3个女性的身高和体重的数据:
| 样本 | F1 | F2 | F3 | M1 | M2 | M3 |
|---|---|---|---|---|---|---|
| 身高 | 165 | 170 | 160 | 178 | 185 | 172 |
| 体重 | 55 | 62 | 50 | 75 | 90 | 68 |
我们想要在图上展示,可以通过身高体重的二维散点图进行展示,如A图。
同样,我们用PCA的方法处理这数据,得到B图:

比较散点图和PCA图,我们发现这两者只是做了空间变换,但相对空间位置是一样的。PCA图将大部分的差异集中在PC1中(99.6%的贡献度),而PC2中只有0.4%的贡献度。
把身高、体重等指标换成每个基因的表达量,就是我们常见的生物学数据。
理论上来说,n维的空间可以得到不超过n个主成分,但由于人类的视觉最多只能观察3维的数据,因此PCA一般只展示二维或三维的结果。
四、PCA计算过程原理
-
根据前面对PCA的理解,我们可以知道,PCA分析的计算过程,就是如何进行数据变换并投射到各个维度(主成分)的过程。这过程可以分为5步:
五、资料
知乎:
[什么是PCA分析?手把手教你理解PCA - 知乎]
(https://zhuanlan.zhihu.com/p/1908087326053238090)
[PCA(主成分分析)的理解与应用 - 知乎](https://zhuanlan.zhihu.com/p/60664507)
