t-SNE降维原理

前言

PCA是一种线性降维算法,不能解释特征之间的复杂多项式关系。如果特征与特征之间的关系是非线性的话,用PCA可能会导致欠拟合的情形发生。

线性降维算法的一个主要问题是它们集中将不相似的数据点放置在较低维度区域时,数据点相距较远。但是为了在低维、非线性曲面的流型上表示高维数据,我们也需要把相似的数据点放在一起展示,这不是线性降维算法所能做的。

t-SNE是一种比PCA更有效的非线性降维方法,它是基于在邻域图上随机游走的概率分布,可以在数据中找到其结构关系。t-SNE在高维空间中采用的高斯核心函数定义了数据的局部和全局结构之间的软边界,可以同时保留数据的局部和全局结构。局部方法寻求将流型上的附近点映射到低维表示中的附近点。 另一方面,全局方法试图保留所有尺度的几何形状,即将附近的点映射到附近的点,将远处的点映射到远处的点。

对同样的一组数据降维,t-SNE的结果明显优于PCA——

PCA结果图

image

t-SNE结果图

image

t-SNE降维原理

简易原理

假设我们现在需要将二维平面上分布的点降到一维直线上,

image

如果我们直接将这些点投放在x轴或者y轴,不同颜色/cluster的点会会混合在一起。

t-SNE首先会将这些点随机摆放在直线上,然后t-SNE会逐渐将这些点移动,直到它们聚在一起(保留二维空间上的分布特征)。

image

这些点是如何移动的呢?

黄色点来自于同一cluster,因此最左边上的这个黄色点希望朝其余的黄点靠近,而红色点由于和黄色的点不属于同一cluster,因此会被排斥。

image

如同上述所讲,低维空间上的点会被其在高维空间的临近点所吸引,相对的,会排斥那些远距离的点。然后就这样一步一步的,原本高维空间上距离较近的点会逐渐聚拢在一起。

image

详细原理

上面大致描述了一下t-SNE如何将近距离的点聚拢在一起。

但是如何判断谁和谁相互吸引?谁和谁相互排斥呢?

Step 1

计算二维平面上所有点的相似性(similarity)。

首先计算黑色点和其周围点的距离(此处暂时以两个点为例,黑色和蓝色),然后将这两个点排放在以黑色点为中心的正态曲线下,接下来计算蓝色点到正态曲线的长度(unscaled similarity distance,也成为similarity score)。

image

进而,我们获得了黑色点同其余所有点的similarity scores。

image

similarity score大,表明两个点在二维平面上的距离近;相对的,表明两个点在二维平面上的距离远。

Step 2

获得黑色点同其余所有点的similarity score后,我们需要对这些scores进行标准化,使得它们加和为1。

为什么要进行标准化处理呢?

scaled similarity scores代表cluster的相对紧密度。

假设平面上有一个新紫色的cluster(我们暂且认为紫色cluster的分布和蓝色cluster完全一样,只是密度(density)是蓝色cluster的两倍,那么紫色cluster正态曲线的宽度也会是蓝色cluster的两倍(正态曲线的高度和宽度由方差决定)),

image

进行标准化处理后,这两个cluster的similarity score就是一样的了(上面提到过,t-SNE可以同时保留数据的局部和全局结构)。

image

当然了,t-SNE还有一个混乱度(perplexity)的参数来表示预期的密度(这个我还没搞明白,暂时步说了)。这个其实影响不大,实际上,这两个cluster的相似性远比我们自己预期的要大的多。

接下来我们会获得每一个点同其余所有点的scaled similarity scores。

Step 3

问题来了,由于每一个点所对应正态曲线的宽度是由其周围点分布的紧密度来决定的。那么两个点之间,前后两次计算的similarity scores可能会不同。所以t-SNE会将这两个点的similarity score求均值。

image

最终,我们可以获得一个矩阵,每一行/列表示这个点同其他点的similarity score。

image

Step 4

计算一维直线上所有点的similarity scores。

同之前计算二维平面上点的计算过程一般,选择一个指定的点,然后计算其同周围点的距离,进而获得similarity scores。只是这次使用的曲线从正态分布变为t分布。

image

这就是为什么t-SNE为什么有一个t的原因了。

此时获得的矩阵比上面那个矩阵显得混乱一些。

image

t-SNE每次移动一下直线上的点,移动的目的是为了让上图左边的矩阵变得像右边一样。

image

Reference

https://juejin.im/entry/5a65b689f265da3e2b1689eb

https://medium.com/d-d-mag/%E6%B7%BA%E8%AB%87%E5%85%A9%E7%A8%AE%E9%99%8D%E7%B6%AD%E6%96%B9%E6%B3%95-pca-%E8%88%87-t-sne-d4254916925b

申明

本文是根据StatQuest系列视频整理而来
已获得Josh Starmer授权说明
感谢久久琼殷不辞辛苦将视频转载至B站

Permmsion

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 217,406评论 6 503
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 92,732评论 3 393
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 163,711评论 0 353
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 58,380评论 1 293
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 67,432评论 6 392
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,301评论 1 301
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,145评论 3 418
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,008评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,443评论 1 314
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,649评论 3 334
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,795评论 1 347
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,501评论 5 345
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,119评论 3 328
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,731评论 0 22
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,865评论 1 269
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,899评论 2 370
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,724评论 2 354

推荐阅读更多精彩内容