大规模数据的标签传播
1.2.1 预备知识
【定义 1】设 是数域
(实数域或复数域)上的线性空间. 对
. 如果存在映射
满足以下三个条件:
- (第一变元线性})
- (共轭对称性)
- (正定性)
则称 是
上的一个内积, 并称
为向量
的内积. 配置了内积的线性空间
称为内积空间. 称
为
诱导的范数. 如果
是 Banach 空间, 那么称
为 Hilbert 空间.
【命题 1】(Cauchy-Schwart 不等式) 若 为内积空间, 则有
【命题 2】(极化恒等式)若 是内积空间, 则由内积诱导出的范数与内积满足下述等式:
【定理 1】(内积导出范数的特征)赋范线性空间 中的范数
是由某一内积诱导出来的(即可内积化)的充要条件是下述的平行四边形法则公式成立:
【定义 2】设 是数域
(实数域或复数域)上的
维内积空间, 它的一组基为
, 对于任意的
,
,
则 分别称为
在基
下的坐标. 记
称之为
在基
下的度量矩阵. 故而, 有内积
【定义 3】(矩阵的内积[1]) 矩阵的内积记作 , 令
定义 为两个『拉长向量』
和
之间的内积
对于任意的 和
容易验证:
因此, 是
上的内积空间.
1.2.2 半监督学习
有一个数据集 ,其中
代表数据集
的特征, 是一个张量;
代表数据集
的标签张量[2].
由于本文仅仅考虑图片数据, 所以我们有:
-
可以是一个包含图片像素值的一维张量, 亦可以是彩色图片的像素值组成的三维张量.
-
可以是一个
对应的标签的字符串或者是字符串所代表的数值型特征, 亦或者是其字符串的 One-hot[3] 形式等.
这里令下标 和
分别代表有标签数据和无标签数据 (同时
和
也分别代表有标签数据和无标签数据的样本数, 且
). 不失一般性, 本文记
数域 上的线性子空间
上定义一个映射
记
下面先基于 构建一个图
, 其中节点集
, 边集
可表示为一个亲和矩阵 (affinity matrix, 矩阵中每个元素表示两两之间的相似性分数[4])
, 令
故而, 对角矩阵
由
(
被称为拉普拉斯矩阵[5]) 则可以定义
的能量函数为
上面的 和
的不同将可以设计出不同的模型. 由上面的分析可以知道:
的情境
令 ,
当 可以不相等时, 记
标签传播算法(Label Propagation)及 Python 实现
-
张贤达著.矩阵分析与应用[M].北京:清华大学出版社.2004. ↩
-
维基百科.张量.[DB/OL].https://zh.wikipedia.org/zh-hans/張量. ↩
-
Wikipedia.One-hot.[DB/OL].https://en.wikipedia.org/wiki/One-hot. ↩
-
朱文涛,袁勇.Python计算机视觉编程[M].北京:人民邮电出版社,2014.7:152-154. ↩
-
Chung, F. (1997). Spectral graph theory (Vol. 92 of the CBMS Regional Conference Series in Mathematics). Conference Board of the Mathematical Sciences, Washington ↩