大师兄的贝叶斯网络学习笔记(四十三):贝叶斯网络(十七)
大师兄的贝叶斯网络学习笔记(四十五):贝叶斯网络(十九)
八、结构学习
3. 大样本模型选择
- 贝叶斯信息准则(Bayesian information criterion)简称BIC评分是另一个模型评分函数。
- BIC评分是在大样本前提下对边缘似然函数的一种近似,它有明确直观的意义,而且使用方便,是实际中最常用的评分函数。
- 本节主要利用拉普拉斯近似(Laplace approximation)方法,对
进行大样本近似,从而推导出BIC评分函数。
- 基本的想法是在最大似然函数附近把对数似然函数展开,然后将计算转化为一个多元正态分布函数在极值点的领域的积分。
- 为简化记号,把
标记为θ。
- 用
记θ的最大似然估计。
- 注意,
依赖于模型结构G
- 假设它是G的参数空间的一个内点(interior point),即对所有i,j,k,
。
- 这样,
作为
的最大值点是被式唯一确定的。
- 关于先验参数分布
,假设它在
周围是光滑的并且不为零。
- 最后,还假设数据是完整的。
- 为了考察
的性质,简记
为
。
- 有
。
- 于是,
。
- 根据假设,我们已经知道,做一个θ的函数,
在
处达到唯一的最大值。
- 另一方面,在样本量m很大时,
也很大。
- 当
与
之间距离的增加时,
的取值迅速降低。
- 又因为
在
周围光滑且不为零,所以
可以用
在
的一个小领域
中的积分来近似,即
。
- 在
周围将
进行泰勒展开,得在领域
内,有
。
- 其中
是
的黑塞矩阵(Hessian matrix)在
的值:
。
- 以下用A记-
,
是一个凹函数,从而A是正定的。
- 根据
在
附近的光滑性,在小领域
内,有:
。
- 得:
。
- 其中参数向量θ由
个独立参数组成。
- 由于以A为协方差矩阵、以
为均值的正态分布的密度函数是
,而且
,所以
。
- 于是有$\begin{align}
\log P(\mathcal{G} | \mathcal{G}) \approx \log P(\mathcal{G} | \mathcal{G}, \theta^*) - \frac{1}{2} \log |A| \
- \log p(\theta^* | \mathcal{G}) + \frac{d}{2} \log (2\pi).
\end{align}$。
- 上面公式成为
的拉普拉斯近似。
- 拉普拉斯近似的后两项不依赖于样本量m,一般将其略去。
- 而
可以用d log m 来近似,于是得到:
。
- 这就是模型结构G的BIC评分,记为
。
- BIC评分的第一项是模型G的优参对数似然度,它度量的是结构G与数据D的拟合程度。
- 第二项是一个关于模型复杂度的惩罚项(penalty)。
- 若仅仅依据优蚕丝然度来选择模型,会选到最复杂的完全贝叶斯网络,从而导致过拟合。
- 由于附加了一个模型复杂度的惩罚项,BIC有效地避免了过度你和。
- 直观上,基于BIC评分选择模型就是要选择即与数据拟合、又比较简单的模型。