大师兄的贝叶斯网络学习笔记(四十四):贝叶斯网络(十八)

大师兄的贝叶斯网络学习笔记(四十三):贝叶斯网络(十七)
大师兄的贝叶斯网络学习笔记(四十五):贝叶斯网络(十九)

八、结构学习

3. 大样本模型选择
  • 贝叶斯信息准则(Bayesian information criterion)简称BIC评分是另一个模型评分函数。
  • BIC评分是在大样本前提下对边缘似然函数的一种近似,它有明确直观的意义,而且使用方便,是实际中最常用的评分函数。
  • 本节主要利用拉普拉斯近似(Laplace approximation)方法,对P(D|G)进行大样本近似,从而推导出BIC评分函数。
  • 基本的想法是在最大似然函数附近把对数似然函数展开,然后将计算转化为一个多元正态分布函数在极值点的领域的积分。
  • 为简化记号,把\theta_G标记为θ。
  • \theta^*=\{ \theta^*_{ijk |i=1,2,...,n;j=1,2,...,q_i;k=1,2,...,r_i} \}记θ的最大似然估计。
  • 注意,q_i依赖于模型结构G
  • 假设它是G的参数空间的一个内点(interior point),即对所有i,j,k, \theta^*_{ijk}>0
  • 这样,\theta^*作为P(D|G,\theta)的最大值点是被式唯一确定的。
  • 关于先验参数分布p(\theta|G),假设它在\theta^*周围是光滑的并且不为零。
  • 最后,还假设数据是完整的。
  • 为了考察P(D|G,\theta)的性质,简记\log P(D|G,\theta)l(\theta)
  • l(\theta) =\sum^n_{i=1}\sum^{G_i}_{j=1}\sum^{r_i}_{k=1}m_{ijk}log\theta_{ijk}=\sum^n_{i=1}\sum^{q_i}_{j=1}m_{ij}*[\sum^{r_i}_{k=1}\theta^n_{ijk}\log\frac{\theta_{ijk}}{\theta^n_{ijk}}+\sum^{r_i}_{k=1}\theta^n_{ijk}\log\theta^n_{ijk}]
  • 于是,P(g \mid \theta, \Theta) = \prod_{i=1}^{n} \prod_{j=1}^{q_i} \left( \exp \left\{ \sum_{b=1}^{r_i} \theta_{ijk}^* \log \frac{\theta_{ijk}}{\theta_{ijk}^*} + \sum_{b=1}^{r_i} \theta_{ijk}^* \log \theta_{ijk}^* \right\} \right)^{m_{ij}}
  • 根据假设,我们已经知道,做一个θ的函数,P(D|G,\theta)\theta^*处达到唯一的最大值。
  • 另一方面,在样本量m很大时,m_{ij}*也很大。
  • \theta\theta^*之间距离的增加时,P(D|G,\theta)的取值迅速降低。
  • 又因为p(\theta|G)\theta^*周围光滑且不为零,所以P(D|G) = \int P(D|G,\theta)p(\theta|G)d\theta可以用P(D|G,\theta)p(\theta|G)\theta^*的一个小领域nb(\theta^*)中的积分来近似,即P(D|G) \approx \int_{nb(\theta^*)}P(D|G,\theta)p(\theta|G)d\theta
  • \theta^*周围将l(\theta)进行泰勒展开,得在领域nb(\theta^n)内,有l(\theta)\approx l(theta^*)+\frac{1}{2}(\theta - \theta^*)^Tl^{''}(\theta^n)(\theta - \theta^*)
  • 其中l^{''}(\theta^{''})l(\theta)黑塞矩阵(Hessian matrix)\theta^{''}的值:l''(\theta^*) = \frac{\partial^2 l(\theta)}{\partial \theta_{ij} \partial \theta_{i'j'}} \bigg|_{\theta = \theta^*}
  • 以下用A记-l^{''}(\theta^{''})l(\theta)是一个凹函数,从而A是正定的。
  • 根据p(\theta|G)\theta^{''}附近的光滑性,在小领域nb(\theta^{''})内,有:p(\theta | \mathcal{Y}) \approx p(\theta^* | \mathcal{Y})
  • 得:\begin{align} P(g|g) &\approx \int \exp\{l(\theta)\} p(\theta|g) d\theta \\ &\approx \int_{n(\theta^*)} \exp\left\{l(\theta^*) - \frac{1}{2}(\theta - \theta^*)^T A(\theta - \theta^*)\right\} p(\theta^*|g) d\theta \\ &= \exp\{l(\theta^*)\} p(\theta^*|g) \\ &\quad \times \int_{n(\theta^*)} \exp\left\{-\frac{1}{2}(\theta - \theta^*)^T A(\theta - \theta^*)\right\} d\theta. \end{align}
  • 其中参数向量θ由d=\prod^n_{i=1}q_i(r_i-1)个独立参数组成。
  • 由于以A为协方差矩阵、以\theta^*为均值的正态分布的密度函数是\frac{1}{\sqrt{(2\pi)^d |A|^{-1}}} \exp \left\{ -\frac{1}{2} (\theta - \theta^*)^T A (\theta - \theta^*) \right\},而且exp\{l(\theta^*)\}=P(D|G,\theta^*),所以P(\theta) = P(\theta | \theta_0) P(\theta_0 | \theta) p(\theta | \theta) \sqrt{(2\pi)^d |A|^{-1}}
  • 于是有$\begin{align}
    \log P(\mathcal{G} | \mathcal{G}) \approx \log P(\mathcal{G} | \mathcal{G}, \theta^*) - \frac{1}{2} \log |A| \
  • \log p(\theta^* | \mathcal{G}) + \frac{d}{2} \log (2\pi).
    \end{align}$。
  • 上面公式成为\log P(D|G)的拉普拉斯近似。
  • 拉普拉斯近似的后两项不依赖于样本量m,一般将其略去。
  • \log |A|可以用d log m 来近似,于是得到:\log P(\mathcal{G} \mid \mathcal{G}) \approx \log P(\mathcal{G} \mid \mathcal{G}, \theta^*) - \frac{d}{2} \log m
  • 这就是模型结构G的BIC评分,记为BIC(G|D)
  • BIC评分的第一项是模型G的优参对数似然度,它度量的是结构G与数据D的拟合程度。
  • 第二项是一个关于模型复杂度的惩罚项(penalty)。
  • 若仅仅依据优蚕丝然度来选择模型,会选到最复杂的完全贝叶斯网络,从而导致过拟合。
  • 由于附加了一个模型复杂度的惩罚项,BIC有效地避免了过度你和。
  • 直观上,基于BIC评分选择模型就是要选择即与数据拟合、又比较简单的模型。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容