大师兄的贝叶斯网络学习笔记(五十四):贝叶斯网络(二十八)

大师兄的贝叶斯网络学习笔记(五十三):贝叶斯网络(二十七)
大师兄的贝叶斯网络学习笔记(五十五):贝叶斯网络(二十九)

九、隐结构模型学习

3. 隐变量模型选择
  • 最大似然估计的唯一性是推导边缘似然度的拉普拉斯近似时用到的重要条件。
  • 然后在后面会看到,这一条件在有隐变量的时候不会成立。
  • 于是,BIC评分不一定适用于隐变量模型选择。
  • 有鉴于此,Geigeret al.(1966)在隐变量模型的显像流行上对边缘似然度的大样本近似重新进行了推导,得到了一个新的评分准则,称为BICe评分:BICe(G|D) = \log P(D|G,\theta^*)-\frac{d_e(G)}{2}\log m
  • 其中D是一组数据,
  • m是D中的样本个数,
  • G是一个隐变量模型,
  • \theta^*是G的参数的一个最大似然估计
  • 另一个评分准则是由Cheeseman and Stutz(1995)给出的,因此称为CS评分。
  • 设D'是基于(G,θ*)将D进行修补而得到的完整数据。
  • 推导CS评分的出发点为\log P(\mathcal{I} \mid \mathcal{G}) = \log \left[ \frac{P(\mathcal{I}' \mid \mathcal{G})}{P(\mathcal{I}, \theta \mid \mathcal{G}) d\theta} \right]
  • 由于D‘是完整数据,上式右端的第一项log P'(D'|G)是基于D‘的CH评分。
  • 至于分数部分,对分子分母的对数同时在θ'附近进行大样本近似,得CS(\mathcal{G} \mid \mathcal{G}) = \log P(\mathcal{G}' \mid \mathcal{G}) + \log P(\mathcal{G} \mid \mathcal{G}, \theta^*) - \frac{d_c(\mathcal{G})}{2} \log m - \log P(\mathcal{G}' \mid \mathcal{G}, \theta^*) + \frac{d(\mathcal{G})}{2} \log m
  • 由于近似是对分子和分母同时进行的,因此近似差会部分地相互抵消。
  • 上式中既有模型G的有效维数d_e(G),又有其标准维数d(G)
  • 这是因为相对于D,G有隐变量;但是相对于D',G却没有隐变量。
  • Cheeseman和Stutz并没有考虑到这一点,他们给出的评分其实为CS(\mathcal{G} \mid \mathcal{D}) = \log P(\mathcal{D}' \mid \mathcal{G}) + \log P(\mathcal{D} \mid \mathcal{G}, \theta^*) - \log P(\mathcal{D}' \mid \mathcal{G}, \theta^*)
  • 通常称前式为修正CS评分,而后式为原始CS评分
  • 尽管BICe评分和CS评分在理论上优于BIC评分,但是迄今为止还没有系统的实验数据来验证这一点。
  • 我们在对多层因变量模型的研究中得到的经验表明,BIC评分和原始CS评分的表现基本一致,他们都优于AIC评分和HVI评分。
  • 使用BICe评分和修正CS评分有一个困难,即对模型有效维数的计算。
  • 对于某些情况,有一些分解和近似方法。
  • 但在一般情况下,需要计算高维矩阵的秩,计算复杂度很高。
  • 所以,虽然Chickering和Heckerman提出了修正CS评分,但在实验室中还是假设d_e(G)=d(G)以简化计算。
  • 总而言之,隐变量模型选择有许多问题尚未解决,需要进一步系统地研究,在找到更好的评分函数之前,一般先暂时使用BIC评分。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容