大师兄的贝叶斯网络学习笔记(四十五):贝叶斯网络(十九)

大师兄的贝叶斯网络学习笔记(四十四):贝叶斯网络(十八)
大师兄的贝叶斯网络学习笔记(四十六):贝叶斯网络(二十)

八、结构学习

4. 其它模型选择标准
  • 除了前面讨论的三个评分函数以外,还有另外几个模型选择准则也被用于贝叶斯网络的结构学习,包括MDL评分、AIC评分、验证数据似然度以及交叉验证
4.1 MDL评分
  • MDL评分是最短描述长度(minimum description length)的简称。
  • 准则的基本思想是:数据分析的目的是要找出蕴含在数据中的规律,然后可以利用它们对数据进行压缩,从而降低数据的编码(描述)长度。所以,用贝叶斯分析数据是否成功可以用数据和模型的编码总长度来度量。
  • MDL评分是这个思想的具体化,在具体化的过程中,需要做一些假设和近似。
  • 不同的假设和近似导致不同的MDL评分函数。
  • 在大样本的情况下,用这些MDL评分函数进行模型选择的结果基本上相互等价,而且它们也与BIC评分等价。
4.2 AIC评分
  • AIC评分是Akaike信息准则(Akaike information criterion)。
  • 它假设数据D是从一个概率分布P(X)中进行i.i.d抽样而得到的。
  • AIC评分的出发点是要找一个贝叶斯网络N^*,使得P_{N^*}与P(X)之间的KL距离最短,即KL(P,P_{N^*})\leq KL(P,P_N),\forall N
  • 在一定光滑条件下做大样本近似,可得如下结论,即N^*的结构G^*应该满足AIC(G^*|D)\meq AIC(G|D),\forall G,
  • 其中AIC(G|D)=\log P(D|G,\theta^*)-d,这就是AIC评分。
  • AIC评分与BIC评分都是优参对数似然度加一个罚项,因此都称为罚项似然度(penalized likelihood),另外MDL也是罚项似然度。
  • 罚项的作用的防止过拟合。
4.3 验证数据似然度
  • 验证数据似然度(holdout validation likelihood),简称HVL评分。
  • 是一种防止过度拟合的方法,它的基本思想是吧数据D随机地分为训练数据D_l和验证数据D_v
  • 对于一个模型结构G,首先基于训练数据对其参数进行评估,得到一个贝叶斯网(G,\theta^t),然后计算验证数据D_v对数似然度:HVL(G|D_v,D_t)=\log P(D_v|G,\theta^t)
  • 在大样本的情况下,HVL准则与AIC准则等价。
4.4 交叉验证
  • 交叉验证(cross validation)是验证数据似然度的进一步发展,它的基本思想是多次计算模型的HVL评分,而每次都按不同方式将D划分为D^t和D_v,然后计算歌词所得评分的平均值,并将其作为模型的最后评分。
  • 这个评分称为CVL评分,它比HVL更具鲁棒性,但其计算复杂度也高出HVL评分数倍。
  • 在大样本情况下,CVL准则与AIC准则等价。
4.5 模型选择的一致性
  • 设G是一个贝叶斯网络机构,P是一个联合概率分布。
  • 如果存在一个参数值\theta,使得贝叶斯网络(G,θ)的联合分布正好是P,那么说G包含(contains)P.
  • 如果其它任何一个包含P的模型的自由参数个数都不少于G得自由参数个数,那么称G为包含P的最简模型(Parsimoinous model)。
  • 一个模型结构G包含另一个模型结构G',如果G包含任何一个以G'为结构的贝叶斯网的联合分布,若G'包含G且G包含G‘,则称G与G'分布等价(distributionally equvalent)。
  • 若G与G‘分布等价,且具有相同数量的自由参数,则称G与G'等价(equivalent)。
  • 设D是从联合分布P中抽样而得到的一组数据,一个模型评分函数f称为是一致的,如果对任何P,当样本量趋于无穷时,下列两个条件得到满足:
  • 如果G包含P,而G'不包含P,则f(G|D)>F(G'|D)
  • 如果G和G‘都包含P,且G的自由参数少于G'的自由参数,则F(G|D)>f(G'|D)
  • 为了体会一致性的重要性,考虑一个贝叶斯网络N=(G,θ)及其联合分布P(X|G,θ).
  • 假设G是包含P(X|G,θ)的最简单模型,如果评分函数f是一致的,那么在样本量趋于无穷时,G的评分大于其它任何一个不与G等价的模型G',即f(G|D)>f(G'|D).
  • 所以,原则上可以利用f得到G或者与G等价的一个模型结构G',原则上还可以得到G的参数θ,使得当前样本量趋于无穷时,P(X|G)几乎必然收敛到P(X|G,θ)。
  • 这就是说,原则上可以获得数据D的原生模型或与其等价的一个模型。
  • 在前面讨论的模型评分函数中,贝叶斯评分、边缘似然度、BIC评分和MDL评分是一致的;
  • 当样本量趋于无穷时,AIC准则退化为最大优参似然准则,他们都会选择完全贝叶斯模型,所以AIC评分不是一致的。
  • 又由于大样本情况下HVL和CVL准则与AIC准则等价,从而它们也是不一致的。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容