大师兄的贝叶斯网络学习笔记(五十三):贝叶斯网络(二十七)

大师兄的贝叶斯网络学习笔记(五十二):贝叶斯网络(二十六)
大师兄的贝叶斯网络学习笔记(五十四):贝叶斯网络(二十八)

九、隐结构模型学习

2. 可分变性及几个相关概念
  • Y_1,Y_2,...,Y_n是一个隐变量模型G中的显变量。
  • 如果有两个不同的参数值\theta_1\theta_2,使得P(Y_1,Y_2,...,Y_n|G,\theta_1) = P(Y_1,Y_2,...,Y_n|G,\theta_2),则称模型G是不可分辨的(unidentifiable)
  • 如果没有满足上式的不同的参数\theta_1和\theta_2,则称模型G是可分辨的(indentifiable)
  • 设D是一组关于Y_1,Y_2,...,Y_n的i.i.d数据,如果上式成立,则有P(D|G,\theta_1) = P(D|G,\theta_2)
  • 这意味着基于数据D不可能分辨\theta_1和\theta_2
  • 与可分变性密切相关的是有效维数的概念。
  • 用k记|Y_1|\times |Y_2|\times ... \times |Y_n|
  • 给定模型G的一个参数值θ,联合分布P(Y_1,Y_2,...,Y_n|G,\theta)R^{k-1}空间中的一个点。
  • 让θ变动,所有这样的点形成一个流行(manifold)
  • 这个流行称为模型G的显像流行(manifest image)
  • 它的维数称为模型G的有效维数(effective dimension),记为d_e(G)
  • 另一方面,G的独立参数的个数称为G的标准维数,记为d(G)。
  • 如果G的标准维数大于其有效维数,则它是不可分辨的,标准维数与有效维数之差就是模型中不可分辨参数的个数。
  • 一个模型不可分辨往往是因为它包含一些冗余部分。
  • 这些冗余部分使得模型变得不必要地复杂。
  • 此时应该将其简化,尽量去掉其冗余部分,得到最简模型。
  • 下面在隐变量模型的框架下把这个思想形式化:
  • 设G和G'是两个具有相同显变量Y=Y_1,Y_2,...,Y_n的隐变量模型。
  • 我们称G显像包含(manifestatively contains)G',如果对G'的任一参数值θ',G有参数值θ
  • 使得P(Y_1,Y_2,...,Y_n|G,\theta) = P(Y_1,Y_2,...,Y_n|G',\theta')
  • 换句话说,G显像包含G'且仅当G能够表示任何一个G'能够表示的关于Y的分布。
  • 如果G和G'互相显像包含对方,则称G与G'现象分布等价(manifestatively equivalent in distribution)
  • 显像分布等价的模型具有相同的有效维数。
  • 如果它们有相同的标准维数,则称它们显像等价(marginally equivalent)
  • 如果部分在与G显像分布等价且标准维数又比G低的模型,那么称模型G是最简的(parsimonious)
  • 最简模型的概念不具有可操作性,一个模型是否最简,往往难以判断。
  • 后面将引入一个具有可操作性的概念来对它进行近似,即正则行(regularity)的概念。
  • 最后需要注意的是,最简模型也可能是不可分辨的。
  • 换句话说,有些不可分变性是无法去掉的。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容