2022-01-03 第二章7 自然语言处理常见的三大任务之语言模型:语言模型性能评价

内容来自哈工大车万翔老师团队的作品《自然语言处理:基于预训练模型的方法》。

3. 语言模型性能评价

如何评价一个语言模型的好坏呢?

  • 外部任务评价:将模型应用于具体的外部任务(如机器翻译),并根据该任务上指标的高低对语言模型进行评价。但是此方法计算代价较高,实现难度也大。
  • 基于困惑度(Perplexity, PPL)的内部评价方式:详述如下
  1. 讲述数据划分为不相交的集合:训练集D^{train}和测试集D^{test}D^{train}用于估计语言模型的参数。得到的模型计算测试集D^{test}的概率P(D^{trest})则反映了模型在测试集上的泛化能力。
  2. 假设测试集D^{test}=w_1w_2···w_N(每个句子开始和结束分别增加<BOS><EOS>标记),则测试集的概率为:
    image.png
  3. 困惑度则为模型分配给测试集中每一个词的概率的几何平均值的倒数:
    困惑度

    几何平均数_百度百科 (baidu.com)
    每日丁点 | 几何平均数是啥 - 知乎 (zhihu.com)
    例,对于bigram模型而言:
    bigram的困惑度
  4. 实际使用中,考虑多个概率相乘可能带来浮点数下溢的问题,通常将式(2-18)转化为对数和形式:


    image.png
  5. 困惑度的意义:
    困惑度越小,意味着单词序列的概率越大,也意味着模型能够更好解释测试集中的数据。
    困惑度越低的语言模型并不总是能在外部任务上取得更好的性能指标,但是二者之间通常呈现一定的正相关性。
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。
禁止转载,如需转载请通过简信或评论联系作者。

友情链接更多精彩内容