Doc2vec预测IMDB评论情感

本文内容源自于国外2015年的一篇博客，中文翻译可以在伯乐在线看到。可以整体了解一些word2vec和doc2vec的使用方法，但是由于时间过去很久了，gensim的api也发生了变化，因此特意重新在源代码基础上做了修改，也回顾一下word2vec和doc2vec的使用

环境要求

python2.7或python3+
gensim
numpy
matplotlib

情感分析基本原理

情感分析（Sentiment analysis）是自然语言处理（NLP）方法中常见的应用，尤其是以提炼文本情绪内容为目的的分类。利用情感分析这样的方法，可以通过情感评分对定性数据进行定量分析。虽然情感充满了主观性，但情感定量分析已经有许多实用功能，例如企业藉此了解用户对产品的反映，或者判别在线评论中的仇恨言论。

情感分析最简单的形式就是借助包含积极和消极词的字典。每个词在情感上都有分值，通常 +1 代表积极情绪，-1 代表消极。接着，我们简单累加句子中所有词的情感分值来计算最终的总分。显而易见，这样的做法存在许多缺陷，最重要的就是忽略了语境（context）和邻近的词。例如一个简单的短语“not good”最终的情感得分是 0，因为“not”是 -1，“good”是 +1。正常人会将这个短语归类为消极情绪，尽管有“good”的出现。

另一个常见的做法是以文本进行“词袋（bag of words）”建模。我们把每个文本视为 1 到 N 的向量，N 是所有词汇（vocabulary）的大小。每一列是一个词，对应的值是这个词出现的次数。比如说短语“bag of bag of words”可以编码为 [2, 2, 1]。这个值可以作为诸如逻辑回归（logistic regression）、支持向量机（SVM）的机器学习算法的输入，以此来进行分类。这样可以对未知的（unseen）数据进行情感预测。注意这需要已知情感的数据通过监督式学习的方式（supervised fashion）来训练。虽然和前一个方法相比有了明显的进步，但依然忽略了语境，而且数据的大小会随着词汇的大小增加。

Word2Vec 和 Doc2Vec

近几年，Google 开发了名为 Word2Vec 新方法，既能获取词的语境，同时又减少了数据大小。Word2Vec 实际上有两种不一样的方法：CBOW（Continuous Bag of Words，连续词袋）和 Skip-gram。对于 CBOW，目标是在给定邻近词的情况下预测单独的单词。Skip-gram 则相反：我们希望给定一个单独的词（见图 1）来预测某个范围的词。两个方法都使用人工神经网络（Artificial Neural Networks）来作为它们的分类算法。首先，词汇表中的每个单词都是随机的 N 维向量。在训练过程中，算法会利用 CBOW 或者 Skip-gram 来学习每个词的最优向量。

W(t) 代表当前的单词，而w(t-2)， w(t-1) 等则是邻近的单词

这些词向量现在可以考虑到上下文的语境了。这可以看作是利用基本的代数式来挖掘词的关系（例如：“king” – “man” + “woman” = “queen”）。这些词向量可以作为分类算法的输入来预测情感，有别于词袋模型的方法。这样的优势在于我们可以联系词的语境，并且我们的特征空间（feature space）的维度非常低（通常约为 300，相对于约为 100000 的词汇）。在神经网络提取出这些特征之后，我们还必须手动创建一小部分特征。由于文本长度不一，将以全体词向量的均值作为分类算法的输入来归类整个文档。

然而，即使使用了上述对词向量取均值的方法，我们仍然忽略了词序。Quoc Le 和 Tomas Mikolov 提出了 Doc2Vec 的方法对长度不一的文本进行描述。这个方法除了在原有基础上添加 paragraph / document 向量以外，基本和 Word2Vec 一致，也存在两种方法：DM（Distributed Memory，分布式内存）和分布式词袋（DBOW）。DM 试图在给定前面部分的词和 paragraph 向量来预测后面单独的单词。即使文本中的语境在变化，但 paragraph 向量不会变化，并且能保存词序信息。DBOW 则利用paragraph 来预测段落中一组随机的词（见图 2）。

选自《Distributed Representations of Sentences and Documents》

一旦经过训练，paragraph 向量就可以作为情感分类器的输入而不需要所有单词。这是目前对 IMDB 电影评论数据集进行情感分类最先进的方法，错误率只有 7.42%。当然，如果这个方法不实用，说这些都没有意义。幸运的是，一个 Python 第三方库 gensim 提供了 Word2Vec 和 Doc2Vec 的优化版本。