文档表示常用模型之Pivoted Length Normalization VSM and BM25

编程环境：

anaconda + Spyder
Win10 + python3.6
完整代码及数据已经更新至GitHub,欢迎fork~GitHub链接

声明：创作不易，未经授权不得复制转载
statement:No reprinting without authorization

内容概述：

任务：

• 实现Pivoted Length Normalization VSM;
• 实现BM25；

注意

• 改进Postings：(docID, Freq)，不仅记录单词所在的文档ID，也记录其在文档中的Frequency；
• 构建inverted index时，记录文档的长度，以及计算average document length (avdl)

一、对推特数据的处理和对postings等一些数据结构的增加与改善

对推特数据文本的处理与实验三相同，只保留用户名、tweet内容以及用来作为文档id的tweetid，修改postings的结构，添加TF的信息，保存每个单词在每条tweet中的词频信息，tf = postings[term][tweeted],打印后如下所示：

image.png

添加其它需要的数据结构来分别记录DF、文档长度（tweet词数）、文档数量和文档平均长度（词数）：

postings = defaultdict(dict)
document_frequency = defaultdict(int)
document_lengths= defaultdict(int)
document_numbers = len(document_lengths)
avdl=0

文档长度（每条tweet词数）的数据结构如下所示：

get_postings_dl()
initialize_document_frequencies()
initialize_avdl()

二、PLN_VSM和BM25的具体实现应用

首先依旧是利用已有数据结构实现查询的功能，对于输入的一串语句，进行相同的token处理，而后为了加快检索速率，避免去遍历所有tweet计算每一个F（q,d）,可以先对于查询检索提取出相关的tweetid,得到relevant_tweetids列表，然后利用PLN和BM25的方法分别计算他们的分数最后降序输出。
核心search方法如下：

def do_search():
    query = token(input("Search query >> "))
    if query == []:
        sys.exit()   
    unique_query = set(query)
    #避免遍历所有的tweet，可先提取出有相关性的tweetid，tweet中包含查询的关键词之一便可认为相关
    relevant_tweetids = Union([set(postings[term].keys()) for term in unique_query])
    #print(relevant_tweetids)
    if not relevant_tweetids:
        print ("No tweets matched any query terms.")
    else:
        scores1 = sorted([(id,similarity_PLN(query,id))
                         for id in relevant_tweetids],
                        key=lambda x: x[1],
                        reverse=True)
        scores2 = sorted([(id,similarity_BM25(query,id))
                         for id in relevant_tweetids],
                        key=lambda x: x[1],
                        reverse=True)
    print ("<<<<<Score(PLN)--Tweeetid>>>>>")
    print("PLN一共有"+str(len(scores1))+"条相关tweet！")
    for (id,score) in scores1:
        print (str(score)+": "+id)
    print ("<<<<<Score(BM25)--Tweeetid>>>>>")
    print("BM25一共有"+str(len(scores2))+"条相关tweet！")
    for (id,score) in scores2:
        print (str(score)+": "+id)

其中similarity_PLN(query,id)和similarity_BM25(query,id)分别使用PLN和BM25的公式来计算，具体如下：

image.png

对于PLN中的参数b,由于每条tweet的次数有限，平均每条18个词左右（加上用户名），因此不同文档的长度不会相差太多，对于文档长度低于（或高于）平均长度的奖励（或惩罚）比重不宜太大，经过实验发现设为0.1便可满足需求。

image.png

对于BM25模型，基于同样原理，其比重不应太大，于是将k设为1，b同样设为0.1.

def similarity_PLN(query,id):
    global postings,avdl
    fenmu =1 - 0.1 + 0.1*(document_lengths[id]/avdl)
    similarity = 0.0
    unique_query = set(query)
    for term in unique_query:
        if (term in postings) and (id in postings[term].keys()):
            #使用ln(1+ln(C(w,d)+1))后发现相关性的分数都为负数很小
            similarity += (query.count(term)*(math.log(math.log(postings[term][id] + 1) + 1))            *math.log((document_numbers+1)/document_frequency[term]))/fenmu            
        
    return similarity

def similarity_BM25(query,id):
    global postings,avdl
    fenmu =1 - 0.1 + 0.1*(document_lengths[id]/avdl)
    k = 1
    similarity = 0.0    
    unique_query = set(query)
    for term in unique_query:
        if (term in postings) and (id in postings[term].keys()):
            C_wd = postings[term][id]
            #使用ln(1+ln(C(w,d)+1))后发现相关性的分数都为负数很小
            similarity += (query.count(term)*(k+1)*C_wd*math.log          ((document_numbers+1)/document_frequency[term]))/(k*fenmu+C_wd)            
        
    return similarity

三、进行查询测评比较

选取三条查询输入，观察两种方法各自返回的tweetid列表：

（1）

image.png

image.png

两者前十个中有9个相同，顺序略有不同！

（2）

image.png

image.png

两者前10个结果完全一样，并且顺序一致！

（3）

image.png

image.png

前10个结果完全一样，并且顺序一致！
综上比较可以发现，两种方法的效果十分接近，但具体哪一种的效率或准确率更好，还有待进一步的测评。

四、更新用qrels.txt和eval_hw4.py对检索模型的结果进行评测：

1、利用提供的result.txt进行演示（baseline？）

image.png

刚开始由于弄混了升序和降序（sorted函数中的reverse参数），导致结果很低，调整后结果如下：

1、使用PLN结构的结果如下：

(1) PLN result 01（b = 0.1）：

image.png

image.png

(2) PLN result 01（b = 0.2）：

image.png

image.png

B = 0.1时有更好表现

2、使用BM25结构的结果如下：

(1) BM25 result 01（k = 1,b = 0.1）:

image.png

image.png

(2) BM25 result 02（k = 2,b = 0.1）:

image.png

image.png

(3) BM25 result 03（k = 1,b = 0.2）:

image.png

image.png

(4) BM25 result 04（k = 1,b = 0.3）:

image.png

image.png

综上可以发现k=1,b=0.2时有最好表现，MAP = 0.491,NDCG = 0.684

3、综合PLN和BM25:

image.png

image.png

发现并没有好多少与单独使用单一结构相近

声明：创作不易，未经授权不得复制转载
statement:No reprinting without authorization

最后编辑于：2019.05.17 20:40:53

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 221,273评论 6赞 515
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 94,349评论 3赞 398
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 167,709评论 0赞 360
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 59,520评论 1赞 296
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 68,515评论 6赞 397
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 52,158评论 1赞 308
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 40,755评论 3赞 421
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 39,660评论 0赞 276
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 46,203评论 1赞 319
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 38,287评论 3赞 340
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 40,427评论 1赞 352
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 36,122评论 5赞 349
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 41,801评论 3赞 333
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 32,272评论 0赞 23
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 33,393评论 1赞 272
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 48,808评论 3赞 376
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 45,440评论 2赞 359

文档表示常用模型之Pivoted Length Normalization VSM and BM25

编程环境：

内容概述：

任务：

注意

一、对推特数据的处理和对postings等一些数据结构的增加与改善

二、PLN_VSM和BM25的具体实现应用

三、进行查询测评比较

（1） image.png

（2） image.png

（3） image.png

四、更新用qrels.txt和eval_hw4.py对检索模型的结果进行评测：

1、利用提供的result.txt进行演示（baseline？）

1、使用PLN结构的结果如下：

2、使用BM25结构的结果如下：

3、综合PLN和BM25:

推荐阅读更多精彩内容

（1）

image.png

（2）

image.png

（3）

image.png