R开发:协调过滤推荐

set.seed ( 1234 )

#加载数据包

library ( "recommenderlab" )

#构造数据运用recommenderlab包实现协同过滤推荐,其数据类型采用S4类构造,需通过as()函数转为raringMatrix类型。

val1<- matrix ( sample ( c ( as.numeric ( 0 : 5 ) ,NA ) ,50 ,replace = TRUE ,prob = c ( rep ( .4 / 6 , 6 ) , .6 ) ) ,ncol = 10 , dimnames = list ( user = paste ( "u" ,1 : 5 ,sep = '' ) ,item = paste ( "i" ,1 : 10 ,sep = '' ) ) )

val2 <- as ( val1, "realRatingMatrix" ) 

数据转换

val3<- normalize ( val2 )

#二元分类转换,normalize()函数进行标准化处理,标准化的目的是为了去除用户评分的偏差

val4 <- binarize ( val3 , minRating = 4 )

val5 <- as ( val4 , "matrix" )


数据可视化

接下来,我们采用MovieLense数据集,

data ( MovieLense )

key1 <- sample ( MovieLense , 943 , replace = F )

image ( MovieLense )


hist ( getRatings ( normalize ( MovieLense ) ) , breaks = 100 )


hist ( rowCounts ( key1 ) , breaks = 50 )


建立模型

对于realRatingMatrix有六种方法:IBCF(基于物品的推荐)、UBCF(基于用户的推荐)、PCA(主成分分析)、RANDOM(随机推荐)、SVD(矩阵因子化)、POPULAR(基于流行度的推荐)

建立协同过滤推荐算法模型,主要运用recommender(data=ratingMatrix,method,parameter=NULL)函数,getModel()可查看模型参数

key1_recom <- Recommender (key1 , method = "IBCF" )

key1_popul <- Recommender ( key1, method = "POPULAR" )

#查看模型方法

names ( getModel ( key1_recom ) )


模型预测

TOP-N预测

对模型预测可运用predict()函数,在此分别以TOP-N预测及评分预测为例,预测第940-943位观影者的评分情况。n表示最终为TOP-N的列表推荐,参数type = "ratings"表示运用评分预测观影者对电影评分,模型结果均需转为list或矩阵表示

pred <- predict ( key1_popul ,key1 [ 940 : 943,] , n = 5 )

as ( pred , "list" )


#top-N为有序列表,抽取最优推荐子集

pred3 <- bestN ( pred , n = 3 )

as ( pred3 , "list" )


#评分预测

rate <- predict ( key1_popul , key1 [ 940 : 943 ] , type = "ratings" )

as ( rate , "matrix" ) [ , 1 : 5 ]


预测模型评价

评分预测模型评价

eva <- evaluationScheme (key1 [ 1 : 800 ] , method = "split" , train = 0.9,given = 15)

method="split"&train=0.9为按90%划分训练测试集合,given为评价的类目数

r_eva1<- Recommender ( getData ( eva , "train" ) , "UBCF" )

p_eva1<- predict ( r_eva1 , getData ( eva, "known" ) , type = "ratings" )

r_eva2 <- Recommender ( getData ( eva, "train" ) , "IBCF" )

p_eva2 <- predict ( r_eva2 , getData ( eva, "known" ) , type = "ratings" )

c_eva1 <- calcPredictionAccuracy ( p_eva1 , getData ( eva , "unknown" ) )

c_eva2 <- calcPredictionAccuracy ( p_eva2 , getData ( eva , "unknown" ) )

error <- rbind ( c_eva1 , c_eva2 ) 

rownames ( error ) <- c ( "UBCF" , "IBCF" )

计算预测模型的准确度

TOP-N预测模型评价

通过4-fold交叉验证方法分割数据集,运用evaluate()进行TOP-N预测模型评价,评价结果可通过ROC曲线及准确率-召回率曲线展示:

#4-fold交叉验证

tops <- evaluationScheme ( key1 [ 1 : 800 ] , method = "cross" , k = 4 , given = 3 ,goodRating = 5 )


results <- evaluate ( tops , method = "POPULAR" , type = "topNList" ,n = c ( 1 , 3 , 5 , 10 ) )

#获得混淆矩阵

getConfusionMatrix ( results ) [ [ 1 ] ]


avg ( results )

推荐算法的比较

除了对预测模型进行评价,还可以对不同推荐算法进行比较。可首先构建一个推荐算法列表,通过ROC曲线、、准确率-召回率曲线或RMSE直方图进行比较

TOP-N算法比较

set.seed ( 2016 )

scheme <- evaluationScheme ( key1 , method = "split" , train = 0.9 , k = 1 , given = 10 , goodRating = 5 )

#构建不同算法模型

results <- evaluate ( scheme ,test_data ,n = c ( 1 ,3 ,5 ,10 ,15 ,20 ) )

#模型比较#ROC曲线

plot ( results , annotate = c ( 1 , 3 ) , legend = "bottomright" )

#准确率-召回率曲线

plot ( results , "prec/rec" , annotate = c ( 2 , 3 , 4 ) , legend = "topleft" )

预测评分算法比较

results2 <- evaluate ( scheme , algorithms , type = "ratings" )

plot ( results2 , ylim = c ( 0 , 20 ) )

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 214,588评论 6 496
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,456评论 3 389
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 160,146评论 0 350
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,387评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,481评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,510评论 1 293
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,522评论 3 414
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,296评论 0 270
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,745评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,039评论 2 330
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,202评论 1 343
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,901评论 5 338
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,538评论 3 322
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,165评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,415评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,081评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,085评论 2 352

推荐阅读更多精彩内容

  • 我是日记星球128号星宝宝徐惠娟,正在参加日记星球第五期21天蜕变之旅。 一个人做一件事情容易,坚持做一件事情就很...
    徐惠娟阅读 199评论 4 2
  • 我写东西写不下去的时候,会下楼去工操走一走。 工操可以肆无忌惮吹到东湖的风,又与车水马龙有了一篱之隔。但迷人的远不...
    病鹤斋阅读 306评论 0 3
  • 日落后的天 每一天都不一样 但都好看,都漂亮 连冰冰冷冷的亭台楼阁 也像在画中一样 那淡淡的月亮 也想是借了一点霞...
    罗不息阅读 219评论 0 2