年末『天翼杯』比赛笔记

插播一则非天池平台的数据比赛『天翼杯』的笔记……虽然这次没能进前 35 ,不过从中还是学到一些知识。

题目说明

给定 7 周用户视频网站访问记录,记录包括用户标识、访问时间、网站、访问次数。预测第8 周用户对各视频网站的浏览量。

测评准则为 F1 分数,其中准确率为余弦值在预测集上的均值,召回率为预测集用户数和实际测试集用户数的交集与实际测试集用户数之比。

数据分布

记录数:525,488,独立用户数:29,932,用户的记录数分布如下:(横坐标是记录数,纵坐标是该记录数下的人数)

用户的记录数分布

用户浏览量总趋势:(横坐标是日期,纵坐标是浏览量)

用户浏览量总趋势

各个视频站点的用户规模:

用户规模

上一周有大约 50% 的用户会在下一周访问其中一个视频网站。这些用户中大部分是连续追剧者(连续几周都看)。

基准测试

余弦相似度是计算余弦夹角,而由于原点的万向向量表示,因此,一个基准估计不是全 0 而是全 1 。要测试选择的用户良好与否,应该以填充 0 表示基准预测。

经验规则

按照余弦相似度作为测试准则的公式表示,可以看出,并不需要我们拟合出绝对数值(分母部分实际上除了向量的大小,也就是说去掉了规模化)。因此,我们要预测的是用户在第8周浏览站点的趋势,而不是绝对数值。为此,我们可以把预测问题看做一个概率分布问题。

如果我们知道这个用户一定会去某一个站点,那么我们可以把这个用户的概率置为相同,也就是基准测试中填充1 的来历。

根据日常规律,对用户看视频的经验总结:

  1. 历史总是会重复的;
    历史的重复特性是从过去预测未来的基础之一,所谓合久必分分久必合,但历史重现的周期有长有短。历史的相似度是短期预测有效性的关键因素。

  2. 人是容易遗忘的;
    行为的时间距离越近,用户越容易记住该视频站点。但是用户记住该视频站点有两种可能:喜欢和厌恶。因此,最近行为的变化量是衡量的一个因素。另一个因素是,对于求和而言,历史行为量应该设定一个衰减函数。

  3. 人的遗忘和事物的多样性相关;
    用户看的视频站点种类少,而用户本身看视频量多,那么,用户继续看这个站点的概率大。

  4. 人的记性和事物的重要性相关;
    人的精力是有限的,因此总行为量是可以比较的,行为量相对于一般人对同一件事的行为量高则对此事比较关注。

对本问题的一般规则策略

  1. 选择最近一周与前几周分别的交集(目前选择是前三周),选择连续观看的用户;

  2. 按照同等无知原理,为选择出来的用户每天每个站点都填充 1,表示用户对站点喜好的均匀分布;

  3. 根据用户对站点的偏好,为经常访问的站点赋予更高的权值;

建模和特征工程

在测评指标中,我们可以了解到涉及到的三个量:用户、用户浏览轨迹、预测规模。其中,用户量是最容易控制的。浏览轨迹的控制上,我们把这个问题控制为拟合浏览概率分布的问题。

因此,目前主要从以下三个方面对问题建模:

  1. 用户选择:选择用户是最终提交数据的规模大小的基础,可以限定召回率和用户数量的准确率;

  2. 站点选择:减小预测范围,是用户的习惯分布更统一;

  3. 浏览模式预测:拟合用户的习惯分布。

这3个主题的概率实际上是对问题从粗粒度到细粒度的划分。从粗粒度来看,用户选择是首要的,它决定了整体的召回率和基础准确率,也就是营销的成本。而站点的选择、进而到浏览模式则是对预测结果的进一步细化。

模型融合

模型来源:使用用户特征筛选得到的用户排名、使用『用户、站点』两个特征筛选得到的用户排名。排名的方式是把两者加起来,然后进行整体排名,因为两个数据集中可能有不稳定的分布。

浏览模式预测

如果浏览模式预测是一个概率分布的预测问题,那么概率分布一般可以通过历史行为数量来估计。但这里有一个要点需要注意的是,对行为量的时间衰减的评估。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 204,684评论 6 478
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 87,143评论 2 381
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 151,214评论 0 337
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 54,788评论 1 277
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 63,796评论 5 368
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 48,665评论 1 281
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 38,027评论 3 399
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,679评论 0 258
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 41,346评论 1 299
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,664评论 2 321
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 37,766评论 1 331
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,412评论 4 321
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 39,015评论 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 29,974评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 31,203评论 1 260
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 45,073评论 2 350
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 42,501评论 2 343

推荐阅读更多精彩内容