推荐系统简介

1.1 推荐系统简介

学习目标

  • 了解推荐系统概念以及产生背景
  • 记忆推荐系统工作原理以及作用
  • 了解推荐系统与web项目区别

1 推荐系统概念以及产生背景

推荐系统经过多年的发展,已经成为了互联网产品的标配,也是AI成功落地的分支之一,在电商,咨询,音乐,短视频等应用中,推荐系统都是核心组件之一。

  • 什么是推荐系统
    没有明确需求的用户访问我们的服务,且物品信息量过载时,推荐系统经过一定规则对物品信息进行排序,并将排序在前的物品优先向用户展示。
  • 信息过载&用户需求不明确
    推荐系统的发展:分类目录>搜索引擎>推荐系统
  • 推荐系统VS搜索引擎


2 推荐系统工作原理以及应用

  • 推荐系统工作原理
    • 社会化推荐 向朋友咨询、社会化推荐、让好友给自己推荐物品
    • 基于内容的推荐 打开搜索引擎进行搜索
    • 基于流行度的推荐 查看排行榜
    • 基于协同过滤的推荐 找到和自己历史兴趣相似的用户
  • 推荐系统的作用
    • 高效连接用户和物品
    • 提高用户停留时间和用户活跃度
    • 有效的帮助产品实现其商业价值
  • 推荐系统应用场景
    购物推荐 音乐推荐 文章推荐

3 推荐系统和Web项目的区别

  • 通过信息过滤实现目标提升 VS 稳定的信息流通系统
    • web项目:处理复杂的业物逻辑,处理高并发,为用户提供一个稳定的信息流通服务
    • 推荐系统:追求指标增长,留存率/阅读时间/GMV(电商网站成交额)/视频网站。从公司角度出发考虑问题
  • 不确定性VS确定性
    -web项目:对结果有确定预期
    -推荐系统:结果是概率问题

1.2 推荐系统设计

学习目标

  • 了解推荐系统要素
  • 记忆推荐系统架构

1 推荐系统要素

  • UI和UE(前端界面)
  • 数据(Lambda架构)
  • 业务知识
  • 算法

推荐系统架构

  • 推荐系统整体架构


    推荐系统架构.PNG

    描述: Lambda架构从用户行为中采集数据,对数据进行处理,通过推荐算法计算出推荐结果,并将推荐结果通过包装推送给用户,用户对推荐做出反馈,Lambda架构再次采集用户的反馈行为数据。

  • 大数据Lambda架构

    • Lambda架构是一个实时大数据处理框架。
    • Lambda架构将离线计算和实时计算整合,设计出一个能满足实时大数据关键特性的架构,数据关键特性包括有:高容错,低延时,可扩展等。
    • Lambda的分层架构
      1. 批处理层
        • 数据不可变,可进行任何计算,可水平扩展
        • 高延迟 几分钟-几小时(计算量和数据量不同)
        • 日志收集Flume
        • 分布式存储:Hadoop
        • 分布式计算:Hadoop,Spark
        • 视图存储书库 nosql mysql redis/memcache
      2. 实时处理层
        • 流式处理,持续计算
        • 存储和分析某个窗口期内的数据(一段时间按的热销排行,实时热搜)
        • 实时数据收集
        • 实时数据分析
      3. 服务层
        • 支持随机读
        • 需要在非常短时间内返回结果
        • 读取批处理层和实时处理层并对其归并


          Lambda架构图.PNG
  • 推荐算法架构

    • 召回阶段(海选)
      • 召回决定了最终推荐结果的天花板
      • 常用算法
      • 协同过滤
      • 基于内容
    • 排序阶段(精选)
      - 召回界定了最终推荐结果的天花板,排序不断将逼近这个极限,决定最终的推荐效果。
      • CTR预估(点击率预估 使用逻辑回归LR算法)估计用户是否会点击某个商品 需要用户的点击数据
      • 策略调整

1.3 推荐算法

学习目标

  • 了解推荐系统模型构建流程
  • 理解协同过滤原理
  • 记忆相似度计算方法
  • 应用杰卡德相似度实现简单协同过滤推荐案例

1 推荐模型构建流程

Data(数据)>Features(特征)>ML Algorithm(选择算法训练模型)>Prediction Output(预测输出)

  • 数据清洗/数据处理
    • 数据来源
      • 显性数据 (打分,评论/评价)
      • 隐性数据(历史订单,加购物车,页面浏览,点击,搜索记录)
    • 数据量/数据 能否满足需求
  • 特征工程
    • 从数据中筛选特征
    • 用数据表示特征
    • 选择合适的算法
    • 产生推荐结果

最经典的推荐算法: 协同过滤(Collaborative Filtering)

算法思想:物以类聚,人以群分
基本的协同过滤推荐算法基于以下假设:

  • 基于用户的协同过滤推荐
  • 基于物品的协同过滤推荐

3 计算相似度(Similarity Calculation)

  • 相似度计算方法
    • 欧氏距离
    • 余弦相似度
  • 皮尔逊相关系数Pearson
  • 杰卡德相似度Jaccard(适用于布尔向量)
  • 如何选择余弦相似度
    • 余弦相似度/皮尔逊相关系数 适合于用户评分数据(有真实数据值)
    • 杰卡德相似度适用于隐式反馈数据(是/无,是/否,即0/1)
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 216,544评论 6 501
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 92,430评论 3 392
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 162,764评论 0 353
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 58,193评论 1 292
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 67,216评论 6 388
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,182评论 1 299
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,063评论 3 418
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,917评论 0 274
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,329评论 1 310
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,543评论 2 332
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,722评论 1 348
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,425评论 5 343
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,019评论 3 326
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,671评论 0 22
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,825评论 1 269
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,729评论 2 368
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,614评论 2 353

推荐阅读更多精彩内容