无标题文章

  1. 综述
    1.1 Cover和Hart在1968年提出了最初的邻近算法
    1.2 分类(classification)算法
    1.3 输入基于实例的学习(instance-based learning), 懒惰学习(lazy learning)

  2. 例子:

      未知电影属于什么类型?
  1. 算法详述

    3.1 步骤:
    为了判断未知实例的类别,以所有已知类别的实例作为参照
    选择参数K
    计算未知实例与所有已知实例的距离
    选择最近K个已知实例
    根据少数服从多数的投票法则(majority-voting),让未知实例归类为K个最邻近样本中最多数的类别

    3.2 细节:
    关于K
    关于距离的衡量方法:
    3.2.1 Euclidean Distance 定义

 其他距离衡量:余弦值(cos), 相关度 (correlation), 曼哈顿距离 (Manhattan distance)
           

 3.3 举例
  1. 算法优缺点:
    4.1 算法优点
    简单
    易于理解
    容易实现
    通过对K的选择可具备丢噪音数据的健壮性

    4.2 算法缺点

      需要大量空间储存所有已知实例
      算法复杂度高(需要比较所有已知实例与要分类的实例)
      当其样本分布不平衡时,比如其中一类样本过大(实例数量过多)占主导的时候,新的未知实例容易被归类为这个主导样本,因为这类样本实例的数量过大,但这个新的未知实例实际并木接近目标样本
  1. 改进版本
    考虑距离,根据距离加上权重
    比如: 1/d (d: 距离)
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • 第5章 引用类型(返回首页) 本章内容 使用对象 创建并操作数组 理解基本的JavaScript类型 使用基本类型...
    大学一百阅读 8,706评论 0 4
  • 【2017年最新】☞ iOS面试题及答案 设计模式是什么? 你知道哪些设计模式,并简要叙述? 设计模式是一种编码经...
    紫色冰雨阅读 3,826评论 0 1
  • 转至元数据结尾创建: 董潇伟,最新修改于: 十二月 23, 2016 转至元数据起始第一章:isa和Class一....
    40c0490e5268阅读 5,876评论 0 9
  • 第二章:推荐系统入门 原文:http://guidetodatamining.com/chapter-2/ 内容:...
    vanhukset阅读 3,584评论 0 1
  • 事情要从《暗时间》这本书说起。最近因为关注关于学习方法和学习效率的缘故,重新拿出来开始读;不读则已,一读就被其内容...
    zhizhuwang阅读 2,372评论 0 1

友情链接更多精彩内容