监督学习之分类算法

在已标签的训练数据中构建分类模型,并在此基础上,对新数据进行分类。这就是分类算法要解决的问题。

分类算法的准确性,取决于以下三个方面:1)所选算法的有效性;2)算法的运用方式;3)所用训练数据的有用性。

谈到分类算法,不可避免我们会谈到逻辑回归(Logistic Regression)和支持向量机(Support Vector Machine)。接下来,我们就来好好讲一讲~

逻辑回归: 0还是1?

逻辑回归(logistic regression)又称逻辑回归分析,是一种广义的线性回归分析模型,常用于数据挖掘,疾病自动诊断,经济预测等领域。

作为分类算法的一种,逻辑回归用于计算分类目标变量Y归属于某个特定分类的概率值。

虽然逻辑回归通常被用在二元分类中。但是,我们也可以对多元问题进行分类,例如,手写数字识别。

如何利用逻辑回归模型的输出做出决策?

逻辑回归模型看起来就像是一个S型曲线,在X值给出的情况下,可以计算出P(Y=1)。

.jpg

为了预测出Y的值——是否是垃圾邮件?是否患癌?是否欺诈?等等——我们需要设置一个阈值。比如说,当我们设置的模型判定这封邮件是垃圾邮件的可能性高于70%时,才会将它标记为垃圾邮件。那么当可能性低于70%时,它就不会被判定为垃圾邮件。

这个阈值通常取决于你对FP(false positives,将负类预测为正类数)和FN(false negatives,将正类预测为负类数)的容忍度。比如说,在诊断癌症时,我们对FN(即把病人患癌的事实预测为未患癌症的结果)的容忍度比较低,原因在于,即使病人患癌的几率很小,我们也必须进行进一步检查以确定他是否患有癌症。也就是说,假设病人实际上患癌了,却被诊断出没有患癌症(也就是我们通常所说的误诊),由于我们对FN的容忍度比较低,所以需要进一步对病人进行检查,这个时候,我们更希望得到的结果是:检测出病人患了癌症。

另外,关于欺诈性贷款申请,人们对FP的接受度也更高些,尤其是针对小额贷款。一方面,是因为审查成比较高,另一方面,小额贷款申请并没有必要付出额外的运营成本,甚至与那些被标记为需要进一步处理的非欺诈性申请者产生摩擦。这样反而会得不偿失。

使用逻辑回归时,如何最小化损失函数?

在逻辑回归中,损失函数是最基本的衡量方法,可以衡量出当真实答案为0时,你的预测值为 1的频率。反之亦然。

.jpg

这是一个正则化的损失函数(cost function)。当你看到这么长的公式时可千万别被吓到了。我们可以将其分解成不同的数据块,然后去理解它。

第一个数据块为data loss(数据丢失),举个例子,模型预测值和事实值之间的差异有多大?第二个数据块为正则化损失(regularizationloss),比如说,针对大量严重影响特定特征的参数的模型,我们进行了多大的惩罚。

我们将利用梯度下降法使损失函数最小化。我们已经建立了逻辑回归模型来将分类预测变得尽可能准确。

支持向量机(SVMs)

支持向量机同逻辑回归解决的是相同的问题,并产生类似的结果。

支持向量机可解决问题包括:

1. 这个图上的是猫还是狗?

2. 这条评论是正能量的还是负能量的?

3. 这些二维平面的点是红色还是蓝色?

关于支持向量机,我也曾看到过一篇详尽的文章,对SVMs进行了详细的分析,原文链接请戳:https://mp.weixin.qq.com/s/YbGxhG-IoOpqx2Wbbzf52Q

——END——

大家好,我是AI搬运工

致力于将国外的AI好文,翻译成大家都懂的中国话!

原文来源:Machine Learning for Humans

往期回顾:
01 谈及监督学习时,我们在谈什么?
02 监督学习之回归分析法:预测连续数值

以上内容为AI搬运工本人翻译,如有错误,欢迎指正。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 229,908评论 6 541
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 99,324评论 3 429
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 178,018评论 0 383
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 63,675评论 1 317
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 72,417评论 6 412
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 55,783评论 1 329
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 43,779评论 3 446
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 42,960评论 0 290
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 49,522评论 1 335
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 41,267评论 3 358
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 43,471评论 1 374
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 39,009评论 5 363
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 44,698评论 3 348
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 35,099评论 0 28
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 36,386评论 1 294
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 52,204评论 3 398
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 48,436评论 2 378

推荐阅读更多精彩内容

  • 首页 资讯 文章 资源 小组 相亲 登录 注册 首页 最新文章 IT 职场 前端 后端 移动端 数据库 运维 其他...
    Helen_Cat阅读 3,903评论 1 10
  • 接触机器学习时间也不短了, 趁国庆放假, 做一下深度整理. 1. 大纲 若想在企业胜任算法相关岗位知识, 除了掌握...
    婉妃阅读 3,423评论 2 92
  • 作为一名医生,我是阅人无数,更是见惯了生死。对于陈家和去世,我虽然遗憾,却也无能为力,我自信他的手术毫无问题,所以...
    卡梅拉的精彩人生阅读 228评论 0 0
  • R:给未来的自己发条信息。FutureMe.org的创始人发明了一种给未来的自己发邮件的方法。从2003年起,他们...
    彤彤妈_子叶阅读 160评论 1 1
  • 两个月以前,还是那个习惯性每一天手写日记的人,只是慢慢被网易云云笔记弄晕乎了,然后直接丢掉了手写,却也没有每一天...
    小Totoro阅读 109评论 0 0