集成方法

集成方法或元算法是对其它算法进行组合的一种方式,根据是否使用基学习器分为同质和异质

优点:泛化错误率低,易编码,可以应用在大部分分类器上,无参数调整

1.从统计的方面来看,由于学习任务的假设空间往往很大,可能有多个假设在训练集上达到同等性能,此时若使用单学习器可能因为误选而导致泛化性能不佳,结合多个学习器会减少这一风险

2.从计算的方面看,学习算法往往会陷入局部极小,导致泛化性能糟糕,集成可降低陷入局部极小点的风险

3.从表示的方面看,某些学习任务的真实假设可能不在当前学习算法所考虑的假设空间内,此时使用单个学习器必定无效,而通过集成,扩大假设空间,有可能学得更好的解

缺点:对离群点敏感

适用数据类型:数值型和标称型数据


 Bagging(bootstrap aggregating)自举汇聚法

从原始数据集中选择S次得到S个新数据集,每次使用随机放回抽样。

然后应用某个学习算法,得到S个分类器,与此同时,选择分类器投票结果最多的类别作为最后的分类结果(权重相等),对回归任务使用平均值

主要关注方差,因此它在不剪枝决策树,神经网络等易受样本扰动的学习器上效果更为明显


随机森林

以决策树为基学习器

每次在选择属性进行划分时,随机选择一个包含K个属性的子集,然后从中选择一个最优的属性。若K=D,则与传统的决策树相同,若K=1,则完全随机。

一般采用K=SQRT(D)或者LOG(D)


Boosting:

 多个分类器的类型仍然一致,但不同的分类器串行训练,每个新分类器都根据已训练处的分类器的性能来进行训练,通过关注已有分类器错分的数据来获得新的分类器。

结果是基于所有分类器的加权求和,权重并不相等,对应分类器的成功度

Boosting 主要关注偏差


AdaBoost(adaptive boosting): 弱分类器(单层决策树)越简单效果越好,“弱”是指分类器的性能比随机猜测要略好.

步骤:

1.对训练数据中的每个样本赋予权重,这些权重构成向量D,并初始化成相等值

2.首先训练一个弱分类器并计算错误率

3.重新调整样本权重,上一轮迭代中分对的样本权重将会降低,分错的提高。

为了从所有弱分类器中得到最终的分类结果,分配分类器权重alpha,基于分类器错误率

a = 0.5*ln(1- ε/ε)

如果某个样本正确分类,Di(t+1) = Di(t)*e^-a/Sum(D)

如果某个样本错误分类,Di(t+1) = Di(t)*e^a/Sum(D)

弱分类器如果过多,容易导致过拟合,使用错误率上升


结合策略

1.平均法

简单平均,加权平均

在个体学习器性能相差较大时宜采用加权平均法

2.投票法

绝对多数投票法,相对多数投票法,加权投票法

3.学习法

通过另一个学习器来结合

个体学习器称为初级学习器,用于结合的学习器称为次级学习器

Stacking算法先从初始数据中训练出初级学习器,然后生成一个新数据集用于训练次级学习器,在这个新数据集中,初级学习器的输出被当做样例输入特征。

次级学习器的输入属性表示和次级学习算法对stacking集成的泛化性能有很大影响。

用多响应线性回归MLR的效果较好

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 217,542评论 6 504
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 92,822评论 3 394
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 163,912评论 0 354
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 58,449评论 1 293
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 67,500评论 6 392
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 51,370评论 1 302
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,193评论 3 418
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,074评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 45,505评论 1 314
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,722评论 3 335
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,841评论 1 348
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,569评论 5 345
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,168评论 3 328
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,783评论 0 22
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,918评论 1 269
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,962评论 2 370
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,781评论 2 354

推荐阅读更多精彩内容