一文看懂集成学习（详解 bagging、boosting 以及他们的 4 点区别）

时间 2019-11-08

标签一文看懂集成学习详解 bagging boosting 以及他们区别栏目 C&C++ 繁體版

原文原文链接

在机器学习中，咱们讲了不少不一样的算法。那些算法都是单打独斗的英雄。而集成学习就是将这些英雄组成团队。实现“3 个臭皮匠顶个诸葛亮”的效果。html

本文将介绍集成学习的 2 种主要思路：bagging、boosting。算法

什么是集成学习？

集成学习归属于机器学习，他是一种「训练思路」，并非某种具体的方法或者算法。bootstrap

现实生活中，你们都知道「人多力量大」，「3 个臭皮匠顶个诸葛亮」。而集成学习的核心思路就是「人多力量大」，它并无创造出新的算法，而是把已有的算法进行结合，从而获得更好的效果。api

集成学习会挑选一些简单的基础模型进行组装，组装这些基础模型的思路主要有 2 种方法：dom

Bagging 的核心思路是——民主。机器学习

Bagging 的思路是全部基础模型都一致对待，每一个基础模型手里都只有一票。而后使用民主投票的方式获得最终的结果。函数

大部分状况下，通过 bagging 获得的结果方差（variance）更小。学习

具体过程：3d

从原始样本集中抽取训练集。每轮从原始样本集中使用Bootstraping的方法抽取n个训练样本（在训练集中，有些样本可能被屡次抽取到，而有些样本可能一次都没有被抽中）。共进行k轮抽取，获得k个训练集。（k个训练集之间是相互独立的）
每次使用一个训练集获得一个模型，k个训练集共获得k个模型。（注：这里并无具体的分类算法或回归方法，咱们能够根据具体问题采用不一样的分类或回归方法，如决策树、感知器等）
对分类问题：将上步获得的k个模型采用投票的方式获得分类结果；对回归问题，计算上述模型的均值做为最后的结果。（全部模型的重要性相同）

举例：rest

在 bagging 的方法中，最广为熟知的就是随机森林了：bagging + 决策树 = 随机森林