随机森林算法
随机森林算法
随机森林的运作方式,是基于“集体智慧”的理念
核心原理
集成学习模型
bagging的方法

意思: 不指望一只又高又大的树,而是很多决策树一起来
- 随机抽样:把原始数据随机分成很多份
- 训练决策树:为每个数据单独训练一棵决策树
- 组合模型:有问题,一起投票
拆分模型
森林:量变引起质变
- 每棵树是个独立模型
- 通过平均提高泛化能力
引入“随机”
“随机”如何体现?有两种随机性。
-
随机样本采样:对原始数据随机采样
-
随机特征选择:从已有特征中随机选择部分特征
就是每棵树智能看其中几个特征
目的:为了减小各个树模型之间的关联性,确保模型的多样性
最终决策
用投票形式决策出最终的结果
核心优势
通过平均化处理提高模型的泛化能力
一个多元化团队一起得出的结论
- 减少单个模型的偏差
- 提高模型的泛化能力
- 创建更稳定、准确的预测
- 防止过拟合
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 zhangxixi的博客!