随机森林算法

随机森林的运作方式,是基于“集体智慧”的理念

核心原理

集成学习模型

bagging的方法

image-20260729124133969

意思: 不指望一只又高又大的树,而是很多决策树一起来

  1. 随机抽样:把原始数据随机分成很多份
  2. 训练决策树:为每个数据单独训练一棵决策树
  3. 组合模型:有问题,一起投票

拆分模型

森林:量变引起质变

  • 每棵树是个独立模型
  • 通过平均提高泛化能力

引入“随机”

“随机”如何体现?有两种随机性。

  1. 随机样本采样:对原始数据随机采样

  2. 随机特征选择:从已有特征中随机选择部分特征

    就是每棵树智能看其中几个特征

目的:为了减小各个树模型之间的关联性,确保模型的多样性

最终决策

用投票形式决策出最终的结果

核心优势

通过平均化处理提高模型的泛化能力

一个多元化团队一起得出的结论

  1. 减少单个模型的偏差
  2. 提高模型的泛化能力
  3. 创建更稳定、准确的预测
  4. 防止过拟合