3.2决策树模型
分类和决策问题决策树示例:
决策树的优缺点
好处:
(1)可以解释(可以让人看到对数据处理的过程)
(2)可以处理数值类和类别类的特征;
坏处:
(1)不稳定(数据产生一定的噪音之后,整棵树构建出的样子可能会不一样)*使用集成学习 (ensemble learning)可以解决
(2)数据过于复杂会生成过于复杂的树,会导致过拟合*把决策树的枝剪掉一些(在训练时觉得太复杂了就停下来,或在训练之后把特往下的节点给剪掉)
(3)大量的判断语句(太顺序化),不太好并行*在性能上会吃亏
随机森林(Random Forest)让决策树变得更稳定
目的:训练多棵决策树,提升模型鲁棒性(抗噪声、抗过拟合能力)
样本随机(Bagging自助采样) 每棵树用一套独立采样数据集,样本可重复抽取,约 37% 原始样本不会被抽到(袋外样本 OOB),可用于无验证集时评估模型泛化误差。
特征随机(特征子空间采样) 单棵树节点分裂时,不使用全部特征,仅随机挑选少量特征寻找最优分割(大幅降低树之间相关性,进一步抑制过拟合)
Gradient Boosting Decision Trees 梯度提升决策树(简称 GBDT)
多棵决策树串行依次训练(无法并行,必须等前一棵树训练完成才能训练下一棵)
【补充】熵:
(选择熵小的分支进行分裂)信息增益越大,分支熵越小,越优