详细内容或原文请订阅后点击阅览
为何随机森林需要达到如此随机
Bagging遇到了无论多少棵树都无法突破的瓶颈——这是解释其原因的方程,以及证明它的实验。该文章《为什么随机森林需要如此随机》首次发表于Towards Data Science。
来源:走向数据科学“随机森林 = 许多树 + 平均 = 更好。”如果您读过哪怕一本集成方法教程,您都会对这句话感到熟悉到恶心的程度。即使遵循最基本的数据科学教程,任何人都会明白这并没有错。另一方面,它的本质是危险的不完整,因为如果这就是整个故事,那么该模型将被称为“袋装树”,我们就会停在那里。我们将采取引导样本,训练树,对它们进行平均,完成。名称中根本不需要“随机”一词。
但事实并非如此。当 Breiman 在 2001 年设计随机森林时,他故意添加了第二层随机性:在每次分裂时,每棵树只能看到可用特征的随机子集;不是全部,只是随机的一部分。
为什么?如果方差是唯一的问题,并且装袋已经通过平均减少了方差,那么这个额外的、看似限制性的约束会增加什么?为什么要故意让你的树“更加盲目”?为什么要隐藏模型中可能被证明很重要的现有信息?
答案隐藏在从业者经常抛出但很少用数学方法解释的一个词中:相关性。具体来说,树木本身的预测之间的相关性。一旦你了解了它背后的数学原理,随机森林的整个设计就不再看起来像任意超参数的集合,而是开始看起来像是针对一个非常具体的敌人的单一而优雅的论证:相关错误,仅靠平均永远无法完全消除,而这正是装袋和算法真正潜力之间的障碍。
这就是本文的主题:为什么 bagging 本身有一个硬上限,这个上限是什么,以及特征子采样如何成为突破它的数学上必要的举措。
偏差-方差,快速复习
在深入研究树之前,让我们快速回顾一下如何将预测误差分解为三部分:
这在物理上说明了什么
-
