详细内容或原文请订阅后点击阅览
关于缺失值我们错过了什么
我们观察到的数据背后隐藏的假设。我们错过的关于缺失值的帖子首先出现在走向数据科学上。
来源:走向数据科学正如古老的格言所说,智者曾经什么也不说。不幸的是,同样的尊重很少延伸到缺失的数据。具有空白单元格的行通常被视为在分析开始之前需要解决的问题:删除它,用平均值填充它,做任何最简单的事情,然后继续。按照这种逻辑,空白单元格是记录中的缺陷,而不是关于世界的事实。但缺乏测量可以提供真正的见解,而我们处理它的方式可能会极大地改变我们得出的结论。更好地理解缺失不是一种不幸的麻烦,而是产生我们观察到的数据的过程的副产品。
在临床试验中,在研究结束评估之前退出的患者并不是入组患者的随机样本。他们中治疗失败、不良事件严重或基础病情恶化的人比例过高。在注册表单上,当用户不愿透露真实数字时,可选收入字段更有可能留空。在产品实验中,在测量窗口关闭之前流失的用户永远不会产生本应记录的结果,并且由于他们接受的治疗,可能会不成比例地这样做。在每种情况下,确定某物是否被观察到的过程本身可能与我们试图理解的现象有关。
因此,我们如何处理缺失值应该取决于缺失的原因以及我们试图从数据中了解什么。没有中立的决定;每种方法都带有对产生差距的过程的假设。我们能做的最好的事情就是仔细思考这个过程并明确我们不知道的事情。
···
参考文献
Chen, T. 和 Guestrin, C. (2016)。 XGBoost:可扩展的树增强系统。第 22 届 ACM SIGKDD 国际知识发现和数据挖掘会议论文集,785–794。https://doi.org/10.1145/2939672.2939785
