None

None

来源:走向数据科学

一个听起来简单但其实不然的问题

错误的目标。假设我们想要估计暴露对结果的影响,例如空气污染对入院或药物与康复时间的影响。我们有观察数据、一个暴露变量和一堆候选协变量。有些是混杂因素。有些是噪音。现在最大的问题是——模型中包含哪些?

通常的反射将选择交给选择规则。运行逐步例程、比较 BIC 值,甚至交叉验证 Lasso。完整贝叶斯平均收益超过候选规格。

然而,这些方法的问题在于,这些工具中的每一种都优化了预测拟合。模型可以完美地预测结果,但对我们关心的效果却存在系统性错误。

这个问题是 Chi Wang、Giovanni Parmigiani 和 Francesca Dominici 2012 年生物识别学论文的主题,他们称潜在问题为调整不确定性。正是针对哪些变量进行调整的不确定性,他们提出了一种称为混杂贝叶斯调整(BAC)的解决方案[1]。它还有一个著名的常客孪生,大多数人没有意识到这是相同的见解:后双重选择和双重机器学习[3][4]。

在这篇文章中,我将演示三件事。我将向您展示可运行的 Python 中的故障模式,构建修复程序,然后最终向您展示修复程序本身的锋利优势:“针对任何预测暴露的内容进行调整”的情况完全是错误的建议,并使您的估计变得更糟。

如果您一直在阅读有关倾向得分、子分类和匹配的内容,那么这些方法假设您已经回答了这个问题:您如何从数据中决定哪些协变量是有效的调整需求?

好的预测变量和混杂因素并不相同

Wang 和合著者用五个候选协变量说明了这一点。 U1、U2 和 U3 分别与 X 和 Y 相关。U4 单独预测 Y。 U5 是噪音。

故障模式,Python

这里发生了三件事: