详细内容或原文请订阅后点击阅览
生存分析和 Cox 比例风险模型:初学者友好指南
从 Kaplan-Meier 曲线到可运行 Python 代码的风险比后生存分析和 Cox 比例风险模型:初学者友好指南首先出现在《走向数据科学》上。
来源:走向数据科学普通回归无法回答
这是一个数据集。 432人被释放并被跟踪一年。他们受到监视只是为了一个事件:再次被捕。有些人在第 8 周再次被捕,有些人在第 30 周再次被捕。大多数人(其中 318 人)在研究结束时从未再次被捕。
这项研究中提出的简单问题是,某人再次犯罪需要多长时间?
我们不能仅仅平均逮捕时间。四分之三的人从未被捕,因此他们没有平均逮捕时间。我们也不能抛弃那些人。因为如果我们只分析那些失败的人,我们最终会得出结论,每个人最终都会再次犯罪,这是错误的,也是残酷的。我们也无法在第 52 周后将幸存者编码为被捕,因为他们并没有被捕。他们要么在第 52 周后的某个星期被捕,但我们从未见过,或者也许永远都没有。
最后一种情况,即我们知道某人至少持续了这么长时间,但我们不知道总共持续了多长时间,称为审查。这就是生存分析作为自己的领域存在的全部原因。普通的线性回归无法表示“答案至少是52”。它想要一个数字。生存分析是针对以下情况而构建的一组工具:对于我们的大部分数据,当我们停止观看时时钟仍在运行。
这篇文章建立在这个单一问题的基础上。我们将从理解生存分析所需的三个核心思想开始。然后我们将继续进行以下三项活动。
1. 首先,我们将直接根据 Kaplan-Meier 数据估计生存曲线。
2. 然后将大部分时间花在 Cox 比例风险回归上。
3. 最后,我们将在 Python 中拟合一个模型,将其输出读取为风险比。
生存分析的三个核心概念
生存分析中的几乎所有内容都是由三个对象构建的,如下所述。
12 个月时的生存率为 0.7" 意味着 70% 的患者预计一年后仍不会发生事件。
总结:
