详细内容或原文请订阅后点击阅览
构建端到端数据科学组合项目
大多数作品集都停留在笔记本上。一路走好你的。
来源:KDnuggets真正雇用人员的项目会做一些不同的事情。他们从业务问题开始,以建议结束,并展示了中间的每个阶段。显示从原始数据到部署的应用程序的每个阶段,是简历无法证明、笔记本无法伪造的。
为了保持具体,我们将自始至终使用一个真实的项目:DoorDash Delivery Duration Prediction 数据项目。这是一个免费项目,因此您可以自行构建。
我们将在 StrataScratch 的内置笔记本环境中完成它,这是一个集成的 Marimo 笔记本,您可以通过单击项目页面上的“开始求解”来打开,因此在开始之前无需安装任何内容。
这就是我们要做的。我们将采用该项目,并通过真实数据科学项目的九个阶段来运行它:构建业务问题、使用 SQL 提取数据、用 Python 清理数据、探索数据、工程功能、构建和评估模型,最后将结果部署为 API 和以建议结尾的仪表板。
每个阶段都是同一个故事的一个章节,每个阶段都是招聘经理可以亲眼看到的。最后,您将拥有一个几乎可以放入任何项目的模板。
从业务问题开始
在编写任何代码之前,请确定您实际要解决的问题。
DoorDash 项目给了我们一个明确的业务问题:给定订单,交货需要多长时间?这个框架很重要。重要的是业务关心什么,而不是算法。
这是大多数投资组合最容易出错的地方。
一个名为“交付时间预测”的项目告诉招聘经理您为公司做了什么。一个名为“XGBoost 回归演示”的项目告诉他们您遵循了教程。
围绕结果构建问题,并选择具有实际利害关系的问题:客户流失、预测、欺诈,或者在我们的例子中是运营效率。
使用 SQL 提取数据
DoorDash 项目为我们提供了一个 CSV,historical_data.csv:
输出:
