详细内容或原文请订阅后点击阅览
在 AI 工作流程中要避免的 7 个常见 Python 错误
干净的运行证明流程已执行。它没有说明管道学到了什么、从哪些行中学到了什么、处于什么状态,或者保存的结果是否可以在其他任何地方信任。
来源:KDnuggets模型在验证中得分为 0.83,笔记本从上到下运行没有出现任何错误,部署三周后预测毫无用处。在这个故事的任何一点上都没有发生任何崩溃。这就是 AI 工作流程错误与普通 Python 错误的不同之处:API 乐意接受违反数据、状态、形状或工件契约的代码。然后惩罚会以可信的数字而不是回溯的形式出现。干净的运行证明流程已执行。它没有说明管道学到了什么、从哪些行中学到了什么、处于什么状态,或者保存的结果是否可以在其他任何地方信任。
下面的七个错误都共享这种沉默,并且每个错误都带有检查,在其开始的边界处捕获它。
1.数据分割前的拟合预处理
这是一个值得运行一次的演示。获取 100 个纯随机噪声样本,1,000 个特征宽,并通过抛硬币分配标签。现在向 SelectKBest 询问 20 个“最佳”特征,并交叉验证幸存者的分类器:
sel = SelectKBest(f_classif, k=20).fit(X, y) # 适合所有行
分数 = cross_val_score(model, sel.transform(X), y, cv=5)
