走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

现实生活中的线性判别分析 (LDA):房地产数据集中的降维

Linear Discriminant Analysis (LDA) in Real-Life: Dimensionality Reduction in a Real-Estate Dataset

在分类问题中使用 LDA 进行降维《现实生活中的线性判别分析 (LDA):房地产数据集中的降维》首先出现在《走向数据科学》上。

为什么 Transformers 需要时间序列的位置编码:视觉指南

Why Transformers Need Positional Encoding For Time Series: A Visual Guide

从标量观察到自我关注,以及位置信息如何恢复序列顺序这篇文章《为什么 Transformers 需要时间序列的位置编码:视觉指南》首先出现在《走向数据科学》上。

使用降阶模型的动态系统迁移学习

Dynamical System Transfer Learning with Reduced Order Models

改进复杂物理的强化学习后动态系统迁移学习与降阶模型首先出现在走向数据科学上。

异构变体成本下的最优流量分配

Optimal Traffic Allocation Under Heterogeneous Variant Cost

为什么当你的处理比你的控制更昂贵时,默认的 50/50 分割是错误的举动,以及基于成本的采样权重如何解决它异构变体成本下的最优流量分配帖子首先出现在走向数据科学上。

分解是一个千 GPU 问题

Disaggregation Is a Thousand-GPU Problem

在将预填充与解码分开之前必须满足的三个条件得到了回报,以及为什么分块预填充是低于该阈值的正确默认值。分解是一个千 GPU 问题首先出现在走向数据科学上。

Power BI 开发人员的 Microsoft Fabric 生存指南

The Power BI Developer's Survival Guide to Microsoft Fabric

Power BI Premium 已消失。 Microsoft Fabric 取代了它。以下是您实际发生的变化、没有发生的变化以及从哪里开始 — 无需恐慌。《Microsoft Fabric 的 Power BI 开发人员生存指南》一文首先出现在 Towards Data Science 上。

如何在没有强大计算机的情况下运行 10 多个 Claude 代码会话

How to Run 10+ Claude Code Sessions Without a Powerful Computer

了解如何在家里无需昂贵、强大的硬件的情况下运行大量并行编码代理这篇文章《如何在没有强大计算机的情况下运行 10 多个 Claude 代码会话》首先出现在《走向数据科学》上。

如何在智能人工智能时代解决正确的问题

How to Solve the Right Problem in the Age of Agentic AI

在智能体加速实施之前减少不确定性的实用框架《如何在智能体人工智能时代解决正确的问题》一文首先出现在《走向数据科学》上。

避免数据湖中的实体键漂移:第 2 步,当模糊匹配停止工作时

Avoiding Entity Key Drift in a Data Lake: Step 2, When Fuzzy Matching Stops Working

我构建了一个匹配器,旨在完成标准化留下的清理工作。根据真实数据对其进行测试表明,它的任何版本都不可能是安全的。接下来是匹配器被搁置后留下的架构。避免数据湖中的实体键漂移:第 2 步,当模糊匹配停止工作时首先出现在走向数据科学上。

说“不在本文档中”的 RAG 必须出示四种证据

A RAG That Says “Not in This Document” Has to Show Four Kinds of Evidence

企业文档智能 [Vol.1 #B3] - 自信的错误答案是一个错误。没有任何理由的赤裸裸的“不回答”几乎同样糟糕。四块砖块中的每一块都有一个要显示的证据“A RAG That Says “Not in This Document” has to Show Four Kinds of Evidence”一文首先出现在《走向数据科学》上。

图神经网络:GCN、MPNN 和 GAT,简单解释

Graph Neural Networks: GCN, MPNN, and GAT, Explained Simply

图神经网络如何在底层工作的视觉指南《图神经网络:GCN、MPNN 和 GAT,简单解释》一文首先出现在《走向数据科学》上。

PySpark 窗口函数实用介绍

A Practical Introduction to PySpark Window Functions

为什么标准的 groupBy 函数不够用《PySpark 窗口函数实用介绍》一文首先出现在 Towards Data Science 上。

关于缺失值我们错过了什么

What We Miss About Missing Values

我们观察到的数据背后隐藏的假设。我们错过的关于缺失值的帖子首先出现在走向数据科学上。

超越点预测:贝叶斯神经网络实用介绍

Beyond Point Predictions: A Practical Introduction to Bayesian Neural Networks

通过不确定性量化做出更明智的决策《超越点预测:贝叶斯神经网络实用介绍》一文首先出现在《走向数据科学》上。

RAG 常见问题解答:当您开始设计语料库时

FAQ as RAG: When You Get to Design the Corpus

企业文档智能 [Vol.1 #B2] - 常见问题解答颠倒了标准 RAG 管道的每一块砖。解析是微不足道的,检索兼作缓存,并且几次提示也成为检索问题作为 RAG 的常见问题解答:当您开始设计语料库时,首先出现在走向数据科学上。

为什么应该赢得 RAG 复杂性

Why RAG Complexity Should Be Earned

构建 RAG 管道的框架,该框架引入了复杂性以响应观察到的故障模式,从词汇和混合搜索到重新排序和代理信息搜索为什么应该赢得 RAG 复杂性的帖子首先出现在走向数据科学上。

AgentOps 不是 MLOps:当代理投入生产时,监控堆栈会出现哪些问题

AgentOps Is Not MLOps: What Breaks in Your Monitoring Stack When Agents Go to Production

代理程序破坏了五个 MLOps 监控假设,哪些继承的信号现在将失败的运行视为正常运行。AgentOps 不是 MLOps:当代理程序投入生产时,监控堆栈中发生的问题首先出现在 Towards Data Science 上。

上下文工程正在发生变化。这对数据科学家意味着什么

Context Engineering Is Changing. Here’s What It Means for Data Scientists

如何将最新的上下文工程指南应用到日常数据科学工作中后上下文工程正在发生变化。这对数据科学家意味着什么首先出现在《走向数据科学》上。