走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

与本地法学硕士构建多模式工作流程

Building Multimodal Workflows with a Local LLM

使用 Gemma 4 和 Ollama 进行图像输入和结构化输出The post Building Multimodal Workflows with a Local LLM 首先出现在 Towards Data Science 上。

不要再把第一个重要的日子称为胜利

Stop Calling the First Significant Day a Win

检查 A/B 测试直至其超过 p < 0.05,可以将名义上 5% 的假阳性率变为近 28%。我使用种子模拟来显示损害有多大,并比较保持早期停止诚实的修复方法。停止称第一个重要的日子为胜利的帖子首先出现在走向数据科学上。

人工智能开发人员是否应该从 Polars 转向 Pandas?

Should AI Developers Make the Switch from Polars to Pandas?

并非所有 Python 数据库都是一样的!这篇文章人工智能开发人员应该从 Polars 切换到 Pandas 吗?首先出现在《走向数据科学》上。

预算分割的解释

The Budget Split That Explains Itself

如何在不失去解释结果的影子价格的情况下实现预算多元化《解释自身的预算分割》一文首先出现在《走向数据科学》上。

如何使用 Claude 代码有效部署代码

How to Effectively Deploy Code With Claude Code

了解如何优化编码代理的 CI/CD 管道《如何使用 Claude Code 有效部署代码》一文首先出现在《走向数据科学》上。

构建代理就绪的数据仓库:传统架构的错误之处

Building an Agent-Ready Data Warehouse: What Traditional Architectures Do Wrong

授予 AI 代理访问数据仓库的权限并不会自动使其为代理做好准备。真正的挑战在于教导代理数据的含义以及数据何时足够可靠可以使用。文章《构建代理就绪的数据仓库:传统架构做错了什么》首先出现在《走向数据科学》上。

变分自编码器 (VAE) 解释:从理论到 ELBO 以及重新参数化技巧

Variational Autoencoders (VAEs) Explained: From Theory to ELBO and the Reparameterization Trick

清晰、以数学为先的 VAE 如何学习生成新数据后变分自编码器 (VAE) 解释:从理论到 ELBO 和重新参数化技巧首先出现在《走向数据科学》上。

SPP-Net 论文演练:打破固定大小约束

SPP-Net Paper Walkthrough: Breaking the Fixed-Size Constraint

了解空间金字塔池化如何通过从头开始的 PyTorch 实现使 CNN 能够处理任何图像大小SPP-Net 后论文演练:打破固定大小约束首先出现在《走向数据科学》上。

我认为加载数据就是终点线。这是起点。

I Thought Loading Data Was the Finish Line. It Was the Starting Point.

构建我的第一个 dbt 模型并了解“分析就绪”数据的实际含义我认为加载数据是终点线。这是起点。首先出现在《走向数据科学》上。

在 Q、K 和 V 之前:重构 Transformer

Before Q, K, and V: Reconstructing the Transformer

许多 Transformer 解释者都是从完成的架构开始的。我们问为什么它看起来像这样。《Q、K 和 V 之前:重构 Transformer》一文首先出现在《走向数据科学》上。

为 My LangGraph AI Agent 构建 Streamlit UI

Building a Streamlit UI for My LangGraph AI Agent

为有状态的 LangGraph 代理构建生产就绪的 Web 界面为我的 LangGraph AI 代理构建 Streamlit UI 帖子首先出现在 Towards Data Science 上。

列表问题的循环工程:当答案是每一段而不是最上面的一段时

Loop Engineering for Listing Questions: When the Answer Is Every Passage, Not the Top One

企业文档智能 [Vol.1 #12] - 大多数 RAG 管道默默失败的问题类别,以及处理这些问题的管道形状列表问题的后循环工程:当答案是每一段时,而不是最重要的一个首先出现在走向数据科学上。

pandas 的问题不在于性能。这是认知开销。

The Problem with pandas Isn’t Performance. It’s Cognitive Overhead.

更快的数据帧引擎固然很好,但它们并没有减少分析师必须记住的语法量。帖子“pandas 的问题不是性能”。这是认知开销。首先出现在《走向数据科学》上。

上个月的机器学习经验教训

Last Month’s Machine Learning Lessons Learned

会议旅行的缺点上个月的机器学习经验教训首先出现在走向数据科学上。

交叉引用的循环工程:当 RAG 回答“参见第 7.2 节”而不是实际答案时

Loop Engineering for Cross-References: When RAG Answers ‘see Section 7.2’ Instead of the Actual Answer

企业文档智能 [Vol.1 #11] - 当第一个答案指向文档中的其他位置时,管道循环返回以获取链接的上下文交叉引用的后循环工程:当 RAG 答案“参见第 7.2 节”而不是实际答案首先出现在《走向数据科学》上。

前沿模型如何构建,请阅读 Kimi K3 报告

How a Frontier Model Gets Built, Read from the Kimi K3 Report

一个开放的 2.8 万亿参数模型,附带 47 页自己的配方。阅读它会告诉您构建前沿模型现在涉及什么,以及模型的内容有多少。如何构建前沿模型(阅读 Kimi K3 报告)一文首先出现在《走向数据科学》上。

半监督学习简介

Introduction to Semi-Supervised Learning

关于半监督学习、不同算法所采用的方法以及使用未标记数据的局限性的入门读物。半监督学习简介一文首先出现在《走向数据科学》上。

这是斜坡吗?无需模型即可检测 AI 生成的内容

Is This Slop? Detecting AI-Generated Content Without a Model

研究支持的线索,用于检测 LLM 生成的文本以及关于“为什么”该帖子是这样的数学直觉的数学直觉吗?在没有模型的情况下检测人工智能生成的内容首先出现在走向数据科学上。