走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

我将数据管道部署到AWS。然后所有"本地"的东西都崩溃了。

I Deployed My Data Pipeline to AWS. Then Everything That Was “Local” Broke.

将Docker化管道从笔记本电脑迁移所学到的关于容器、网络和隐藏假设的经验。

递归CTE:SQL的隐藏图遍历引擎

Recursive CTEs: SQL’s Hidden Graph Traversal Engine

导航层次结构、查找路径、检测循环和计算分隔度的实用指南。该文章《递归CTE:SQL的隐藏图遍历引擎》首次发表于Towards Data Science。

幻觉、水印、移除工具和被挤压的气球

Hallucinations, Watermarks, Removers, and a Squeezed Balloon

水印在模型产生疑虑的时刻发挥作用,捕捉AI错误的安全检查也是如此。该文章《幻觉、水印、移除器和一个被挤压的气球》首次发表于Towards Data Science。

一种文档类型,百万个文件:SQL表RAG查询的结构化提取

One Document Type, a Million Files: Structured Extraction into the SQL Table RAG Queries

企业文档智能[第1卷第14C期]——一小时两人六到十个字段,以及区分真实列和稍后会破坏筛选器的列的两个信号。该文章《一种文档类型,百万份文件:将结构化提取到

企业RAG主流教程中常搞错的10个要点

10 Positions for Enterprise RAG That Mainstream Tutorials Get Wrong

企业文档智能 [Vol.1 #M3] - 该系列争论的十个立场,以及争论它们的每篇文章的地图主流教程错误的企业 RAG 的 10 个立场首先出现在《走向数据科学》上。

大语言模型能否正确遗忘?

Can an LLM Forget the Right Things?

大多数 LLM 推理运行时不知道存在物理截止日期。这个拒绝入场而不是错过 33 毫秒的机器人控制周期,通过意义而不是年龄驱逐 KV 缓存,并且完全用手写 CUDA 编写 - 没有 cuBLAS,没有 libtorch。 帖子 Can an LLM Forget the Right Things? 帖子 Can an LLM Forget the Right Things?首先出现在《走向数据科学》上。

CPU上的推测解码:DFlash实现近4倍令牌生成加速

Speculative Decoding on CPUs: Nearly 4x Faster Token Generation with DFlash

推测性解码可以将未充分利用的 CPU 计算转化为更快的令牌生成,而无需更改模型的输出。在我们的 vLLM 测试中,DFlash 在并发数为 1 时在 Intel Xeon 6 上使用 Qwen3.5-9B 实现了 3.92 倍的自回归吞吐量。我们详细分析了加速的来源,解释了接受指标,并展示了决定推测是否有效的因素。CPU 上的推测解码:使用 DFlash 使令牌生成速度加快近 4 倍首先出现在《走向数据科学》上。

AI智能体不需要更多上下文——它们需要类型化上下文

AI Agents Don’t Need More Context — They Need Typed Context

人工智能代理不仅存在上下文问题,还存在上下文输入问题。当指令、内存、检索到的证据和工具输出被扁平化为一个字符串时,它们的语义边界就会消失。我构建了一个轻量级、零依赖的 Python 运行时,它可以使这些边界保持明确,跟踪出处,并在无效的上下文转换到达模型之前拒绝它们。本文介绍了实现、测试以及这种方法的作用和不保证的内容。《人工智能代理不需要更多上下文 — 他们需要类型化上下文》一文首先出现在《走向数据科学》上。

生存分析和 Cox 比例风险模型:初学者友好指南

Survival Analysis and the Cox Proportional Hazards Model: A Beginner-Friendly Guide

从 Kaplan-Meier 曲线到可运行 Python 代码的风险比后生存分析和 Cox 比例风险模型:初学者友好指南首先出现在《走向数据科学》上。

解析文件夹,而不仅仅是 PDF:案例文件中 RAG 需要的关系表

Parse the Folder, Not Just the PDFs: The Relational Tables RAG Needs on a Case File

企业文档智能 [Vol.1 #14D] - 索引列出了打开任何文件夹之前案例类型的要求,并且值得构建的两个问题根本不是检索问题帖子解析文件夹,而不仅仅是 PDF:案例文件中 RAG 需要的关系表首先出现在走向数据科学上。

为我的 LangGraph AI 代理构建合适的后端

Building a Proper Backend for My LangGraph AI Agent

将演示代理转变为可以保留真实预订数据的东西为我的 LangGraph AI 代理构建适当的后端一文首先出现在走向数据科学上。

多文档 RAG:不相关 PDF 的文件夹是一个带有嵌套大纲的长文档

Multi-Document RAG: A Folder of Unrelated PDFs Is One Long Document with a Nested Outline

企业文档智能 [Vol.1 #14B] - 没有共享字段意味着无需构建索引。每个文件一个摘要行加上每个文件自己的目录,检索路线向下两层多文档 RAG:不相关 PDF 的文件夹是一个带有嵌套大纲的长文档,首先出现在走向数据科学上。

从无数据中进行估算:从类别中得出连续分数

Estimating from No Data: Deriving a Continuous Score from Categories

当只有分类标签可用于训练时,使用低容量网络获取细粒度评分的演练及其背后的数学原理从无数据进行估计:从类别中得出连续分数的帖子首先出现在走向数据科学上。

从表中检索一行,而不是整个表:RAG 的行级块

Retrieve One Row from a Table, Not the Whole Table: Row-Level Chunks for RAG

企业文档智能 [Vol.1 #7sexies] - 检索单位不一定是页面或段落。当语料库包含表格时,每个正文行及其列标题本身就是一个块,并且通常是读者询问的一行从表中检索一行,而不是整个表:RAG 的行级块首先出现在走向数据科学上。

星型架构中的维度类型以及如何使用它们

The Types of Dimensions in a Star Schema, and How to Use Them

维度是维度建模中两种主要对象类型之一。但维度有哪些不同类型?如何使用它们?星型模式中的维度类型以及如何使用它们一文首先出现在《走向数据科学》上。

人工智能决策的贝叶斯护栏:在自动化决策之前测量不确定性

Bayesian Guardrails for AI Decisions: Measuring Uncertainty Before Automating Decisions

人工智能系统不应仅仅因为可以提供预测而自动做出决策。决策系统应该考虑预测的不确定性,如果错误代价高昂,则应推迟决策。人工智能决策的后贝叶斯护栏:在自动化决策之前测量不确定性首先出现在《走向数据科学》上。

如何有效地将您的意图与 Claude 代码保持一致

How to Effectively Align Your Intent with Claude Code

提高您对 Claude Code 的熟练程度。如何有效地使您的意图与 Claude Code 保持一致的帖子首先出现在 Towards Data Science 上。

三种 RAG 语料库,以及构建错误语料库的成本

Three Kinds of RAG Corpus, and What It Costs to Build for the Wrong One

企业文档智能 [Vol.1 #14A] - 三个问题告诉您文档集合具有哪种形状,每种形状都需要不同的架构《三种 RAG 语料库以及构建错误语料库的成本》一文首先出现在《走向数据科学》上。