走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

如何在不破坏正确性的情况下扩展集成管道

How to Scale an Integration Pipeline Without Breaking Correctness

将企业集成管道从每秒 500 个事件扩展到 8,000 个事件的生产帐户,这两个正确性保证了吞吐量工作永远不会被允许牺牲。如何在不破坏正确性的情况下扩展集成管道的帖子首先出现在走向数据科学上。

Kimi K3 的 1M 令牌上下文窗口与 RAG:成本、延迟和应答质量

Kimi K3’s 1M Token Context Window vs. RAG: Cost, Latency and Answer Quality

对相同 12 个问题、相同系统提示和相同模型的前 5 个 RAG 管道和完整的 127,000 个令牌提示进行受控比较。对正确性、完整性和接地性进行盲评分。Kimi K3 的 1M 令牌上下文窗口与 RAG:成本、延迟和答案质量一文首先出现在 Towards Data Science 上。

了解反AI舆论

Understanding Anti-AI Public Opinion

当人们看到价值时,他们可以接受权衡——但如果他们不这样做,会发生什么?理解反人工智能舆论的帖子首先出现在走向数据科学上。

Jigsaw Jeeves:使用计算机视觉构建拼图助手

Jigsaw Jeeves: Building a Puzzle Assistant using Computer Vision

Python 中解决方案方法的概念概述和演练Jigsaw Jeeves:使用计算机视觉构建拼图助手一文首先出现在 Towards Data Science 上。

构建人们可以信任、验证和改进的企业代理系统

Building Enterprise Agent Systems that People can Trust, Verify and Improve

决定代理系统在生产中是否成功的 5 个原则,通过我为一家价值超过 1 亿美元的公司构建的一个原则进行了解释。构建人们可以信任、验证和改进的企业代理系统一文首先出现在《走向数据科学》上。

图工程不是关于更多连接 - 而是关于使用哪些连接

Graph Engineering Isn’t About More Connections — It’s About Which Ones Get Used

在代理之间添加更多通信路径并不一定会提高多代理性能。在 50 次运行的受控、可重复实验中,回收率在 20% 至 100% 关系密度范围内保持非常稳定。但随着网络变得更加密集,实际使用的边的比例急剧下降,揭示了配置连接和行为连接之间的差距。图工程不是关于更多连接 - 而是关于哪些连接被使用首先出现在走向数据科学上。

十不是一百

Ten Is Not a Hundred

欺骗所有幻觉探测器的数字“十不是一百”的帖子首先出现在《迈向数据科学》上。

如何利用人工智能进行有效的项目管理

How to Perform Effective Project Management with AI

通过法学硕士成为一名更有生产力的软件工程师如何使用人工智能进行有效的项目管理一文首先出现在走向数据科学上。

使用 Quack 在三个远程 DuckDB 服务器上同时运行 SQL

Running SQL Concurrently Across Three Remote DuckDB Servers with Quack

远程 SQL 执行的一个小实验使用 Quack 在三个远程 DuckDB 服务器上同时运行 SQL 的帖子首先出现在 Towards Data Science 上。

人机协作使数学实验变得丰富

Mathematical Experiments Are Becoming Abundant Through Human-Machine Teaming

两个悬而未决的问题,精确的算术检查和证明助理,在一个周末。帖子《通过人机协作使数学实验变得丰富》首先出现在《走向数据科学》上。

如何在 Vibe 编码时代成为一名数据科学家

How to Shine as a Data Scientist in the Vibe Coding Era

以下是如何成为在编码成为商品的世界中蓬勃发展的数据科学家。 《如何在 Vibe 编码时代成为一名数据科学家》一文首先出现在《迈向数据科学》上。

2026 年数据科学家生活中的一天

A Day in the Life of a Data Scientist in 2026

人工智能如何极大地改变了我的日常工作流程《2026 年数据科学家生活中的一天》一文首先出现在《迈向数据科学》上。

我的模型在自己的测试中作弊

My Model Was Cheating on Its Own Test

预处理管道让我的汽车价格模型在考试前查看测试集,并且 R 平方的 12 个点作弊到了“我的模型在自己的测试中作弊”一文,该文章首先出现在《走向数据科学》上。

如何高效利用 OKF 实现法学硕士之间的知识交流

How to Utilize OKF Efficiently to Enable Knowledge Exchange Among LLMs

Google 的开放知识格式 (OKF) 是一个 Markdown+YAML 框架,用于在人类和 AI 代理之间共享知识。这篇文章在一项非常具体的工作中重用了该框架——在三个 Qwen2.5-Coder 模型(7B、3B、1.5B)之间进行预标记化整数数组的代理到代理的交接,并显示了 28-37% 的 TTFT 减少以及一个确保整个安全的全词汇等效性检查。如何有效利用 OKF 来实现 LLM 之间的知识交换的文章首先出现在 Towards Data 上科学。

通过减少 LLM 调用而不是购买更快的模型来降低企业 RAG 管道的延迟和成本

Cut an Enterprise RAG Pipeline’s Latency and Cost by Calling the LLM Less, Not by Buying a Faster Model

企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。

如何编排 OpenClaw 机器人群

How to Orchestrate a Fleet of OpenClaw Bots

了解如何运行 OpenClaw 机器人以提高工作效率《如何协调 OpenClaw 机器人队列》一文首先出现在《走向数据科学》上。

LangChain 与 LangGraph:4 个主要差异以及何时使用每个差异

LangChain vs LangGraph: 4 Key Differences and When to Use Each

为您的代理工作流程和系统选择合适工具的实用指南LangChain 与 LangGraph:4 个关键差异以及何时使用每个差异首先出现在 Towards Data Science 上。

向初学者解释反向传播(第 3 部分):反向传播的实际工作原理

Backpropagation Explained for Beginners (Part 3): How Backpropagation Really Works

从一个梯度到每个梯度这篇文章《为初学者解释反向传播(第 3 部分):反向传播的实际工作原理》首先出现在《走向数据科学》上。