走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

添加更多 AI 代理之前重新设计工作

Redesign Work Before You Add More AI Agents

绘制人工智能价值、设计工作流程、重新定义人才、升级执行团队并衡量业务影响。添加更多人工智能代理之前重新设计工作一文首先出现在《走向数据科学》上。

产生虚假相关性的子空间内部

Inside the Subspace Where Spurious Correlations Are Born

为什么小样本可以偶然产生大相关性,以及为什么大样本并不总是意味着有意义这篇文章《内部虚假相关性诞生的子空间》首先出现在《走向数据科学》上。

阈值是价格,而不是百分比

The Threshold Is a Price, Not a Percentage

如何通过使用成本不对称而不是固定的置信截止来决定人工智能代理何时应自行行动阈值是价格,而不是百分比的帖子首先出现在走向数据科学上。

信息论和集成模型

Information Theory and Ensemble Models

我们应该如何更好地集成时间序列预测?《信息论和集成模型》一文首先出现在《走向数据科学》上。

格兰杰因果网络和间接反馈

Granger Causal Networks and Indirect Feedback

结构 VAR 的非参数变量选择后格兰杰因果网络和间接反馈首先出现在《走向数据科学》上。

测量计量经济模型的结构稳定性

Measuring Structure Stability of Econometric Models

时间序列预测最简单最重要的想法计量经济模型的结构稳定性后测量首先出现在走向数据科学上。

PDF 的生产 RAG 管道:关系解析、TOC 检索、键入答案

A Production RAG Pipeline for PDFs: Relational Parsing, TOC Retrieval, Typed Answers

企业文档智能 [Vol.1 #9A] - 同一篇论文,与第 1 条相同的问题。每块砖一个升级的合同:文档解析、问题解析、检索、生成PDF 的生产 RAG 管道:关系解析、TOC 检索、类型化答案一文首先出现在 Towards Data Science 上。

代理指针 RAG:无需语义预编译的时间推理

Proxy-Pointer RAG: Temporal Reasoning Without Semantic Precompilation

Proxy-Pointer 和 LLM-Wiki 的技术比较后 Proxy-Pointer RAG:无需语义预编译的时间推理首先出现在 Towards Data Science 上。

识别太空中的微生物

Identifying Microbes in Space

国际空间站上生活着什么?《识别太空中的微生物》一文首先出现在《走向数据科学》上。

数据漂移和机器学习可靠性的生存分析

Survival Analysis for Data Drift and ML Reliability

将模型退化视为故障时间问题数据漂移和 ML 可靠性的后生存分析首先出现在《走向数据科学》上。

如何使用 Claude 代码运行端到端测试

How to Run End-to-End Tests with Claude Code

通过端到端测试提高编码代理的有效性。如何使用 Claude Code 运行端到端测试一文首先出现在 Towards Data Science 上。

PANet 论文演练:当特征金字塔自下而上时

PANet Paper Walkthrough: When Feature Pyramids Go Bottom-Up

了解 PANet 如何缩短低级和高级特征之间的路径 PANet 后论文演练:当特征金字塔自下而上时首先出现在《走向数据科学》上。

AI 代理解释:什么是 ReAct 循环及其工作原理?

AI Agents Explained: What Is a ReAct Loop and How Does It Work?

代理如何推理、行动和观察最终答案,一次一步人工智能代理解释:什么是 ReAct 循环及其工作原理?首先出现在《走向数据科学》上。

长上下文与短上下文模型:长上下文模型何时获胜?

Long Context vs. Short Context Model: When Does a Long Context Model Win?

平衡上下文能力与成本、速度和数据后篇《长上下文与短上下文模型:长上下文模型何时获胜?首先出现在《走向数据科学》上。

LLM Wiki 过度设计 - 我用纯 Python 编译器替换了我的

LLM Wikis Are Over-Engineered — I Replaced Mine With a Pure Python Compiler

大多数“LLM wiki”使用代理、嵌入和重复模型调用来组织本地注释。我构建了一个确定性的替代方案:一个纯 Python 编译器,仅使用标准库将杂乱的 Markdown 转换为链接的、经过 linted 的 wiki。在此过程中,我修复了两个真正的错误,在两个操作系统上对管道进行了基准测试,并展示了为什么编译器通常比代理更适合机械文本组织。LLM 维基百科过度设计——我用纯 Python 编译器替换了我的编译器首先出现在《走向数据科学》上。

RAG 检索的未受启发的教训:余弦不是基础

The Untaught Lessons of RAG Retrieval: Cosine Is Not the Foundation

企业文档智能 [Vol.1 #7ter] - 检索砖上的六个位置与主流 RAG 的余弦优先反射相矛盾The post The Untaught Lessons of RAG Retrieval: Cosine Is Not the Foundation 首先出现在 Towards Data Science 上。

Tokenminning:如何以更少的成本从聊天机器人中获得更多

Tokenminning: How to Get More from Your Chatbot for Less

Tokenmaxxing 已出炉。在不牺牲人工智能有效性的情况下降低成本的真实模式《Tokenminning:如何以更少的成本从聊天机器人中获得更多》一文首先出现在《走向数据科学》上。

设计循环,而不是提示

Design Loops, Not Prompts

但不要让模型自行检查“设计循环,而不是提示”帖子首先出现在《走向数据科学》上。