走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

时间序列法学硕士,用 t0-alpha 解释

Time-Series LLMs, Explained with t0-alpha

t0-alpha 是用于概率时间序列预测的解码器式补丁转换器。原始序列被分成 32 步补丁,嵌入,通过因果时间注意力和群体注意力层进行处理,并解码为未来分位数而不是单点预测。后时间序列法学硕士,用 t0-alpha 解释首先出现在《走向数据科学》上。

RAG 问题解析的未受教导的教训:搜索之前的结构

The Untaught Lessons of RAG Question Parsing: Structure Before You Search

企业文档智能 [Vol.1 #6ter] - 问题解析砖上的六个位置与主流 RAG 手册相矛盾The Untaught Lessons of RAG Question Parsing: Structure Before You Search 首先出现在 Towards Data Science 上。

为什么强大的机器学习看似简单 — 第 2 部分

Why Powerful ML Is Deceptively Easy — Part 2

下一个泄漏问题不仅仅是暂时的。它与空间、结构和覆盖范围相关。使用 DALL·E 创建的 AI 生成插图《为什么强大的 ML 看似简单 — 第 2 部分》首先出现在《走向数据科学》上。

在数据科学行为面试中生存

Surviving the Data Science Behavioral Interview

在人工智能时代,脱颖而出比以往任何时候都意义重大。这里有三个技巧,可以让你自信地参加下一次面试。《在数据科学行为面试中生存》一文首先出现在《走向数据科学》上。

如何最大化 Codex Exec 命令

How to Maximize Codex Exec Command

使用模型集合构建更强大的编码代理设置如何最大化 Codex Exec Command 帖子首先出现在 Towards Data Science 上。

经典NLP还能走多远?从词袋到令人毛骨悚然的作者识别堆叠

How Far Can Classical NLP Go? From Bag-of-Words to Stacking on Spooky Author Identification

关于 Kaggle 的 Spooky 作者识别任务的端到端经典 NLP 实验:从 Vowpal Wabbit 和 TF-IDF/NB-SVM 基线到调整后的堆叠集成,对 Bag-of-Words、BM25、Word2Vec 和 FastText 进行紧凑表示调查以获取上下文。经典 NLP 能走多远? 《从词袋到怪异作者识别的堆叠》首先出现在《走向数据科学》上。

我完成了五年的分析咨询工作:改变我工作方式的 5 堂课

I Completed Five Years in Analytics Consulting: 5 Lessons That Changed How I Work

我用于分析和报告的工具的变化超出了我的预期,但我对任何分析项目的问题都没有太大变化。我在分析咨询中完成的五年:改变我工作方式的 5 堂课首先出现在走向数据科学上。

如何选择小型机型和前沿机型

How to Choose Between Small and Frontier Models

小语言模型的兴起《如何在小型模型和前沿模型之间进行选择》一文首先出现在《走向数据科学》上。

我在 358 场比赛中对比了 XGBoost 和逻辑回归。无聊的模型赢了。

I Pitted XGBoost Against Logistic Regression on 358 Matches. The Boring Model Won.

具体的偏差-方差课程:为什么最小的模型具有最佳的交叉验证拟合,以及如何知道何时伸手去拿大锤子。我在 358 场比赛中对比 XGBoost 与 Logistic 回归的文章。无聊的模型赢了。首先出现在《走向数据科学》上。

我们构建了路由层来降低 AI 成本。它破坏了产品。

We Built a Routing Layer to Cut Our AI Costs. It Broke the Product.

一个团队将 AI 推理费用削减了一半以上。三个月后,客户满意度下降,成本节省与质量损失联系在一起。成本优化路由层是一个帕累托陷阱,这里的检测方法可以在几天而不是几个月内捕获它们。我们构建路由层来降低人工智能成本的帖子。它破坏了产品。首先出现在《走向数据科学》上。

如何建立强大的法学硕士知识库

How to Build a Powerful LLM Knowledge Base

使用编码代理为您的知识库提供支持如何构建强大的法学硕士知识库帖子首先出现在走向数据科学上。

从本地法学硕士到工具使用代理

From Local LLM to Tool-Using Agent

使用 Gemma 4、Ollama、OpenAI Agents SDK 和 Tavily MCP 构建轻量级研究代理从本地 LLM 到工具使用代理的帖子首先出现在 Towards Data Science 上。

饮水机闲聊,第一集。 11:RAG评估中的过度拟合

Water Cooler Small Talk, Ep. 11: Overfitting in RAG evaluation

为什么为考试而记忆并不意味着你理解了该主题The post Water Cooler Small Talk, Ep. 11:RAG 评估中的过度拟合首先出现在 Towards Data Science 上。

Vector RAG 还不够 - 我为多代理内存构建了上下文图形层

Vector RAG Isn’t Enough — I Built a Context Graph Layer for Multi-Agent Memory

我在相同的多代理对话上对原始聊天历史记录、纯矢量 RAG 和上下文图进行了基准测试。结果暴露了关系检索中的一个令人惊讶的弱点。Vector RAG isn't Enough — I Building a Context Graph Layer for Multi-Agent Memory 首先出现在 Towards Data Science 上。

超越直线:在 OLS、交互项和 Tweedie 回归之间进行选择

Beyond the Straight Line: Choosing Between OLS, Interaction Terms, and Tweedie Regression

您是否应该坚持经典的普通最小二乘回归、引入交互项或转向 Tweedie 分布,完全取决于您的数据如何处理零和极端异常值的混乱现实。文章《超越直线:在 OLS、交互项和 Tweedie 回归之间进行选择》首先出现在《走向数据科学》上。

3 名特工。 3 名法学硕士。 1 老化的 GPU:裸机上的工程并行推理

3 Agents. 3 LLMs. 1 Aging GPU: Engineering Parallel Inference on Bare Metal

突破 8GB VRAM 限制。了解如何使用 C++ 层复用和准入控制在单个 8GB GPU 上运行三个不同的 LLM。后 3 个代理。 3 名法学硕士。 1 老化 GPU:裸机上的工程并行推理首先出现在《走向数据科学》上。

公开学习数据工程一个月:这是我没有写的内容

One Month Into Learning Data Engineering in Public: Here’s What I Didn’t Write About

对公开学习数据工程第一个月的反思,以及真正让我坚持下去的原因。《公开学习数据工程一个月:这是我没有写的内容》一文首先出现在《走向数据科学》上。

如何从逻辑回归模型构建信用评分网格

How to Build a Credit Scoring Grid From a Logistic Regression Model

将模型系数转换为 0-1000 分,并进行风险类别和稳定性检查如何从 Logistic 回归模型构建信用评分网格一文首先出现在 Towards Data Science 上。