走向数据科学领域信息情报检索

在数据科学领域分享概念、思想和代码。Towards Data Science Inc.是一家在加拿大注册的公司。它为成千上万的人提供了一个交流思想、扩展对数据科学理解的平台。

通过 ML 主动学习减少人工注释

Reducing Human Annotation with ML Active Learning

在人类时间昂贵的世界中,仅在真正必要时才学习如何使用它《使用 ML 主动学习减少人类注释》一文首先出现在《走向数据科学》上。

我如何在 16GB MacBook 上重现 BM25、密集检索和 SPLADE

How I Reproduced BM25, Dense Retrieval, and SPLADE on a 16GB MacBook

三个检索基线的实际再现,包括对 RAG 系统重要的崩溃、修复和分数检查。我如何在 16GB MacBook 上再现 BM25、密集检索和 SPLADE 帖子首先出现在 Towards Data Science 上。

如何高效提示 Claude 代码

How to Efficiently Prompt Claude Code

使用 Claude Code 最大化您的效率如何有效提示 Claude Code 的帖子首先出现在《走向数据科学》上。

当 RAM 太昂贵时如何优化矢量搜索:磁盘上 ANN 索引与内存中 ANN 索引

How to Optimize Vector Search When RAM Gets Too Expensive: On-Disk vs. In-Memory ANN Indexes

通过权衡 HNSW、SPANN 和 DiskANN 的延迟和存储来构建经济高效的基础架构这篇文章《当 RAM 变得太昂贵时如何优化矢量搜索:磁盘上与内存中 ANN 索引》首先出现在《走向数据科学》上。

无法求解流体方程的流体模拟器

The Fluid Simulator That Doesn’t Solve the Fluid Equations

我在没有求解单个流体方程的情况下生成了卡门涡街。以下是格子玻尔兹曼方法如何实现这一目标,它源自第一原理,用 C++ 实现,并在超级计算机上运行。 文章《无法求解流体方程的流体模拟器》首先出现在《走向数据科学》上。

表格法学硕士:预测电子表格的基础模型简介

Tabular LLMs: An Introduction to the Foundation Models That Predict Your Spreadsheet

表格基础模型可以预测任何电子表格零样本中缺失的列,就像法学硕士完成文本的方式一样 - 在 TabArena 基准测试中,它们现在位于完全调整的梯度增强树之上。介绍了它们的工作原理、最强开放模型的独立复制,以及 XGBoost 仍然获胜的地图。后表格式法学硕士:预测电子表格的基础模型简介首先出现在《走向数据科学》上。

上下文窗口忘记了重要的事情 - 我为 AI 代理内存构建了一个使用强化的衰减引擎

Context Windows Forget What Matters — I Built a Usage-Reinforced Decay Engine for AI Agent Memory

大多数人工智能记忆系统保存的是最新信息,而不是最重要的信息。以下是我如何使用艾宾浩斯遗忘曲线为法学硕士构建更好的内存引擎。后文“上下文 Windows 忘记重要的事情——我为 AI 代理内存构建了一个使用强化的衰减引擎”首先出现在《走向数据科学》上。

当数据科学让我们悲伤时:航班超售的故事

When Data Science Makes Us Sad: The Story of an Overbooked Flight

800 万美元 vs 5000 美元 + 可能会迅速走红这篇文章《当数据科学让我们悲伤:航班超售的故事》首先出现在《走向数据科学》上。

8.5 年 ML 经验教训

Lessons Learned After 8.5 Years of ML

耐心、乐观、纪律、项目、团队机器学习 8.5 年的经验教训首先出现在《迈向数据科学》上。

为什么添加更多 AI 代理会使我们的系统变慢

Why Adding More AI Agents Made Our System Slower

异步系统的隐性成本,在扩展数百个 LLM 代理时,微小的 CPU 任务如何悄然成为我们最大的瓶颈。为什么添加更多 AI 代理使我们的系统变慢的帖子首先出现在《走向数据科学》上。

RAG 生成的循环工程:一次迭代 top-k

Loop Engineering for RAG Generation: Iterate top-k One at a Time

企业文档智能 [Vol.1 #8bis] - 将检索到的候选发送到生成砖的两种机制、在它们之间进行选择的充分性信号以及使其廉价的每个问题类型调度 RAG 生成的后循环工程:一次迭代 top-k 一个首先出现在《走向数据科学》上。

如何从头开始构建您自己的 LLM 运行时

How To Build Your Own LLM Runtime From Scratch

如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。

构建可以编写和运行代码的 LLM 代理

Build an LLM Agent That Can Write and Run Code

使用 OpenAI Agents SDK 和 Docker 执行代码的实践演练《构建可以编写和运行代码的 LLM 代理》一文首先出现在《走向数据科学》上。

使用 SkillSpector 检测代理技能中的漏洞:从绿色复选标记到真正的安全判断

Detecting Vulnerabilities in Agent Skills with SkillSpector: From Green Checkmark to Real Security Judgment

静态分析确定了恶意技能并过度标记了有用的技能。这些结果之间的差距正是人类判断真正发挥作用的地方。使用 SkillSpector 检测代理技能中的漏洞:从绿色复选标记到真正的安全判断首先出现在《走向数据科学》上。

提示工程还不够:情境工程的四块砖如何阻止 RAG 幻觉

Prompt Engineering Isn’t Enough: How Four Bricks of Context Engineering Stop RAG Hallucinations

企业文档智能 [Vol.1 #9bis] - 您的 RAG 不是幻觉,它忠实地回答了错误的上下文。在真实的 NIST 和世界银行文件中,观察四块砖块中的每一块都破裂了,以及关闭它的合同。后提示工程还不够:背景工程的四块砖块如何阻止 RAG 幻觉首先出现在《走向数据科学》上。

我尝试在 Colab 上微调机器人 AI 模型。这是有效的

I Tried Fine-Tuning a Robot AI Model on Colab. Here Is What Worked

针对 OpenVLA 的可重复 100 步 LoRA 微调运行,包括数据集检查、Colab 设置、训练指标和 W&B 证据。我在 Colab 上尝试微调机器人 AI 模型的帖子。这是有效的方法首先出现在《走向数据科学》上。

如今,有多少数据科学工作流程可以在 GPU 上运行?第 1 部分:加速数据准备

How Much of a Data Science Workflow Can Run on a GPU Today? Part 1: Accelerating Data Preparation

使用 cuDF、cudf.pandas 和 Polars GPU 引擎探索 GPU 加速文章当今有多少数据科学工作流程可以在 GPU 上运行?第 1 部分:加速数据准备首先出现在《迈向数据科学》上。

您的 ML 实验一团糟吗?这是修复方法

Are Your ML Experiments a Mess? Here’s the Fix

使用 ML Flow 跟踪实验、记录模型和重现结果的实践指南。帖子您的 ML 实验一团糟吗?这是首先出现在《走向数据科学》上的修复方法。