人工智能开发人员是否应该从 Polars 转向 Pandas?

并非所有 Python 数据库都是一样的!这篇文章人工智能开发人员应该从 Polars 切换到 Pandas 吗?首先出现在《走向数据科学》上。

来源:走向数据科学

如果你使用 Python 进行数据分析(或处理任何形式的数据)甚至几周,你几乎肯定使用过 Pandas,或者至少听说过它。

十多年来,Pandas 一直是清理数据、探索数据集以及为机器学习算法准备所述数据的标准库。无论您是在大学课程、业余项目还是全职工作中这样做,Pandas 几乎已经成为 Python 数据分析的代名词。

但近年来,Pandas 的一个有竞争力的替代品已经出现,这个库的名字在教程、GitHub 项目和 AI 工作流程中越来越频繁。那个图书馆就是 Polars。

许多开发者都采用 Polars 作为比 Pandas 更快的选择。他们使用不同的基准来显示良好的速度提升,尤其是在处理大型数据集时。考虑到这个速度,您可能会想:如果 Polars 快得多,那为什么不是每个人都使用它呢?

当我们超越速度优势时,反应会更有趣。你看,Pandas 和 Polars 基于不同的理念,理解这些理念比根据基准数据做出决定更有价值。

因此,在本文中,我们将研究这两个库之间的差异,解释为什么 Polars 通常更快(此处的关键字:通常),并说明何时一个库是更好的选择。

为什么要创建 Polars?

2008 年 Pandas 首次推出时,计算机已经不同了;大多数个人计算机只有少量的 CPU 核心,数据集要小得多,内存通常是限制因素。

因此,Pandas 的设计考虑到了这些现实。该 API 注重简单性和可读性,允许用户在处理表格数据时执行直观的操作。然而,当数据集大小达到数百万行时,Pandas 的一些原始设计选择就成为了其局限性。

乍一看,它们看起来很相似

熊猫

极坐标