详细内容或原文请订阅后点击阅览
如今,有多少数据科学工作流程可以在 GPU 上运行?第 1 部分:加速数据准备
使用 cuDF、cudf.pandas 和 Polars GPU 引擎探索 GPU 加速文章当今有多少数据科学工作流程可以在 GPU 上运行?第 1 部分:加速数据准备首先出现在《迈向数据科学》上。
来源:走向数据科学花费大量时间处理表格数据。传统上,这些工作负载在 CPU 上运行,这通常就足够了,直到昂贵的操作成为瓶颈。与此同时,围绕 GPU 的大部分讨论都集中在深度学习和大型语言模型上。然而,如今,Python 数据科学堆栈的大部分都可以使用 GPU 加速,从而允许许多现有的表格数据工作流在 GPU 上运行,而无需更改或很少更改代码。
许多围绕 GPU 的讨论都集中在深度学习和大型语言模型上。然而,许多数据科学家仍然将大部分时间花在处理表格数据上,其中大部分工作负载传统上都在 CPU 上运行。这通常没问题,直到昂贵的操作成为瓶颈。下图以一种轻松的方式体现了这一点。
如今,Python 数据科学堆栈的大部分都提供了 GPU 支持,这使得数据科学家能够在很少或无需更改代码的情况下加速许多现有工作流程。这减少了等待昂贵操作完成所花费的时间,从而有更多时间专注于解决实际问题。
我决定一次一步地浏览典型的机器学习管道,看看现在可以在哪些地方使用 GPU 加速以及它的实用性如何。在本系列中,我将一步一步地介绍典型的机器学习管道,了解目前哪些地方可以使用 GPU 加速、需要更改多少代码以及何时 CPU 仍然是更好的选择。
我们将从表格数据处理和数据准备任务开始,它们是许多日常数据科学工作流程的一部分。
数据集和代码
为了保持示例的重点,我省略了一些样板代码并缩短了一些片段。完整的代码可以在这里找到。
在 GPU 上加速 Pandas 工作流程
如果您的数据处理管道是使用 pandas 构建的,则有两种简单的方法可以在 GPU 上运行它:
安装
!nvidia-smi
