详细内容或原文请订阅后点击阅览
None
None
来源:BAIR图 1:CUDA 到 MLX 优化转换图。CUDA 优化知识可以转换为架构本机 MLX 策略,而不是复制指令到指令。
我们面临着计算的新纪元。硬件正在迅速变化——不仅仅是更快的 GPU,还有来自不同供应商的越来越多的芯片,每个芯片都有自己的架构,并且通常针对特定的人工智能工作负载进行定制。软件的变化同样快,人工智能编码工具现在只需几分钟即可生成几年前需要花费数月时间的工作。
现在,大量计算都以人工智能为中心,GPU 内核是其成功的关键组成部分。这些是在 GPU 内部运行的低级程序,编写高效的程序远非显而易见——需要多年的专业知识才能做到正确。将内核从一个供应商的硬件转移到另一个供应商的硬件更加困难,并且通常意味着从头开始重新发现相同的优化。例如,CUDA 生态系统积累了数十年来之不易的内核专业知识:手工调整的注意力实现、状态空间模型以及代表数千个工程小时的其他关键操作。较新的硬件生态系统(Apple Silicon、定制人工智能加速器等)正在快速发展,但缺乏这种深度。
在这项工作中,我们询问专业知识是否可以自动转移。我们建立在 K-Search 的基础上,K-Search 是由 Cao 等人引入的进化内核搜索框架。伯克利天空实验室使用人工智能来优化 GPU 内核,并通过 MLX 后端对其进行扩展——MLX 是苹果公司为其自己的 Apple Silicon 芯片设计的机器学习框架。我们开发了一种新颖的结构化 CUDA 到 MLX 转换层,让 K-Search 将现有 CUDA 内核作为知识库,并将其改编为 Apple Silicon 的高质量 GPU 内核,而不是从头开始重建。
为什么选择 MLX?
这个差距是本文其余部分的动力。
