边缘 AI 的训练后量化

为什么重要:边缘 AI 的训练后量化:INT8 和 INT4 如何将模型缩小 4-16 倍、精度成本如何,以及如何使用 GPTQ、AWQ 和 GGUF 快速部署。

来源:人工智能+

简介

边缘人工智能的训练后量化已成为最近设备智能浪潮背后的安静引擎。它缩小了大型神经网络,使它们可以在手机、传感器和廉价主板上运行,而无需数据中心支持。将模型从 16 位浮点数压缩为 4 位整数可以将其大小缩小四到十六倍。这种减少直接映射到更少的内存、更低的功耗以及在受限硬件上更快的本地响应。小语言模型现在可以在完全离线运行的情况下提供大约 80% 到 90% 的大型模型功能,这是对设备上 LLM 的系统评估中提出的观点。团队之所以采用这种技术,是因为从头开始重新训练模型既昂贵又缓慢,而且通常是不必要的。相反,量化会重用已经训练过的网络,并将其数字舍入为较小的格式。本指南解释了该方法的工作原理、其精度成本以及如何将其交付到生产中。

关于边缘 AI 训练后量化的快速解答

什么是边缘 AI 的训练后量化?

它是一种压缩方法,可将经过训练的模型的权重转换为较低精度的整数,例如 INT8 或 INT4,因此它可以在小型边缘设备上运行而无需重新训练。

它会损失多少准确度?

精心调整的 INT8 量化损失通常低于 1%,而当 GPTQ 或 AWQ 等方法保护敏感权重时,INT4 可以保持 98% 以上的准确度。

是否需要 GPU 或重新训练?

不需要。它只需要一个小的校准数据集和几分钟的计算,这就是边缘团队快速将模型发送到消费类硬件的原因。

要点

  • 训练后量化将训练后的模型压缩为整数格式,无需重新训练,从而使设备上部署快速且经济实惠。
  • INT8 的准确度通常低于百分之一,而激进的 INT4 需要智能方法才能保持可用。
  • 校准数据质量和激活异常值决定量化模型是成功还是崩溃。
  • 目录

    设备上的模型尺寸

    50%