TurboQuant:压缩和性能值得大肆宣传吗?

如何在不损失准确性的情况下提高效率?它真的值得炒作吗?

来源:KDnuggets

简介

TurboQuant 是 Google 最近推出的一个新颖的算法套件和库。其目标是将先进的量化和压缩应用于大型语言模型 (LLM) 和矢量搜索引擎(检索增强生成 (RAG) 系统不可或缺的元素),以大幅提高其效率。 TurboQuant 已被证明可以成功地将缓存内存消耗降低至仅 3 位,而不需要模型重新训练或牺牲准确性。

它是如何做到这一点的?它真的值得大肆宣传吗?本文旨在通过其使用的描述和实际示例来回答这些问题。

TurboQuant 简介

虽然法学硕士和矢量搜索引擎使用高维矢量来处理信息并取得令人印象深刻的结果,但这种工作需要大量内存,可能会导致所谓的键值 (KV) 缓存(一种快速访问的“数字备忘单”,其中包含用于实时检索的常用信息)的主要瓶颈。管理更大的上下文长度会以线性方式扩展 KV 缓存访问,这严重限制了内存容量和计算速度。

近年来使用的矢量量化(VQ)技术有助于减小文本矢量的大小以消除瓶颈,但它们通常会引入额外的“内存开销”,并且需要在小数据块上计算全精度量化常数,从而在一定程度上破坏了压缩的原因。

TurboQuant 是一组用于高级压缩且精度为零的下一代算法。它通过采用两阶段过程并辅以两种相辅相成的技术,以最佳方式解决内存开销问题:

  • PolarQuant:这是第一阶段应用的压缩技术。它通过将矢量坐标映射到极坐标系来压缩高质量数据。这简化了数据几何结构,并消除了存储额外量化常数的需要——这是内存开销背后的主要原因。
  • 评估 TurboQuant