详细内容或原文请订阅后点击阅览
停止速率限制请求。开始调度令牌:DataRobot TokenGrid 简介
作者:Sudeeptha Jothiprakash、Venkat Bala、Tushar Pandey、Romi Datta 现代 AI 堆栈的真正瓶颈企业 IT 存在一个奇怪的问题:代币支出和第三方模型订阅成本不断攀升,而运行这些工作负载的 GPU 集群的利用率仅为 20%。这种差距归结为一件事:管理访问的工具......后停止速率限制请求。开始调度令牌:DataRobot 简介 TokenGrid 首先出现在 DataRobot 上。
来源:DataRobot博客作者:Sudeeptha Jothiprakash、Venkat Bala、Tushar Pandey、Romi Datta
现代人工智能堆栈的真正瓶颈
企业 IT 面临一个奇怪的问题:代币支出和第三方模型订阅成本不断攀升,而运行这些工作负载的 GPU 集群的利用率仅为 20%。这种差距归结为一件事:管理访问的工具从来都不是为了查看工作负载本身而构建的。
传统应用程序编排器、Kubernetes 框架和 API 网关(如 Tyk 或 Envoy)管理静态硬件:CPU、GPU 数量、内存、网络流量。他们无法了解令牌计数、提示长度或实际驱动 LLM 推理成本的 KV 缓存压力,并且该盲点会影响 AI 堆栈的两侧。它无法优化自托管 GPU 基础设施,也无法管理第三方模型 API 的配额、速率限制或成本。
如今,为了管理访问,平台团队依赖于 LiteLLM 等无状态代理:静态配置映射、硬编码带宽规则和基于计数的速率限制,例如每分钟 100 个请求的固定上限。这对于简单的流量来说效果很好。它在多轮生成人工智能和代理系统中很快就会崩溃。如果两个请求的元数据匹配,令牌盲网关会将两个请求视为相同,即使一个请求是 10 个令牌查询,另一个请求传递一个 200K 令牌上下文文件。集群内的实际成本相差几个数量级。如果没有办法隔离这些工作负载,200K 令牌请求会锁定模型服务器的 KV 缓存,增加该硬件上每个其他租户的 P95 尾部延迟,并可能导致整个集群出现故障,从而在不相关的关键任务应用程序中触发一波 429 拒绝。无论哪种方式,网关都会承认这一点:单个恶意用户或不受管理的代理循环可能会触发不受控制的激增,从而使其他所有人的模型带宽饱和,因为网关从来不是为了寻找它而构建的。
平台团队在三个地方遇到了这种摩擦。
