Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。
Accessing OpenAI models on Amazon Bedrock from Australia with global cross-Region inference
澳大利亚团队现在可以访问 Amazon Bedrock 上的 OpenAI GPT-5.6 Sol、Terra 和 Luna 模型,并通过亚太地区(悉尼)和亚太地区(墨尔本)进行全球跨区域推理。本文展示了如何调用模型、使用提示缓存、使用 OpenID Connect 身份验证设置 Codex 以及使用 Amazon CloudWatch 监控使用情况。
FAQ as RAG: When You Get to Design the Corpus
企业文档智能 [Vol.1 #B2] - 常见问题解答颠倒了标准 RAG 管道的每一块砖。解析是微不足道的,检索兼作缓存,并且几次提示也成为检索问题作为 RAG 的常见问题解答:当您开始设计语料库时,首先出现在走向数据科学上。
Can an LLM Forget the Right Things?
大多数 LLM 推理运行时不知道存在物理截止日期。这个拒绝入场而不是错过 33 毫秒的机器人控制周期,通过意义而不是年龄驱逐 KV 缓存,并且完全用手写 CUDA 编写 - 没有 cuBLAS,没有 libtorch。 帖子 Can an LLM Forget the Right Things? 帖子 Can an LLM Forget the Right Things?首先出现在《走向数据科学》上。
Latest Pentagon UFO files release includes video of mysterious ‘cold orbs’
这个新的材料缓存包括 2021 年阿曼湾演习期间记录的美国军用飞机红外显示的镜头
Beyond RAG: Task-aware knowledge compression for enterprise AI on AWS
传统 RAG 在跨越数百个文档的分析任务上遇到了上限。本文展示了如何使用 AWS 上的任务感知知识压缩 (TAKC) 将整个知识库预先压缩为特定于任务的表示形式,将它们缓存在多个保真度层,并将每个查询路由到正确的层,并使用您可以部署的开源实现。