Set up OpenAI ChatGPT Codex with LiteLLM on Amazon ECS and Amazon Bedrock
使用 AWS Fargate 在 Amazon ECS 上部署客户操作的 LiteLLM 网关,将其连接到 Amazon Bedrock 上的 OpenAI 模型,并配置 Codex 通过网关的响应 API 使用范围内的身份、预算、速率限制和遥测来路由请求。我们还比较了直接 IAM Identity Center 访问和托管 Portkey 部署。
5 Free Courses to Go From LLM Beginner to Practitioner
精心策划的线性高信号免费资源管道,可帮助您从反向传播基础知识到部署生产级 LLM 应用程序。
Speed Up LLM Inference with DSpark Speculative Decoding
了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。
Quantization and Pruning Methods to Make Your LLM Leaner
本文介绍了每种技术的实际用途,为什么跳过它们会花费真正的金钱和真正的延迟,然后实践人们目前在生产中运行的五种特定方法。
Going Deeply into the Weeds & Standing Up a New Local LLM: THURSDAY MAMLMS
餐桌下的LLM大比拼:开源权重alibaba/qwen3.8:27b的发布,以及在一台顶配M5 Max MacBook Pro上测试四个本地LLM……
What to Expect From LLM Customization Services
LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。
Стоимость развертывания LLM за год выросла почти втрое
MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。
LiteLLM in the crosshairs: Supply Chain Attack on AI Infrastructure
LiteLLM 的用户可能已成为攻击者组织的目标。早在 3 月份,人们就知道“TeamPCP”组织已经成功获取了各个平台的机密信息,包括 Kubernetes 秘密、SSH 密钥、存储库凭证、AWS 等云平台以及 AI 环境的代币。有关谁受到影响以及攻击者能够窃取哪些数据的信息可以在在线数据库中查看。
Потребление китайских LLM в России выросло более чем в 11 раз
MWS云分析了俄罗斯企业对中国大语言模型的消费情况。 2026年上半年的消费量比2025年全年高出11倍多。
企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。
Harbor Seeks To Counter General LLM FDEs
法律技术咨询公司 Harbor 推出了针对法律人工智能需求的“部署”,这将使他们“在客户内部嵌入包括前沿部署工程师 (FDE) 在内的专家团队”。他们...
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。
Semantic Knowledge Graph for LLM Agents
为什么重要:了解 LLM 代理的语义知识图如何减少幻觉、增加记忆力并将测试中的答案准确性从 17% 提高到 54%。
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...
LLM optimization integration for Amazon SageMaker Python SDK
Amazon SageMaker Python SDK v3 现在直接在您的笔记本中公开 Amazon SageMaker AI 中的生成式 AI 推理建议。对端点进行基准测试,生成数据驱动的部署建议,并部署推荐的配置,而无需离开笔记本工作流程。
Honest Abacus AI Review: ChatLLM, DeepAgent, AI Studio & More
一体化 AI 引擎:Abacus AI 完整生态系统的全面回顾深入了解该平台如何将 100 多个 AI 模型、自主代理和完整的开发人员套件集成到为团队和高级用户提供的单一且经济高效的工作流程中。
7 Approaches to Reduce Inference Latency in Your LLM Workflows
从量化到推测解码,这里有七种工程策略,可以在生产中交付更快、响应更灵敏的生成式 AI 应用程序。
ICRA 最近举行的题为“在论文洪流中幸存”的小组聚集了领先的机器人研究人员,他们一直在努力应对当今发表的大量机器人论文。讨论范围从出版物增长的硬数据、大型语言模型 (LLM) 的承诺和风险,到重塑同行评审的激进建议,因为我们 [...]