LLM关键词检索结果

在 Amazon ECS 和 Amazon Bedrock 上使用 LiteLLM 设置 OpenAI ChatGPT Codex

Set up OpenAI ChatGPT Codex with LiteLLM on Amazon ECS and Amazon Bedrock

使用 AWS Fargate 在 Amazon ECS 上部署客户操作的 LiteLLM 网关,将其连接到 Amazon Bedrock 上的 OpenAI 模型,并配置 Codex 通过网关的响应 API 使用范围内的身份、预算、速率限制和遥测来路由请求。我们还比较了直接 IAM Identity Center 访问和托管 Portkey 部署。

从 LLM 初学者到实践者的 5 门免费课程

5 Free Courses to Go From LLM Beginner to Practitioner

精心策划的线性高信号免费资源管道,可帮助您从反向传播基础知识到部署生产级 LLM 应用程序。

通过 DSpark 推测解码加速 LLM 推理

Speed Up LLM Inference with DSpark Speculative Decoding

了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。

量化和修剪方法让你的 LLM 更精简

Quantization and Pruning Methods to Make Your LLM Leaner

本文介绍了每种技术的实际用途,为什么跳过它们会花费真正的金钱和真正的延迟,然后实践人们目前在生产中运行的五种特定方法。

深入细节并建立新的本地LLM:周四MAMLMS

Going Deeply into the Weeds & Standing Up a New Local LLM: THURSDAY MAMLMS

餐桌下的LLM大比拼:开源权重alibaba/qwen3.8:27b的发布,以及在一台顶配M5 Max MacBook Pro上测试四个本地LLM……

LLM 定制服务的期望

What to Expect From LLM Customization Services

LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。

一年来 LLM 部署成本几乎增加了两倍

Стоимость развертывания LLM за год выросла почти втрое

MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。

LiteLLM 成为焦点:人工智能基础设施的供应链攻击

LiteLLM in the crosshairs: Supply Chain Attack on AI Infrastructure

LiteLLM 的用户可能已成为攻击者组织的目标。早在 3 月份,人们就知道“TeamPCP”组织已经成功获取了各个平台的机密信息,包括 Kubernetes 秘密、SSH 密钥、存储库凭证、AWS 等云平台以及 AI 环境的代币。有关谁受到影响以及攻击者能够窃取哪些数据的信息可以在在线数据库中查看。

中国LLM在俄罗斯的消费量增长了11倍以上

Потребление китайских LLM в России выросло более чем в 11 раз

MWS云分析了俄罗斯企业对中国大语言模型的消费情况。 2026年上半年的消费量比2025年全年高出11倍多。

通过减少 LLM 调用而不是购买更快的模型来降低企业 RAG 管道的延迟和成本

Cut an Enterprise RAG Pipeline’s Latency and Cost by Calling the LLM Less, Not by Buying a Faster Model

企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。

Harbor 寻求对抗普通 LLM FDE

Harbor Seeks To Counter General LLM FDEs

法律技术咨询公司 Harbor 推出了针对法律人工智能需求的“部署”,这将使他们“在客户内部嵌入包括前沿部署工程师 (FDE) 在内的专家团队”。他们...

使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 提供分层 KV 缓存

Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine

大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。

LLM 代理的语义知识图

Semantic Knowledge Graph for LLM Agents

为什么重要:了解 LLM 代理的语义知识图如何减少幻觉、增加记忆力并将测试中的答案准确性从 17% 提高到 54%。

DeepAmbigQA:用于 LLM 答案完整性基准测试的模糊多跳问题

DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...

Amazon SageMaker Python SDK 的 LLM 优化集成

LLM optimization integration for Amazon SageMaker Python SDK

Amazon SageMaker Python SDK v3 现在直接在您的笔记本中公开 Amazon SageMaker AI 中的生成式 AI 推理建议。对端点进行基准测试,生成数据驱动的部署建议,并部署推荐的配置,而无需离开笔记本工作流程。

Honest Abacus AI 评论:ChatLLM、DeepAgent、AI Studio 等

Honest Abacus AI Review: ChatLLM, DeepAgent, AI Studio & More

一体化 AI 引擎:Abacus AI 完整生态系统的全面回顾深入了解该平台如何将 100 多个 AI 模型、自主代理和完整的开发人员套件集成到为团队和高级用户提供的单一且经济高效的工作流程中。

减少 LLM 工作流程中推理延迟的 7 种方法

7 Approaches to Reduce Inference Latency in Your LLM Workflows

从量化到推测解码,这里有七种工程策略,可以在生产中交付更快、响应更灵敏的生成式 AI 应用程序。

在论文洪流中生存:ICRA 小组关于出版、法学硕士和同行评审的未来的笔记

Surviving the paper deluge: Notes from an ICRA panel on publishing, LLMs, and the future of peer review

ICRA 最近举行的题为“在论文洪流中幸存”的小组聚集了领先的机器人研究人员,他们一直在努力应对当今发表的大量机器人论文。讨论范围从出版物增长的硬数据、大型语言模型 (LLM) 的承诺和风险,到重塑同行评审的激进建议,因为我们 [...]