LLM关键词检索结果

LLM 定制服务的期望

What to Expect From LLM Customization Services

LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。

一年来 LLM 部署成本几乎增加了两倍

Стоимость развертывания LLM за год выросла почти втрое

MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。

LiteLLM 成为焦点:人工智能基础设施的供应链攻击

LiteLLM in the crosshairs: Supply Chain Attack on AI Infrastructure

LiteLLM 的用户可能已成为攻击者组织的目标。早在 3 月份,人们就知道“TeamPCP”组织已经成功获取了各个平台的机密信息,包括 Kubernetes 秘密、SSH 密钥、存储库凭证、AWS 等云平台以及 AI 环境的代币。有关谁受到影响以及攻击者能够窃取哪些数据的信息可以在在线数据库中查看。

中国LLM在俄罗斯的消费量增长了11倍以上

Потребление китайских LLM в России выросло более чем в 11 раз

MWS云分析了俄罗斯企业对中国大语言模型的消费情况。 2026年上半年的消费量比2025年全年高出11倍多。

通过减少 LLM 调用而不是购买更快的模型来降低企业 RAG 管道的延迟和成本

Cut an Enterprise RAG Pipeline’s Latency and Cost by Calling the LLM Less, Not by Buying a Faster Model

企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。

Harbor 寻求对抗普通 LLM FDE

Harbor Seeks To Counter General LLM FDEs

法律技术咨询公司 Harbor 推出了针对法律人工智能需求的“部署”,这将使他们“在客户内部嵌入包括前沿部署工程师 (FDE) 在内的专家团队”。他们...

使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 提供分层 KV 缓存

Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine

大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。

LLM 代理的语义知识图

Semantic Knowledge Graph for LLM Agents

为什么重要:了解 LLM 代理的语义知识图如何减少幻觉、增加记忆力并将测试中的答案准确性从 17% 提高到 54%。

DeepAmbigQA:用于 LLM 答案完整性基准测试的模糊多跳问题

DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...

Amazon SageMaker Python SDK 的 LLM 优化集成

LLM optimization integration for Amazon SageMaker Python SDK

Amazon SageMaker Python SDK v3 现在直接在您的笔记本中公开 Amazon SageMaker AI 中的生成式 AI 推理建议。对端点进行基准测试,生成数据驱动的部署建议,并部署推荐的配置,而无需离开笔记本工作流程。

Honest Abacus AI 评论:ChatLLM、DeepAgent、AI Studio 等

Honest Abacus AI Review: ChatLLM, DeepAgent, AI Studio & More

一体化 AI 引擎:Abacus AI 完整生态系统的全面回顾深入了解该平台如何将 100 多个 AI 模型、自主代理和完整的开发人员套件集成到为团队和高级用户提供的单一且经济高效的工作流程中。

减少 LLM 工作流程中推理延迟的 7 种方法

7 Approaches to Reduce Inference Latency in Your LLM Workflows

从量化到推测解码,这里有七种工程策略,可以在生产中交付更快、响应更灵敏的生成式 AI 应用程序。

构建可以编写和运行代码的 LLM 代理

Build an LLM Agent That Can Write and Run Code

使用 OpenAI Agents SDK 和 Docker 执行代码的实践演练《构建可以编写和运行代码的 LLM 代理》一文首先出现在《走向数据科学》上。

如何从头开始构建您自己的 LLM 运行时

How To Build Your Own LLM Runtime From Scratch

如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。

使用自适应解析进行循环工程:使用 Azure 解析平面表格,使用 Vision LLM 解析图形

Loop Engineering with Adaptive Parsing in Action: Parsing Flat Tables with Azure and Figures with a Vision LLM

企业文档智能 [Vol.1 #10B] - LLM 作为最后一道防线,然后两个真正的升级从头到尾进行:从平面表到 Azure,从图形到视觉模型后循环工程与自适应解析的实际应用:使用 Azure 解析平面表和带有愿景的图形 LLM 首先出现在《走向数据科学》上。

LLM 函数调用的不确定性量化

Uncertainty Quantification for LLM Function-Calling

大型语言模型 (LLM) 越来越多地用于自主解决现实世界的任务。其中一个关键要素是法学硕士函数调用范式,这是一种广泛使用的方法,为法学硕士配备工具使用功能。然而,LLM 错误地调用函数可能会产生严重影响,特别是当其影响不可逆转时,例如转账或删除数据。因此,在执行函数调用之前,考虑法学硕士对函数调用正确解决任务的信心至关重要。不确定性量化(UQ)方法可用于量化……

认识 GPT-Red:LLM 超级黑客 OpenAI 旨在使其模型更安全

Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

OpenAI 构建了一个名为 GPT-Red 的 LLM 超级黑客,将其用作陪练伙伴,帮助其其他模型增强对网络攻击的防御能力。上周该公司发布了其旗舰 LLM 的最新版本 GPT-5.6。 OpenAI 表示,针对 GPT-Red 进行训练使该模型成为迄今为止最强大的版本。 GPT-Red 自动化...

检查法学硕士中的类人行为:模型行为、用户因素和系统提示的多维分析

Examining Human-Like Behaviors in LLMs: A Multi-Dimensional Analysis of Model Behaviors, User Factors, and System Prompts

大型语言模型 (LLM) 表现出广泛的类人行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管法学硕士很普遍,但研究人员和从业者缺乏方法和经验见解来就法学硕士应该表现出何时以及何种类型的类人行为做出明智的决定。为了填补这一空白,我们使用法学硕士作为法官和人类评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。超过 21,000 个……