LLM关键词检索结果

深入细节并建立新的本地LLM:周四MAMLMS

Going Deeply into the Weeds & Standing Up a New Local LLM: THURSDAY MAMLMS

餐桌下的LLM大比拼:开源权重alibaba/qwen3.8:27b的发布,以及在一台顶配M5 Max MacBook Pro上测试四个本地LLM……

LLM 定制服务的期望

What to Expect From LLM Customization Services

LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。

一年来 LLM 部署成本几乎增加了两倍

Стоимость развертывания LLM за год выросла почти втрое

MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。

LiteLLM 成为焦点:人工智能基础设施的供应链攻击

LiteLLM in the crosshairs: Supply Chain Attack on AI Infrastructure

LiteLLM 的用户可能已成为攻击者组织的目标。早在 3 月份,人们就知道“TeamPCP”组织已经成功获取了各个平台的机密信息,包括 Kubernetes 秘密、SSH 密钥、存储库凭证、AWS 等云平台以及 AI 环境的代币。有关谁受到影响以及攻击者能够窃取哪些数据的信息可以在在线数据库中查看。

中国LLM在俄罗斯的消费量增长了11倍以上

Потребление китайских LLM в России выросло более чем в 11 раз

MWS云分析了俄罗斯企业对中国大语言模型的消费情况。 2026年上半年的消费量比2025年全年高出11倍多。

通过减少 LLM 调用而不是购买更快的模型来降低企业 RAG 管道的延迟和成本

Cut an Enterprise RAG Pipeline’s Latency and Cost by Calling the LLM Less, Not by Buying a Faster Model

企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。

Harbor 寻求对抗普通 LLM FDE

Harbor Seeks To Counter General LLM FDEs

法律技术咨询公司 Harbor 推出了针对法律人工智能需求的“部署”,这将使他们“在客户内部嵌入包括前沿部署工程师 (FDE) 在内的专家团队”。他们...

使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 提供分层 KV 缓存

Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine

大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。

LLM 代理的语义知识图

Semantic Knowledge Graph for LLM Agents

为什么重要:了解 LLM 代理的语义知识图如何减少幻觉、增加记忆力并将测试中的答案准确性从 17% 提高到 54%。

DeepAmbigQA:用于 LLM 答案完整性基准测试的模糊多跳问题

DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...

Amazon SageMaker Python SDK 的 LLM 优化集成

LLM optimization integration for Amazon SageMaker Python SDK

Amazon SageMaker Python SDK v3 现在直接在您的笔记本中公开 Amazon SageMaker AI 中的生成式 AI 推理建议。对端点进行基准测试,生成数据驱动的部署建议,并部署推荐的配置,而无需离开笔记本工作流程。

Honest Abacus AI 评论:ChatLLM、DeepAgent、AI Studio 等

Honest Abacus AI Review: ChatLLM, DeepAgent, AI Studio & More

一体化 AI 引擎:Abacus AI 完整生态系统的全面回顾深入了解该平台如何将 100 多个 AI 模型、自主代理和完整的开发人员套件集成到为团队和高级用户提供的单一且经济高效的工作流程中。

减少 LLM 工作流程中推理延迟的 7 种方法

7 Approaches to Reduce Inference Latency in Your LLM Workflows

从量化到推测解码,这里有七种工程策略,可以在生产中交付更快、响应更灵敏的生成式 AI 应用程序。

构建可以编写和运行代码的 LLM 代理

Build an LLM Agent That Can Write and Run Code

使用 OpenAI Agents SDK 和 Docker 执行代码的实践演练《构建可以编写和运行代码的 LLM 代理》一文首先出现在《走向数据科学》上。

如何从头开始构建您自己的 LLM 运行时

How To Build Your Own LLM Runtime From Scratch

如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。

使用自适应解析进行循环工程:使用 Azure 解析平面表格,使用 Vision LLM 解析图形

Loop Engineering with Adaptive Parsing in Action: Parsing Flat Tables with Azure and Figures with a Vision LLM

企业文档智能 [Vol.1 #10B] - LLM 作为最后一道防线,然后两个真正的升级从头到尾进行:从平面表到 Azure,从图形到视觉模型后循环工程与自适应解析的实际应用:使用 Azure 解析平面表和带有愿景的图形 LLM 首先出现在《走向数据科学》上。

GARY MARCUS:Anthropic在盈利吗?盈利多少?

(VERY PARTIAL-)CROSSPOST: GARY MARCUS: Is Anthropic Making Money? How Much Money?

没有人应该通过销售LLM服务而变得超级富有:Anthropic的IPO与“航空场景”;问题在于,当年我对谷歌和Facebook也是同样的看空态度,而我大错特错了……

选择学徒制而非普通学位真的会多赚143,000英镑吗?以及为何每年八月我的收件箱里堆满垃圾邮件……

Will you really be £143,000 better off if you plump for an apprenticeship over a regular degree? And why my email inbox fills with junk every August …

HEPI主任Nick Hillman OBE对每年围绕公开考试成绩的、信息不充分的电子邮件浪潮表示遗憾。每年八月,在成绩公布日前后,我的收件箱里都会塞满愚蠢季节的主动投递和标题党新闻。这些通常包含