What to Expect From LLM Customization Services
LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。
Стоимость развертывания LLM за год выросла почти втрое
MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。
LiteLLM in the crosshairs: Supply Chain Attack on AI Infrastructure
LiteLLM 的用户可能已成为攻击者组织的目标。早在 3 月份,人们就知道“TeamPCP”组织已经成功获取了各个平台的机密信息,包括 Kubernetes 秘密、SSH 密钥、存储库凭证、AWS 等云平台以及 AI 环境的代币。有关谁受到影响以及攻击者能够窃取哪些数据的信息可以在在线数据库中查看。
Потребление китайских LLM в России выросло более чем в 11 раз
MWS云分析了俄罗斯企业对中国大语言模型的消费情况。 2026年上半年的消费量比2025年全年高出11倍多。
企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。
Harbor Seeks To Counter General LLM FDEs
法律技术咨询公司 Harbor 推出了针对法律人工智能需求的“部署”,这将使他们“在客户内部嵌入包括前沿部署工程师 (FDE) 在内的专家团队”。他们...
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。
Semantic Knowledge Graph for LLM Agents
为什么重要:了解 LLM 代理的语义知识图如何减少幻觉、增加记忆力并将测试中的答案准确性从 17% 提高到 54%。
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...
LLM optimization integration for Amazon SageMaker Python SDK
Amazon SageMaker Python SDK v3 现在直接在您的笔记本中公开 Amazon SageMaker AI 中的生成式 AI 推理建议。对端点进行基准测试,生成数据驱动的部署建议,并部署推荐的配置,而无需离开笔记本工作流程。
Honest Abacus AI Review: ChatLLM, DeepAgent, AI Studio & More
一体化 AI 引擎:Abacus AI 完整生态系统的全面回顾深入了解该平台如何将 100 多个 AI 模型、自主代理和完整的开发人员套件集成到为团队和高级用户提供的单一且经济高效的工作流程中。
7 Approaches to Reduce Inference Latency in Your LLM Workflows
从量化到推测解码,这里有七种工程策略,可以在生产中交付更快、响应更灵敏的生成式 AI 应用程序。
Build an LLM Agent That Can Write and Run Code
使用 OpenAI Agents SDK 和 Docker 执行代码的实践演练《构建可以编写和运行代码的 LLM 代理》一文首先出现在《走向数据科学》上。
How To Build Your Own LLM Runtime From Scratch
如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。
企业文档智能 [Vol.1 #10B] - LLM 作为最后一道防线,然后两个真正的升级从头到尾进行:从平面表到 Azure,从图形到视觉模型后循环工程与自适应解析的实际应用:使用 Azure 解析平面表和带有愿景的图形 LLM 首先出现在《走向数据科学》上。
Uncertainty Quantification for LLM Function-Calling
大型语言模型 (LLM) 越来越多地用于自主解决现实世界的任务。其中一个关键要素是法学硕士函数调用范式,这是一种广泛使用的方法,为法学硕士配备工具使用功能。然而,LLM 错误地调用函数可能会产生严重影响,特别是当其影响不可逆转时,例如转账或删除数据。因此,在执行函数调用之前,考虑法学硕士对函数调用正确解决任务的信心至关重要。不确定性量化(UQ)方法可用于量化……
Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer
OpenAI 构建了一个名为 GPT-Red 的 LLM 超级黑客,将其用作陪练伙伴,帮助其其他模型增强对网络攻击的防御能力。上周该公司发布了其旗舰 LLM 的最新版本 GPT-5.6。 OpenAI 表示,针对 GPT-Red 进行训练使该模型成为迄今为止最强大的版本。 GPT-Red 自动化...
大型语言模型 (LLM) 表现出广泛的类人行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管法学硕士很普遍,但研究人员和从业者缺乏方法和经验见解来就法学硕士应该表现出何时以及何种类型的类人行为做出明智的决定。为了填补这一空白,我们使用法学硕士作为法官和人类评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。超过 21,000 个……