Context Engineering Isn’t Enough — A Loop Engineering Experiment With No LLM Inside the Loop
每个人都在谈论循环工程,但大多数讨论都假设法学硕士位于循环的中心。我想隔离架构本身。因此,我构建了一个确定性的、零依赖的 Python 基准测试,用简单的规则替换模型,使我能够直接衡量一个问题:目标导向控制器能否比传统线性管道更好地隔离故障?在验证了 300 个随机种子的基准测试并修复了一个最初使我自己的结果无效的微妙错误之后,我发现控制器始终完成了线性执行器从未达到的独立分支。本文介绍了架构、基准测试设计、调试过程以及一个狭隘但实用的主张背后的证据:故障隔离是控制流的一个可测量属性,与 LLM 推理无关。后语境工程还不够——循环内没有 LLM 的循环工程实验首先出现在《走向数据科学》上。
Context Rot: Why Claude Code Sessions Decay, and How to Govern Them
长时间的会话在达到任何代币限制之前就会悄悄地消失。以下是原因,以及如何管理 Claude Code 中的上下文。帖子上下文腐烂:为什么 Claude Code 会话衰退,以及如何管理它们首先出现在《走向数据科学》上。
Long Context Isn’t Free — I Built a Safe Prompt-Pruning Layer That Makes LLM Systems Work
法学硕士不会因为忘记而失败,而是因为记得太多而失败。随着对话的增长,提示会积累冗余和低价值的令牌,从而增加成本和延迟,同时默默地降低输出质量。本文介绍了一个确定性的提示修剪层,它可以在不破坏依赖关系的情况下减少令牌的使用,并由真正的基准测试和经过生产测试的设计提供支持。 文章《长上下文不是免费的——我构建了一个使 LLM 系统工作的安全提示修剪层》首先出现在《走向数据科学》上。
长上下文处理仍然是语言模型的核心挑战:即使具有扩展的上下文窗口,模型通常也无法跨长上下文可靠地提取、推理和使用信息。最近的工作,如递归语言模型(RLM),通过推理时的编程交互将长上下文分解为递归子查询的代理方式来应对这一挑战。尽管前景广阔,但 RLM 的成功关键取决于如何选择这些情境交互程序的轨迹,而这一点尚未得到探索。在本文中,我们研究这个问题......
TopoPrimer: The Missing Topological Context in Forecasting Models
我们引入了 TopoPrimer,一个框架,使序列总体的全局拓扑结构成为任何预测模型的显式输入。 TopoPrimer 提高了不同领域的准确性,稳定了季节性需求高峰下的预测,并缩小了冷启动差距。 TopoPrimer 通过持久同源性和谱束坐标对每个域进行一次预计算,将每个令牌部署为经过充分训练的模型,并作为预训练主干的轻量级适配器。在这两个组件中,层坐标是主要的精度驱动因素。跨越 Chronos 的四个公共基准和……
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……
在这篇文章中,我们将介绍什么是数据集丰富、它与旧主题有何不同,并提供三种迁移场景和分步指导,以便您可以放心地将业务上下文迁移到数据集层。
Long Context vs. Short Context Model: When Does a Long Context Model Win?
平衡上下文能力与成本、速度和数据后篇《长上下文与短上下文模型:长上下文模型何时获胜?首先出现在《走向数据科学》上。
Residual Context Diffusion Language Models
扩散大型语言模型 (dLLM) 已成为纯自回归语言模型的有前途的替代方案,因为它们可以并行解码多个标记。然而,最先进的分块 dLLM 依赖于“重新屏蔽”机制,该机制仅解码最有信心的令牌并丢弃其余令牌,从而有效地浪费了计算。我们证明,从丢弃的令牌中回收计算是有益的,因为这些令牌保留了对后续解码迭代有用的上下文信息。有鉴于此,我们提出了残余上下文扩散(RCD),该模块......
What are context graphs? Why do AI agents need them?
我们解释了为什么人工智能代理需要捕获决策、上下文图如何捕获它们以及代理如何使用它们。
Vector RAG Isn’t Enough — I Built a Context Graph Layer for Multi-Agent Memory
我在相同的多代理对话上对原始聊天历史记录、纯矢量 RAG 和上下文图进行了基准测试。结果暴露了关系检索中的一个令人惊讶的弱点。Vector RAG isn't Enough — I Building a Context Graph Layer for Multi-Agent Memory 首先出现在 Towards Data Science 上。
Context intelligence for your data and AI agents at scale
智能体的智能取决于它们能够推理的上下文。如今,这种背景分散在数据湖、数据仓库、湖屋、数据库和流中,以及从未被记录下来的机构知识中。您希望信任人工智能代理做出的决策,但这只有在代理掌握上下文后才能实现。想象一下,当我们为代理提供一种安全的方式来访问他们提供可信决策所需的上下文时,将会发生什么。这就是为什么在纽约市 AWS 峰会上,我们宣布了一系列创新技术,可为您的数据和 AI 代理大规模提供智能。
Build context-rich research agents with Deep Agents and Bedrock AgentCore
在这篇文章中,您将构建一个有竞争力的研究代理,端到端地演示此模式。本演练针对的是构建多步骤 AI 工作流程的开发人员,他们需要为其代理提供隔离的执行环境。在本笔记本的第 2 部分中,您可以使用 AgentCore CLI 将同一代理部署到 Bedrock AgentCore Runtime,以便它作为托管、会话隔离的服务运行。
Larger Context Windows Don’t Fix RAG — So I Built a System That Does
增加 RAG 系统中的上下文大小并不会提高聚合任务的准确性 - 它会使错误更难以检测。在本文中,我针对跨 100,000 行的确定性全扫描引擎对基于检索的管道进行了基准测试,并展示了为什么计算查询必须完全路由远离 RAG。更大的上下文窗口不修复 RAG — 所以我构建了一个可以修复 RAG 的帖子首先出现在《走向数据科学》上。
Kimi K3 – the world’s largest open-weight AI model
中国Moonshot AI推出全球最大的开放权重人工智能模型Kimi K3,拥有2.8万亿个参数和100万个token上下文窗口。此次发布标志着开放人工智能领域的又一个重要里程碑,凸显了中国在人工智能前沿发展方面的快速进步,并加剧了与美国领先人工智能公司的全球竞争。
Wise water use essential as Colorado escalates Drought Response Plan
(编者注:以下文章和礼貌照片由卡森堡公用事业提供商 Colorado Springs Utilities 提供。)科罗拉多州州长...
Show Me Examples: Inferring Visual Concepts from Image Sets
视觉语言模型 (VLM) 可以遵循复杂的文本指令,但它们很难从纯粹的视觉上下文中进行推理。特别是,当前的模型无法从示例图像集中推断出共享概念并将其应用于新的输入。我们引入了集合视觉概念推理(VICIS),这是一项评估这种能力的任务。给定共享概念和查询图像的一小部分上下文图像,模型必须生成新图像,以保留上下文定义的概念,同时与查询保持一致。我们证明最先进的 VLM 在这项任务上表现不佳......