让知识层成为你实际遍历的图

为什么检索质量应该是系统的属性,而不是问题措辞的属性?通过对每个查询、双时态边缘和双阈值实体解析进行图遍历来重建知识层。使知识层成为您实际遍历的图的帖子首先出现在走向数据科学上。

来源:走向数据科学

本系列的(,我在 RAG 管道旁边构建了一个持久知识层:一个用于基础的证据层,一个用于积累理解的结构化知识层,以及一个决定需要这两个问题中的哪一个的协调器。我将其部署在 Azure 上,用一个合成保险语料库播种它,该语料库旨在以六种特定方式破坏检索系统,并测量发生的情况。

架构经得起考验。矛盾登记册拒绝回答公司本身尚未解决的问题。生效日期范围使得 3 月 1 日生效的规则不再适用于 2 月 20 日的损失。实时模型走的是四跳推理链,每一步都有引用。

但我在这篇文章的结尾列出了我接下来要构建的内容,并且该列表中的两个条目从那时起就一直困扰着我。

第一个是数字。当我在部署的堆栈上通过实时提取运行所有 21 个文档时,该模型提出了这样的概念:我的基于别名的实体解析只能部分合并。结果是 149 个概念对象,其中策划图有 19 个——大约是碎片因子的 7 倍。我当时写道,这是“在解决链中嵌入相似性和法学硕士裁决的具体论点。”是的。但随着时间的推移,我意识到这个数字背后蕴藏着更大的意义。我构建的知识层存储关系,但系统中没有任何内容在检索时实际遍历它们。该图像文件柜一样被查阅,而不是像图一样被行走。

我会保留之前的做法,分三部分来呈现,和之前的方式一样。

第一部分是设计修订。与上次一样,与供应商无关。它涵盖了替换路由器(检索器与过滤器)、始终融合的检索管道、双时态边缘、摄取时间矛盾检测以及其他所有内容所依赖的实体解析子系统的原理。

内容

  • 老实说,第 1 部分结束了
  • 路由器是薄弱环节