使用自适应解析进行循环工程:使用 Azure 解析平面表格,使用 Vision LLM 解析图形

企业文档智能 [Vol.1 #10B] - LLM 作为最后一道防线,然后两个真正的升级从头到尾进行:从平面表到 Azure,从图形到视觉模型后循环工程与自适应解析的实际应用:使用 Azure 解析平面表和带有愿景的图形 LLM 首先出现在《走向数据科学》上。

来源:走向数据科学

在答案出现之前看起来不错(经典 OCR 是教科书案例:EasyOCR 恢复单词并悄悄地删除它们周围的表格结构,答案读起来很好,直到您对照页面检查它)。确定性检查可以免费捕获明显的失败,但是一张被解析为看似合理的废话的表格会直接穿过它,并且模型充满信心地从这些废话中回答。上游没有任何标记它,因为在纸面上解析看起来很好。最后一道防线是法学硕士在用户看到答案之前读取自己的输入。

本文是有关自适应解析的两部分中的第二部分,属于企业文档智能的第三部分,该系列由四个部分构建企业 RAG 系统:文档解析、问题解析、检索和生成。第一部分,具有自适应 PDF 解析的循环工程:开始便宜,仅在页面需要时才支付较重的解析器(链接即将到来),构建升级级联和免费标记失败解析的确定性检查。这部分将 LLM 添加为最后一道防线,并端到端地进行两次真正的升级。

📓 可运行的同伴将两个升级从头到尾进行:您使用 fitz 解析平面页面,然后使用 Azure 重新解析它,将图形页面发送到视觉 LLM,然后观察 context_structed 将生成从错误答案翻转为正确答案。在 GitHub 上:doc-intel/notebooks-vol1。

PyMuPDF 在五毫秒内免费解析一个页面。同一页上的愿景LLM可能要花费一万倍,并且需要十秒钟。当问题以简单的散文形式出现时,廉价的解析器就会获胜。当答案隐藏在表格、图形、扫描区域或扁平布局中时,廉价的解析器会默默地返回任何有用的内容,而法学硕士可以自信地回答错误的问题。

评估不是一处检查。这是一个级联:

  • 预解析元数据在提取之前路由大部分语料库
  • 2.1。问题,直接使用

    两个发现。