具有自适应 PDF 解析的循环工程:起步便宜,仅在页面需要时才购买较重的解析器

企业文档智能 [Vol.1 #10A] - 升级级联和免费的确定性检查,在您付费进行更深入的解析之前标记失败的解析带有自适应 PDF 解析的后循环工程:开始便宜,仅在页面需要时才为较重的解析器付费它首先出现在《走向数据科学》上。

来源:走向数据科学

而且很贵。快速解析器会错过答案所在的表格。在 200 页报告的每一页上运行繁重的表格,您需要支付 200 页才能挽救其中的三页。到处跑便宜的桌子,一张扁平的桌子就解决了问题。这两种设置都不适合整个文档,因为文档不统一:大多数页面都是纯文本,快速解析器可以很好地处理,而少数页面则包含需要昂贵页面的表格。页面本身应该决定它被解析的难度。

本文是企业文档智能的第三部分中有关自适应解析的两部分中的第一部分,该系列由四个部分构建企业 RAG 系统:文档解析、问题解析、检索和生成。这部分构建了升级级联和廉价检查,以决定解析何时足够好;第二部分,使用自适应解析进行循环工程:使用 Azure 解析平面表格,使用 LLM 愿景解析图形(链接即将到来),介绍更深入的解析器的实际使用。

📓 可运行的同伴自己运行廉价的检查:您在注意纸的每一页上调用 pre_parse_signals,打印每页标志(char_count、image_count、line_df 上的平板指纹),并在花费一美元之前观察哪些页面路由到较重的解析器。在 GitHub 上:doc-intel/notebooks-vol1。

PyMuPDF 在五毫秒内免费解析一个页面。同一页上的愿景LLM可能要花费一万倍,并且需要十秒钟。当问题以简单的散文形式出现时,廉价的解析器就会获胜。当答案隐藏在表格、图形、扫描区域或扁平布局中时,廉价的解析器会默默地返回任何有用的内容,而法学硕士可以自信地回答错误的问题。

评估不是一处检查。这是一个级联:

  • 预解析元数据在提取之前路由大部分语料库
  • 解析时输出标记扁平表格和不透明数字
  • 检索评分捕获漂移的锚点
  • 3.1。检查1:预解析