详细内容或原文请订阅后点击阅览
我花了五月时间评估不同的 OCR 引擎
在 93 份人类文档上测试 14 个引擎“我花了五月时间评估 OCR 的不同引擎”一文首先出现在“迈向数据科学”上。
来源:走向数据科学应该由机器读取。旧酒店发票、银行对账单、工资单、贷款申请、医疗账单、海关表格、法庭文件、工单。
大多数公司使用免费工具和付费 API 来尝试转换这些文档,如果您想要结构化输出,像 Textract Structured 这样的 API 每 1000 页的费用高达 65 美元左右。
不过,在过去几年中,出现了许多新的选择:专门用于 OCR 的小型开源视觉模型、通用视觉语言模型以及 LlamaParse 等文档解析工具——改变了可能性及其成本。
因此,现在是我自己做实验的好时机,可以针对不同难度的文档来测试其中的一些内容。
我搜寻了 93 份文档,这些文档可以作为公司使用 OCR 的代理:手写笔记、表格、财务遗留文档、扫描发票、收据、图表、旧报纸、税表,然后通过 14 个不同的引擎运行它们。
这个想法是看看他们如何处理两件事:文本恢复和保留有用的表结构的能力。
我想要回答的主要问题是:您真的需要为 1000 个结构化页面支付 65 美元吗?或者您可以将其缩减为一小部分吗?专用模型是否胜过通用模型?
在做这样的实验时,你总会发现很多奇怪的事情,我也会介绍一下。但为了回答这个主要问题,我将带您了解 OCR 是什么(如果不是新的,请跳过)、经济学、测试、一些结果,以及这向我展示了什么。
注意:我没有测试全场提取,因为很难在十四个引擎之间进行清晰的比较。
TL;DR
没有最好的 OCR 引擎。 OCR是一个路由问题。
对于干净的大容量文档,Tesseract 仍然很难被击败,因为它免费且速度快。对于混合制作文档,Gemini Flash 是本次测试中最好的全能选手。对于表格来说,Mistral OCR 看起来是更便宜的结构化选项。
向我解释一下 OCR 空间
文档、引擎和指标
❤
