相同事实,不同答案:法律AI的一致性问题

作者:Shaz Aziz,Neota Logic。现在是2026年8月。一位没有技术背景的律师现在可以在...内构建一个可用的法律AI工具。

来源:Artificial Lawyer

作者:Shaz Aziz,Neota Logic。

现在是2026年8月。一个没有技术背景的律师现在可以在喝咖啡休息时间在聊天窗口中构建一个可工作的法律AI工具。我自己就做过。这是革命性的,法律科技界任何假装不是的人都在推销什么。

所以,我很乐意承认许多供应商试图争论的观点:模型是好的。它们甚至很优秀。它们阅读合同,提取义务,总结,对话。对于法律工作中那些从未完全适应规则的部分,它们是我们拥有的最好的工具。

应该让律师夜不能寐的问题不是AI是否能产生答案。而是第六个月会发生什么。模型已经更新了两次。编写提示的人已经离开。监管机构或对方律师询问某个特定决定是如何做出的,以及相同的事实是否会在今天产生相同的决定。在我看到的大多数法律AI部署中,诚实的答案是没人知道。

生成器与验证器

有一个持久且诱人的说法,即每一波新的技术进步都会摧毁上一波。iPod杀死了CD播放机。然后苹果自己用iPhone摧毁了iPod。音乐播放器多年来不断变化,但音乐只是从一个家搬到另一个家。真正重要的技术从来不是设备。而是设备携带的东西——任何新播放器都可以摄入的结构化录音。

同样的误读也发生在法律AI中:逻辑系统是旧事物,语言模型是新事物,进步意味着扔掉旧的以支持新的。它混淆了音乐播放器和音乐收藏。但规则才是音乐。逻辑系统持有组织多年来明确化的编纂判断:策略手册阈值、升级规则、合规逻辑。判断通过的聊天窗口是当前设备,而LLM是另一次家的变化。将数年编纂判断输入提示的买家正走向将来会反噬的部署。

这里有两种机器,它们擅长不同的工作。语言模型是概率性的。它产生一个合理的答案,通常是一个非常好的答案,但每次略有不同。规则引擎是确定性的。相同的输入,相同的答案,每次都是,并有一个您可以通过逻辑的路径,您可以打印出来交给某人检查。一台机器阅读和对话。另一台做出决定并记住为什么。法律工作需要两者,通常在同一个工作流中:模型读取文档,规则做出决定,在风险需要的地方,工作流停止等待人,没有他们就不会继续。

最近每个违反专业标准的“幻觉”案例都在某个地方有一个人在回路中:律师助理、书记员、当地法律顾问。在场不是控制。控制说明人员必须验证什么,证明他们验证了,并在他们验证之前阻止下一步。

您的规则在哪里?

当客户问我为什么不能简单地在他们的AI助手中构建合规逻辑时(他们确实会问),我已经不再争论能力了。相反我问一个问题:您的规则在哪里?

如果答案是“在提示中”,请考虑这意味着什么。提示可以放在版本控制中,但那是对文字的版本控制,而不是行为:底层的模型会在不询问您的情况下改变,所以1月和6月的同一个提示不是同一个系统。规则引擎对行为本身进行版本控制。没有维护过程:通过提示生成的规则通过重新提示来维护,而重新提示可以悄悄重写整个东西。审计员的问题清晰简单。您能否重现1月在1月规则下做出的决定?对于提示构建的系统,答案是否定的,无论模型改进多少都无法修复。

大型保险公司或公司不是在做一项决定,而是每天数万项。用可检查的逻辑系统地做出这些决定,您就有了一个运营。用概率性的、可以在您不知情的情况下变化的逻辑做出它们,您就是在规模上做出不一致的决定。这是集体诉讼建立的基础模式:当一个决定被成功挑战时,每个以同样方式做出的决定都面临风险,而您无法证明它们是以同样的方式做出的。我们平台上运行的一个索赔申请在其决策逻辑中大约有1.09亿条可能路径。每一条都是可检查的。这不是您可以通过提示来实现的属性。

接下来是什么

我会押注的未来,也是我们正在构建的,有三个阶段。

首先,AI在受治理的工作流内部工作。模型进行阅读、提取和分类;规则做出决定;审计记录显示哪些步骤是概率性的,哪些是确定性的。这在今天正在发货,也是认真部署的开始。

其次,行进方向反转。AI不是在工作流内部,而是工作流可以从律师已经在的任何地方被调用,例如聊天界面。提出一个有后果的问题,而不是模型猜测,它调用一个确定性应用程序并返回附带推理的答案。模型只做一个决定:调用工作流。所有必须可重复的都留在那条线的另一侧。规则引擎不再是一个您去的地方,而是成为您的助手携带的东西,就像您的手机携带您的音乐一样。

第三,AI帮助编写规则本身,这使确定性层更容易构建和维护。这是今天的一个方向而非产品,我会警惕任何告诉您相反的人。

要问的问题

在法律AI中,几乎没有人能告诉买家答案的哪一部分是猜测。这是我会向任何供应商提出的问题,包括我们:指出工作流并说明哪些步骤是概率性的,哪些是规则。提取可能仍然是错误的(它是一个模型,模型有时会出错),这正是工作流在那里停下来等待人的原因。但您知道边界在哪里。这比任何关于安全和信任的安慰性语言都更有价值。

因此,当您今年评估法律AI时,跳过模型基准。询问规则在哪里、谁可以更改它们,以及它们能否重现去年1月在去年1月逻辑下做出的决定。能回答的供应商会很高兴您问了。

了解Neota Logic如何在此处保持您的法律AI答案一致。

关于作者:Shaz Aziz是Neota Logic的高级客户解决方案总监。

[ 这是Neota Logic为Artificial Lawyer撰写的赞助思想领导力文章。]

在Artificial Lawyer发现更多

订阅以将最新帖子发送到您的电子邮件。