详细内容或原文请订阅后点击阅览
Harvey + Legora 在 OpenAI 的 GPT-6 Astra 上
OpenAI 发布了 GPT-6 Astra,这是其新的旗舰模型,也是迄今为止最有能力执行端到端任务的法学硕士。哈维和莱戈拉都提供了一些......
来源:Artificial LawyerOpenAI 发布了 GPT-6 Astra,这是其新的旗舰模型,也是迄今为止最有能力执行端到端任务的法学硕士。 Harvey 和 Legora 都提供了一些关于它如何使合法人工智能受益的见解(见下文)。
GPT-6 Astra 于 9 月 3 日开始在有限的基础上推出,最终将得到更广泛的使用。但是,问题是:现在有这么多型号上市,这有什么大不了的吗?
简短的回答是:是的,因为主要模型制造商表明他们可以(尽管是渐进的)不断提高人工智能性能。这对律师来说尤其重要,因为很难定义一个阈值,在该阈值下,法律人工智能的独立使用受到限制,但相反,一旦达到一定的可靠性水平,它就会变得非常强大。
例如,OpenAI 提供了一系列基准测试,展示了许多改进,其中之一是“Agents Last Exam”——加州大学伯克利分校 RDI 创建的基准测试,旨在回答以下问题:“AI 代理能否从头到尾执行具有经济价值的专业工作?”
它涵盖 55 个专业“子领域”,并包括法律工作的某些方面等。在这种情况下(见图)它达到了 59.3%,而 GPT-5.6 Sol 达到了 53.6%。
现在,你可能会说:‘那又怎样?这还不足以完全接管整个法律工作。”你是对的。但是,情况正在迅速好转。
如果有人认为,当 genAI 首次应用于法律任务时,让法学硕士处理一整套复杂工作并做得很好的想法似乎是一个白日梦;所以我们已经走了很长的路。
没有迹象表明事情会放缓,特别是考虑到主要模型制造商和开源开发人员之间现在的激烈竞争。
OpenAI 补充道:“GPT-6 Astra 将计算机使用方面的进步与专业环境的针对性培训相结合,帮助解决复杂的工作任务。它将复杂问题所需的智能与执行多步骤工作流程和生成精美文档的能力结合在一起......
“Astra 是我们最一致的模型,在理解用户意图和模型行为方面有了显着改进,您可以更加信任 Astra 的判断来委派任务。”
如果我们要对法律工作采取真正的代理方法,即不仅仅是到处提示,而是要求人工智能工具执行一系列相互关联的任务,那么所有这些都很重要。
OpenAI 还提供了几个专门针对法律文件的格式化示例,但这些并不是那么令人兴奋,即使格式化仍然是全世界律师的痛苦。
— 广告 —
—
哈维和莱戈拉的观点
Harvey 的快速发展的法律人工智能平台应用研究主管 Niko Grupen 表示:“Astra 在复杂的法律任务中比 GPT-5.6 Sol 有了显着的质量改进。
“在我们的早期测试中,Astra 因以敏锐律师的方式处理法律工作而脱颖而出:它将文件与既定记录区分开来,提出不受支持的假设,并将差距转化为具体的起草立场。”
AL 期待看到它在 Harvey 自己的基准测试中的表现。
对于 Legora,OpenAI 与法律工程师 Percevale Perks 一起发表了一篇文章,其中涉及对 GPT-6 Astra 的试验,他们将其描述为“一种更繁琐的工作流程……财务报表搭配:根据试算表、合并时间表和上一年的账目检查草稿账户中的每个数字,直到每个项目都一致。”
他们将新模型瞄准了这一点,这就是他们的发现:
“大规模处理复杂的金融环境 -
‘使用 GPT-6 Astra,Legora 的特工在一次运行中完成了 41 个文档的绑定。代理在几分钟内完成了工作:根据支持计划检查每笔余额,显示金额中断,并记录每笔支票。结果为法律专业人员提供了每个行项目和要审查的数字的详细记录。
‘我认为前后发生的变化是处理能力,摄取如此大量文档的能力,消化真正复杂的信息,以及获取所有这些不同的行项目和数字的能力。
‘代理负责进行详尽的比较,而专家则负责对每个结果进行判断。这种让人们了解情况的方法对于 Legora 如何将其平台从法律工作扩展到审计、税务、合规和风险领域至关重要。
‘GPT-6 Astra 发现 Legora 在账户中植入的所有四个错误,包括收入票据中隐藏的 500,000 英镑缺口。它根据其支持计划检查了每笔余额并记录了每笔支票。它保留了之前型号正确的每一项检查,并完成了大约 50 项以上的检查。
“结果是更完整、更快速的首次通过以及更清晰的审查记录,而最终决定权则由法律专家做出。”
这里的关键是节省的时间、任务的复杂性以及结果带来的信心。尽管在本例中,该测试更多的是关于数字而不是复杂的法律文本。
Legora 还通过其 Legora 代理推理基准 (BAR) 评估了 GPT-6 Astra,该基准衡量来自现实世界用例的端到端法律任务的性能。
Legora 发现:“GPT-6 Astra 在财务报表工作流程方面的性能比之前的模型提高了近 40%。在 BAR 中的所有任务中,平均改进约为 3%。”
结论
这是惊天动地的飞跃吗?编号
这是否证明模型每隔几个月就能有意义地进步?是的。
为什么这很重要?因为法律工作高度依赖准确性。如果代理人能够承担复杂的法律工作流程,并获得如此高质量的结果,以至于律师可以真正依赖他们,只需进行最简单的质量检查,那么这就真正改变了游戏规则。
我们到了吗?不会。如上所示,在特工期末考试中,新型号的得分为 59.3%。这不是“一劳永逸”的绩效水平。但是,改善的速度是显着的。毫无疑问,几天后另一家公司将发布另一款更先进的型号。然后另一个会。等等。性能曲线将慢慢爬升。
这个必须达到99.9%吗?不会。有人可能会说,只要有经验丰富的律师监督,它就已经非常有用了。主要问题是,复杂代理任务的表现在什么时候会变得如此出色,以至于律师只是“快速浏览一遍以确保确定”?到那时,这会在多大程度上更广泛地改变合法的商业模式?
有关 Astra 的更多信息请参见此处。
快来参加我们于 11 月 4 日至 5 日在伦敦举办的 Legal Innovators 活动吧! 此次会议是法律人工智能与法律业务的交叉点。第一天:律师事务所,第二天:内部。
英国法律创新者 - 伦敦,11 月 4 日至 5 日
从人工律师中发现更多
订阅以将最新帖子发送到您的电子邮件。
