“远离人类水平”:加州大学伯克利分校研究发现,人工智能模型在工作任务上的得分低于 25%

加州大学伯克利分校的研究人员在 50 多个行业测试流行的人工智能语言模型的能力时,其得分低于 25%。研究表明,伯克利负责任、分散式智能中心进行了“特工最后考试”,这是该校真实世界的专业工作流程测试,旨在确定人工智能是否已“做好工作准备”。 “今天的 [...]

来源:The College Fix

要点

  • 加州大学伯克利分校的一项研究发现,流行的人工智能模型在现实世界的专业任务中得分低于 25%,突显出它们在跨行业执行复杂工作流程时的能力有限。
  • 包括 OpenAI 的 ChatGPT-5.5 在内的 AI 模型在持续推理和执行繁重的工作流程中遇到了困难,在最具挑战性的任务上平均成功率仅为 2.6%。
  • 虽然目前在处理复杂任务方面效率不高,但研究人员认为,人工智能将越来越多地自动化重复性、例行工作,尽管决策密集型角色可能会在更长时间内保持安全。
  • 加州大学伯克利分校的研究人员在 50 多个行业测试流行的人工智能语言模型的能力时,其得分低于 25%。

    根据该研究,伯克利负责任、去中心化情报中心进行了“特工最后考试”,这是该校真实世界的专业工作流程测试,旨在确定人工智能是否已“做好工作准备”。

    “今天的智能体可以解决相当一部分专业任务。然而,当我们审视那些需要持续推理、深厚领域专业知识和长期可靠执行的最困难任务时,它们仍然距离人类水平还很远,”报告指出。

    “在 ALE 最难的层中,我们测试的每个前沿特工(包括《神鬼寓言 5》)的成功率都是 0%,”研究指出。

    该测试涵盖“涵盖 55 个职业的 1,500 多项专家任务”,包括金融、法律和制造。

    Fable 5、GPT-5.5 和 Composer 2.5 等未能正确完成超过四分之一的测试。研究显示,在所有测试的模型中,OpenAI 的 ChatGPT-5.5 模型得分最高,通过率为 24%。

    当被问及人工智能可能仍难以掌握哪些技能时,Sun 表示,它选择如何完成任务以及在发生故障时改变方法的能力仍然很困难。