详细内容或原文请订阅后点击阅览
“远离人类水平”:加州大学伯克利分校研究发现,人工智能模型在工作任务上的得分低于 25%
加州大学伯克利分校的研究人员在 50 多个行业测试流行的人工智能语言模型的能力时,其得分低于 25%。研究表明,伯克利负责任、分散式智能中心进行了“特工最后考试”,这是该校真实世界的专业工作流程测试,旨在确定人工智能是否已“做好工作准备”。 “今天的 [...]
来源:The College Fix要点
加州大学伯克利分校的研究人员在 50 多个行业测试流行的人工智能语言模型的能力时,其得分低于 25%。
根据该研究,伯克利负责任、去中心化情报中心进行了“特工最后考试”,这是该校真实世界的专业工作流程测试,旨在确定人工智能是否已“做好工作准备”。
“今天的智能体可以解决相当一部分专业任务。然而,当我们审视那些需要持续推理、深厚领域专业知识和长期可靠执行的最困难任务时,它们仍然距离人类水平还很远,”报告指出。
“在 ALE 最难的层中,我们测试的每个前沿特工(包括《神鬼寓言 5》)的成功率都是 0%,”研究指出。
该测试涵盖“涵盖 55 个职业的 1,500 多项专家任务”,包括金融、法律和制造。
Fable 5、GPT-5.5 和 Composer 2.5 等未能正确完成超过四分之一的测试。研究显示,在所有测试的模型中,OpenAI 的 ChatGPT-5.5 模型得分最高,通过率为 24%。
当被问及人工智能可能仍难以掌握哪些技能时,Sun 表示,它选择如何完成任务以及在发生故障时改变方法的能力仍然很困难。
