详细内容或原文请订阅后点击阅览
AI模型在这些智力测试中不及格。你能做得更好吗?
谜题和游戏自人工智能发展之初就一直是其核心。正如我们人类喜欢用填字游戏或逻辑谜题来测试智力一样,开发者也可以用游戏挑战来测试模型的发展程度。“机器学习”一词
来源:MIT Technology Review _人工智能增加复杂性
在某些情况下,LLM 能否完成拼图是一个规模问题。苹果公司研究人员的一项研究发现,法学硕士可以解决简单版本的河内塔问题(该问题涉及一次移动一堆圆盘,而无需将较大的圆盘放在较小的圆盘上)和过河难题(其中一群人必须根据特定规则穿越一条河流)。但仅限于一定程度:当磁盘或人员的数量达到六或更多时,模型开始动摇。
在另一项研究中,华盛顿大学、斯坦福大学和艾伦人工智能研究所的研究人员观察到,法学硕士在逻辑网格难题上遇到了类似的困难,这需要从一系列线索中推断出一组个体的属性。苹果公司的这篇论文迅速走红,但评论员质疑该结果是否揭示了 LLM 推理的独特局限性,或者只是随着复杂性的增加,犯错误是正常的。
河流
说明:使用提供的场景,计划让每个人过河所需的行程。
