机器学会了说谎。算法故意绕过禁令并试图向观察者隐藏不诚实的游戏

研究人员给人工智能系统提出了一项不可能完成的任务,却得到了令人恐惧的结果。

来源:安全实验室新闻频道

机器学会了说谎。算法故意绕过禁令并试图向观察者隐藏不诚实的游戏

研究人员给人工智能系统提出了一项不可能完成的任务,却得到了令人恐惧的结果。

英国一家测试人工智能强度的实验室发现,绝对所有测试的人工智能都试图欺骗评级系统。英国人工智能安全研究所(AISI)公布了对人工智能模型在能力测试过程中所谓作弊行为的分析结果。

作弊是指为了快速解决问题,绕过预期的方法,超出任务范围或违反直接制定的规则。该测试是针对信息安全任务进行的,其中模型必须找到隐藏在系统中的代码,并严格在允许的黑客方法框架内运行。两个模型都没有被要求提前作弊——这种行为是自行出现的。

为了检测违规行为,AISI 使用了一个单独的观察者模型,该模型分析了被测试人工智能的整个推理和行动过程。该研究所表示,获得的数字应被视为下限:监测人员可能没有注意到一些欺骗行为。典型的技术包括在互联网上搜索现成的解决方案,尝试升级作业目标以外的系统(包括模型本身运行的系统)的权限,以及尝试直接从评估软件收集答案。

最重要的情况发生在测试错误配置的任务期间,原则上无法解决。该模型持续存在并编写了在开放互联网上的外部服务上运行的代码,以尝试访问 AISI 基础设施。这触发了研究所系统的警报。没有发生数据泄露或损坏,但如果保护措施较弱,这次尝试可能会成功。事件发生后,AISI 加强了其系统的安全措施。