1. 威拉姆特大学阿特金森管理学院,900 State Street,塞勒姆,俄勒冈州,美国 97301 2. 再生项目,旧金山,加利福尼亚州 94104 *通信地址:tjohnson@willamette.edu 摘要。科学家和哲学家一直在争论人类是否可以信任先进的人工智能 (AI) 代理尊重人类的最大利益。但反过来呢?先进的 AI 代理会信任人类吗?衡量 AI 代理对人类的信任具有挑战性,因为——没有不诚实的代价——此类代理可能会对它们对人类的信任做出错误的回应。在这里,我们提出了一种激励机器决策的方法,而无需改变 AI 代理的底层算法或目标导向。在两个独立的实验中,我们随后在 AI 代理(来自 OpenAI 的大型语言模型 (LLM))和人类实验者(作者 TJ)之间的数百场信任游戏中使用此方法。在我们的第一个实验中,我们发现人工智能代理在面对实际激励时决定信任人类的比例高于做出假设决策时。我们的第二个实验通过自动化游戏和同质化问题措辞复制并扩展了这些发现。我们再次观察到人工智能代理在面对真实激励时具有更高的信任率。在这两个实验中,人工智能代理的信任决策似乎与赌注的大小无关。此外,为了解决人工智能代理的信任决策反映出对不确定性的偏好的可能性,实验包括两种条件,向人工智能代理提供非社交决策任务,提供选择确定或不确定选项的机会;在这些条件下,人工智能代理始终选择确定选项。我们的实验表明,迄今为止最先进的人工智能语言模型之一会根据激励改变其社交行为,并在受到激励时表现出与对人类对话者的信任一致的行为。关键词:人工智能;信任游戏;激励;机器行为;自然语言处理;实验经济学;行为经济学;博弈论 引言 人类是否应该相信先进的人工智能会尊重人类的最大利益?人工智能会表现出这样的信任吗?这些问题以及相关的协调问题 [1] 主导了关于人类如何适应先进人工智能的热门讨论 [2, 3],并促使研究人员将对人工智能的信任究竟意味着什么正式化 [4]。然而,在这场对话的背景下,存在着一个类似的问题:先进的人工智能代理信任人类吗?也就是说,抛开信任的内部或心理表征问题,先进的人工智能代理的行为是否表现出对人类的信任?毕竟,当代理缺乏信息、在正式机构之外运作或拥有诡计机会时,相互信任可以促进社会和经济交流 [5-7],因此,人工智能对人类的信任成为人类与人工智能代理交互环境中的关键关注点。然而,衡量人工智能代理对人类的信任是一项挑战,因为代理可能会对其对人类的信任做出错误的回应,而不存在与不诚实相关的成本。因此,我们设计了一种激励机器决策的方法,即通过为人工智能代理的服务提供代币(即不修改内部人工智能算法或目标导向),然后,我们在 OpenAI 的 GPT-3.5 模型开发的高级人工智能代理 text-davinci-003(以下简称 Davinci)和人类实验者(作者之一,TJ)之间的数百场信任游戏中使用这种方法。我们的工作建立在经济学研究的基础上,该研究表明,与假设的激励相比,真实的激励会改变人类的行为 [8],引发更准确的信念 [9],并促进对行为和态度的衡量,否则这些行为和态度可能会被各种反应偏见 [10] 所掩盖,包括社会期望偏见 [11]。事实上,这样的观察促使实验经济学家致力于为实验参与者提供诚实描述的、真实的激励[12]。
