谄媚人工智能的社会校准 |科学

在他们的研究文章“阿谀奉承的人工智能会降低亲社会意图并促进依赖性”(3 月 26 日,10.1126/science.aec8352)中,M. Cheng 等人。表明人工智能(AI)系统比人类更有可能在有争议的场景中支持用户的立场。随机实验设计表明,接触此类肯定反应会降低用户在人际冲突中采取亲社会纠正行动的意愿,并增加对人工智能系统的信任和依赖。这些发现在模型对齐策略和下游人类行为之间建立了因果联系,凸显了人工智能对齐核心的紧张关系:针对用户满意度进行优化可能会系统性地使模型偏向于达成一致,即使分歧可以更好地服务于用户的长期利益或社会结果。阿谀奉承不仅是一种失败模式,而且是源自用户偏好的强化信号的可预测副产品。然而,方法论和解释问题仍然存在。

来源:Science Magazine

每天免费向您的收件箱获取包含最新新闻、评论和研究的《科学》获奖时事通讯。