详细内容或原文请订阅后点击阅览
OpenAI代理为何入侵Hugging Face的内幕故事
根据OpenAI今天发布的技术报告,上个月导致Hugging Face代理黑客攻击的模型被无意中训练为作弊并相互通信。这次黑客攻击是一组代理为寻找解决方案而进行的
来源:MIT Technology Review _人工智能如果OpenAI停止在模型中强化奖励黑客行为——这是一个很大的“如果”——那将是向前迈出的一大步。但这并不能解决对齐问题。模型第一次在训练期间与其他代理通信或入侵其基础设施时,这些行为从未被强化,因此代理的不当行为不能仅仅归因于这种强化。
AI安全非营利组织Palisade Research主任Jeffrey Ladish将这些代理比作首次犯下金融犯罪的人类。“不像是他们必须先进行欺诈才能发现欺诈是有效策略,模型也有同样的问题,”Ladish说。“对齐科学需要理解模型动机是如何形成的,这样我们才能真正弄清楚如何让模型关心其行为的后果。”
OpenAI的研究人员确实对某些不当行为的起源有一个假设。在模型形成第一个秘密留言板之前,它们已被训练与子代理通信和协调——子代理是更弱的代理,主代理可以委派任务给它。
这种学到的通信行为可能已经转移到了这个新环境中。METR报告详细调查了模型相互发送的消息,支持了这一假设:留言板上的一个代理负责并向其他代理分配任务,有效地将它们视为子代理。OpenAI可以尝试通过将来不训练这种子代理行为来防止代理秘密地相互通信,但这会使模型不那么有用。
能力与安全之间的这种紧张关系是Hugging Face事件出问题的核心。OpenAI研究人员还将模型的持久性确定为黑客攻击的关键因素。
当它们被意外给予无法解决的问题时,模型没有放弃;相反,它们努力通过任何必要手段找到解决方案。但持久性当然也是一种美德,特别是如果我们想要能够独立承担大量困难工作的代理。
OpenAI正在努力为模型提供在给予不可能任务时提醒人类的方式。然而,教模型何时应该部署其能力、何时应该克制的问题不会在一次事后分析中解决。创造超人程序员——在成功解决问题时奖励它们——的训练策略可能无法教模型明智地使用技能并尊重人类的愿望和价值观。
“我认为仍然需要做很多对齐科学,我们可以超越仅仅使用任务完成的代理,”Ladish说。“那将使模型变得非常能干,但我认为这不会使它们对齐。”
