检查法学硕士中的类人行为:模型行为、用户因素和系统提示的多维分析

大型语言模型 (LLM) 表现出广泛的类人行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管法学硕士很普遍,但研究人员和从业者缺乏方法和经验见解来就法学硕士应该表现出何时以及何种类型的类人行为做出明智的决定。为了填补这一空白,我们使用法学硕士作为法官和人类评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。超过 21,000 个……

来源:Apple机器学习研究

大型语言模型 (LLM) 表现出广泛的类人行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管法学硕士很普遍,但研究人员和从业者缺乏方法和经验见解来就法学硕士应该表现出何时以及何种类型的类人行为做出明智的决定。为了填补这一空白,我们使用法学硕士作为法官和人类评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。在来自四种广泛使用的模型(gpt-4o、gpt-4.1-mini、claude-sonnet-4.6、gemini-2.5-flash)的 21,000 个多轮对话中,我们发现类人行为普遍存在,但因模型和用户因素(对话目标和用户配置文件)而异。就感知的适当性而言,人类评估者认为法学硕士的自我参照和建立关系行为不如人类适合,但法学硕士的边界维护行为比人类更适合。最后,我们证明系统提示可以控制这些行为,尽管需要仔细评估以避免意外影响。我们讨论我们的研究结果的含义,并为负责任的法学硕士设计和评估提供建议。