详细内容或原文请订阅后点击阅览
我们仍然不知道人们如何真正使用人工智能
人工智能研究人员表示,Anthropic 和 OpenAI 等人工智能公司定期发布有关人们如何使用 Claude 和 ChatGPT 等产品的报告,但他们只发布他们希望我们看到的数据。斯坦福可信赖人工智能研究中心的计算机科学博士生安卡·鲁埃尔 (Anka Reuel) 表示:“没有独立来源证实这一点。”
来源:MIT Technology Review _人工智能此外,研究人员标记为敏感的交流(即具有潜在有害或受限内容的交流,包括性骚扰和仇恨言论)变得不那么频繁。这可能表明平台普遍部署了更有效的保障措施。
AI Observatory 还发现,不同模型的主题、交互风格、对话结构以及敏感用例的可能性和类型都不同。
例如,研究人员发现人们更频繁地使用 Grok 和 Gemini 进行信息检索。尤其是 Grok,它在新闻和政治信息方面尤其受欢迎,但它也是错误信息往往集中的地方。 (这与其他研究一致,这些研究表明错误信息在 Grok 上很容易扩散。xAI 没有回复评论请求。)
与此同时,人们更有可能使用 Anthropic 进行编码,使用 Gemini 进行社交和角色扮演,使用 ChatGPT 进行家庭作业帮助。
同一型号的不同版本之间甚至存在差异。研究人员发现,当 ChatGPT 由 GPT-3.5 提供支持时,人们与 ChatGPT 的对话时间较短,而当使用 GPT-4o 时,人们与 ChatGPT 的对话时间更长且迭代次数更多——考虑到该版本因导致情绪成瘾而闻名,这是有道理的。
然而,公司的报告并没有倾向于捕捉他们自己的模型之间甚至内部的这些细微差别。 “没有哪家公司的报告能够讲述全部故事,”刚刚从麻省理工学院媒体实验室毕业的博士生 Shayne Longpre 说道,他与 Reuel 共同领导了这项研究。
但与大型实验室本身能够访问的数据相比,这些对话只是杯水车薪。例如,最新的人类经济人工智能指数是基于对 100 万条克劳德对话的分析; OpenAI 关于人们如何使用 ChatGPT 的报告分析了 150 万个对话。
