详细内容或原文请订阅后点击阅览
人工智能探测器和公平性差距:在信任分数之前先阅读证据
本博客由 MAAS EdTech 创始人兼首席执行官 Anh Do 友情撰写。询问人工智能检测器学生是否使用了聊天机器人,它会给你一个自信的答案。询问研究人员探测器是否正确,信心就会消失。当 7 个广泛使用的检测器在 91 篇论文中进行测试时 […]后 AI 检测器和公平性差距:在信任之前先阅读证据,分数首先出现在 HEPI 上。
来源:HEPI博客人工智能探测器和公平性差距:在信任分数之前先阅读证据
本博客由 MAAS EdTech 创始人兼首席执行官 Anh Do 友情撰写。
询问人工智能检测器学生是否使用了聊天机器人,它会给你一个自信的答案。询问研究人员探测器是否正确,信心就会消失。当七个广泛使用的检测器对母语不是英语的人为托福(标准英语水平考试)撰写的 91 篇论文进行测试时,他们错误地将平均 61% 的真实人类写作标记为人工智能生成的。对于美国学生用母语撰写的论文,同样的工具要准确得多。
这种差距应该会影响大学如何使用这些工具,因为它表明错误不是随机的。许多检测器的工作原理是测量一篇文章的可预测性:变化多端、令人惊讶的措辞看起来很人性化;而平淡而重复的措辞看起来是机械制造的。用第二语言仔细写作的人往往会使用较小范围的单词和句型,因此勤奋的多语言学生的习惯就是工具像机器人一样阅读的习惯。最无力接受不当行为指控的人是这些工具最有可能指控的人。
这并不意味着探测器总是错误的,并且承认它们不正确的地方更有力。一项针对 160 份真实学生作业的研究发现,根本没有误报,每一篇人类论文的人工智能可能性均为零。供应商已经发表反驳来捍卫他们的工具,更广泛的评估发现错误率在不同工具之间跳跃,而不是一致很高。总而言之,诚实的解读并不是检测永远不起作用,而是没有通用的准确率数字:误报率随着工具、样本和设置的不同而波动很大,而最糟糕的恰恰是后来学习英语的学生的写作。
