人工智能驱动的语言评估的 5 种失败模式(以及如何及早发现它们)

人工智能评分承诺大规模即时反馈,但失败却是安静而自信的。一个构建人工智能分级法语考试练习的团队分享了他们在生产中遇到的五种故障模式,以及现在捕获每种故障模式的护栏。这篇文章首先发表在 eLearning Industry 上。

来源:eLearning行业 | 在线教育博客

AI 分级考试练习的制作课程

我们使用人工智能对法语口语和书面语进行评分。我们的学习者准备加拿大永久居留所接受的语言考试,这意味着错误的分数不会造成学术上的不便。人们根据我们报告的水平预订考试日期并做出家庭决定。

这种压力教会了我们一些不舒服的事情:当人工智能评估失败时,它很少会明显失败。它会礼貌地失败,并附上一个可靠的号码。以下是我们在生产中遇到的五种故障模式,以及我们现在为每种故障模式设置的人工智能护栏。它们都不是特定于法语的,甚至不是特定于语言测试的。如果您的 L&D 团队通过模型获得了任何分数,无论是认证测验还是技能评估,其中的某些版本正在等待您。

1. 模型对沉默进行自信评分

我们最糟糕的制作事件始于麦克风从未捕捉到音频的学习者。录音中一片寂静,或者接近寂静。语音转文本模型没有返回空的文字记录。它返回真实的句子。

语音模型是在带字幕的媒体上进行训练的,因此当它们什么也没听到时,其中一些模型会生成训练数据中最常伴随安静音频的文本:字幕学分。我们的节目返回了法语广播字幕“Sous-titrage Société Radio-Canada”,以消除死气沉沉的气氛。然后,评分模型会尽职尽责地将该短语作为口语样本进行评估,并返回量表上的最低级别。几十名学习者(其中一些人的演讲能力很强)被告知,他们的法语水平是初级水平,因为他们的麦克风坏了。

教训并不是模型不好。每个组件都表现合理。失败之处在于没有任何组件负责询问是否有任何内容需要评分。

人工智能护栏

2. 你的问题库有模型从未见过的模式

3. 错误原因的正确答案

4. 管道比模型更容易出现故障

5. 准确的反馈不会改变任何内容

自己的评估应考虑哪些因素