详细内容或原文请订阅后点击阅览
你的学习仪表板知道的比它决定的要少
学习仪表板可以将准确的活动轨迹转化为远远超出证据的结论。随着人工智能将这些推论转化为概况、路径和决策,L&D 必须区分系统观察到的内容与它们推断的内容,以及允许它们做出的决定。这篇文章首先发表在电子学习行业上。
来源:eLearning行业 | 在线教育博客从活动跟踪到 AI 驱动的决策
想象一下学习者在培训模块结束时完成简短的在线评估。十个问题,八个正确答案。到目前为止没有什么异常。但这八个答案可能不仅仅是一个评估结果。他们可以提高熟练程度分数,改变学习路径,使学习者不再获得额外支持,并最终有助于判断是否适合某个角色。
八个正确答案可以走得惊人的远。
他们可以提高熟练程度分数,改变学习路径,取消学习者的支持,并最终有助于判断是否适合某个角色。每一步都可能显得合理。基础数据甚至可能是完全准确的。然而,最终的结论可能远远超出证据支持的范围。
系统实际观察到的内容很窄:可能在进入模块 15 分钟后正确提交了 8 个答案。它最终可能代表的意义更大:学习者理解该主题,拥有特定水平的技能,可以独立执行,并准备好继续前进。在这两个陈述之间存在着学习分析中最不明显的部分之一。
这个解释步骤并不在学习分析之外;它是学习分析的一部分。它是该领域本身的一部分。SoLAR 2025 的定义明确地将学习分析描述为有关学习者及其学习的数据的收集、分析、解释和交流。这里重要的词是解释。数据到达时并不附带其教育意义。
人工智能正在使隐藏的通道变得更快、更重要。现在,在有人询问原始证据的实际合理性之前,暂定信号可以更新个人资料、生成路径、触发注册、删除支持干预或进入另一个系统。因此,核心问题不是组织可以收集多少学习数据。问题在于它有权赋予它们多少意义——以及多少后果。
数据可能是正确的,但结论仍然薄弱
关于学习数据的讨论通常从数据质量开始。记录是否完整?时间戳可靠吗?活动归因是否正确?这些问题很重要,但它们只是第一层。
想象一下数据是完美无缺的。一名学习者确实正确回答了八个问题。该平台确实记录了 2 个事件之间的 15 分钟。该模块确实是按照其规则完成的。没有什么是不准确的。
80% 的分数有力地证明了在这些条件下十个答案中有八个是正确的。根据评估设计,它也可能是提供更高级材料的有用证据。它不会自动表现出持久的理解、独立的表现或对相应决策的准备。
任务时间使问题变得尤为明显。如果一个事件在 10:02 记录,下一个事件在 10:17 记录,则系统知道 2 个事件相隔 15 分钟发生。它不知道这 15 分钟发生了什么。 Kovanović 及其同事的一项研究表明,估计任务时间的不同方法可以极大地改变学习分析结果 [1]。
因此,问题不仅仅是可靠性(测量是否被一致地记录或应用),而是有效性:证据是否真正支持其附加的解释和使用。Philip Winne 对基于轨迹的学习分析的分析更正式地表达了同样的观点:在决定应该观察什么以及这些观察可以证明哪些推论和行动时,理论是不可避免的。
表述的精确性并不是证据的强度。 100% 的完成率、82% 的熟练度分数,或者诸如“高级”之类的标签都可以看起来像是事实。但当它被要求回答一个它从未设计要回答的问题时,该指标就会产生误导。
仪表板背后的隐藏链
学习者执行的活动和系统采取的操作之间存在一条仪表板很少完全可见的链:
活动跟踪 → 指标 → 推理 → 配置文件 → 决策/行动
跟踪记录了可观察到的内容:资源被打开、答案被提交、视频暂停、活动完成。技术标准使这种区别出奇地清晰。当前的 ISO/IEC/IEEE xAPI 标准旨在将体验活动数据传送到学习记录存储,而 1EdTech Caliper [2] 定义了捕获和描述学习活动和产品使用数据的常用方法。这些基础设施可以记录发生的事情。他们本身并没有确定该事件对学习意味着什么。
指标组织跟踪:80% 正确,12 分钟,3 次尝试,查看了 5 个资源。然后,推论将意义赋予该指标:学习者理解、正在努力、正在投入、已经掌握了一项技能,或者已经准备好接受更困难的任务。个人资料使该推断稳定为与人相关的属性。最后,决策对表示进行一些操作:推荐内容、更改路径、发送警报、删除支持或更新另一个系统。
第一阶段描述一个事件。后期阶段越来越多地描述一个人。
每个过渡都包含一个设计选择。哪些事件算数?它们是如何聚合的? “基础”和“高级”的界限是什么?有哪些替代解释符合相同的模式?推断属性的有效期有多长?谁可以采取行动?
系统未按照记录提交答案的方式发现能力。它应用了一种模型,根据该模型,特定模式被视为能力的证据。该模型可能是合理的。它仍然是一个模型。
当假设成为概要时
个人资料具有说服力,因为它们是由名词构建的:技能、兴趣、差距、优势、准备情况、熟练程度。名词看起来很稳定。产生它们的动词更难看到:观察、聚合、加权、比较、预测、推断。
配置文件可能会显示“数据分析 - 高级”。它很少以同样突出的方式展示的是“根据两项评估分数、三项已完成的活动以及六个月前应用的加权规则推断出来的”。然而,出处改变了信息使用的可信度。
这不仅仅是对语言的哲学关注。 2023 年对学习分析和知识会议论文以及《学习分析杂志》文章的回顾发现,71.1% 的实证文章没有包含任何学习成果衡量标准。结果并不表明学习分析无法衡量学习。它确实说明了为什么学习者数据、活动数据和学习证据不应被视为可互换的类别。
人工智能不会创造飞跃。它消除了暂停。
基于规则的系统早已将指标转化为行动:分数低于 60%,分配补救措施;完成一个模块,解锁下一个模块。人工智能并没有发明从推理到结果的转变。
将证据与结果相匹配
一个有用的设计原则如下:证据的强度和多样性应该随着结果的权重而增加。
参考文献:
一旦推理进入配置文件,它也可以开始形成接下来的证据。被归类为高级的学习者会获得不同的机会。被标记为需要支持的学习者会收到另一条途径。然后,未来的活动发生在部分由早期分类构建的环境中,产生再次提供配置文件的新数据。因此,如果一个假设的起源、不确定性和可逆性从视野中消失,它就可以自我强化。
变化的是可以组合多个步骤的速度、比例和不透明度。系统可以分析配置文件、识别明显差距、生成评估、评估响应、更新配置文件、选择下一个资源并触发另一个工作流程。 “模型思考”和“系统行为”之间的距离可以变得非常短。
这很重要,因为推论的质量不能与授予它的权威分开。 NIST 的人工智能风险管理框架将有效性、可靠性、问责制、透明度、可解释性和可解释性视为值得信赖的人工智能的上下文相关特征 [3]。在学习系统中,上下文包括附加到输出的结果。
Jisc的《学习分析实践守则》从学习数据方面得出了一致的结论:机构应明确与分析相关的目的、数据源、指标、流程、使用边界和干预措施。换句话说,这条链条在变得重要之前应该是清晰易读的。
人工智能建议留有暂停的空间:学习者或管理者可以接受它、拒绝它或要求其他观点。自动化操作可以消除这种停顿。一旦系统被授权根据自己的结论采取行动,“这个推论有多好?”必须与“这个推论可以做什么?”一起问。
相同的证据对于一个目的可能是充分的,但对于另一个目的却是不充分的。八个正确答案可能足以建议可选的高级资源,特别是如果学习者可以忽略建议或返回到先前的活动。他们可能还远远不足以证明能力、撤回必要的支持、改变官方职业档案或为担任某个角色做好准备。
将会产生什么后果,谁可以审查、纠正或逆转它?
这些问题并不妨碍自动化。他们使自动化变得相称。
避免证据成为判决
[1] 任务时间估算重要吗?对学习分析结果有效性的影响
[2] 卡尺分析
[3]人工智能风险管理框架
来源:
学习分析可以揭示模式、引导注意力、改进资源设计并支持更好的决策。人工智能可以跨系统连接信息并更快地响应新出现的需求。答案不是拒绝任何一种能力。答案是保留观察、推理和决策之间的区别。
成熟的分析环境应该使重要的结论可追溯到其证据,在不确定性真实存在时保持不确定性可见,并使配置文件可供修改。它还应该认识到,适合指导的指标可能不适合判断。
仪表板应该帮助我们决定在哪里查看。它不应该悄悄地决定什么才算知道。八个正确答案可以保留八个正确答案:有用的、可解释的证据,可以证明下一个问题、建议或进一步评估的合理性。它们不必成为对学习者的判断。
