通过 ML 主动学习减少人工注释

在人类时间昂贵的世界中,仅在真正必要时才学习如何使用它《使用 ML 主动学习减少人类注释》一文首先出现在《走向数据科学》上。

来源:走向数据科学

主动学习的目的是选择信息最丰富的未标记样本,并只为这些样本请求标签。通过交互式查询用户(或其他一些信息源)来标记新数据点,我们可以使用更少的标签来训练模型。本教程将引导您完成主动学习工作流程,并向您展示如何实现三种常用的查询策略:不确定性采样、基于多样性的采样和委员会查询。我们提供这些方法的直观解释以及 Python 实现。最后,我们将讨论每种方法的优缺点,以及当注释昂贵/稀缺时如何将它们一起使用来创建强大的人机循环系统。

内容

  • 什么是主动学习
  • 主动学习技巧
  • 主动学习的优点和缺点
  • 结论
  • 1. 什么是主动学习

    主动学习是一种机器学习方法,其中学习算法能够交互式地查询用户(或某些其他信息源)以获得新数据点所需的输出。在主动学习中,您不需要向学习算法提供大量标记示例,而是允许模型首先查看未标记的数据点。它将选择想要学习的数据点,并将这些数据点发送给人类进行标记。您循环重复此过程。使用主动学习,您通常可以通过更少的带注释的训练示例获得与正常监督学习相当的性能。主动学习周期见图 1。

    特别是当人类处于循环中时,这种技术会大放异彩。该模型不是让注释器标记数千个简单/冗余的样本,而是显示最不确定的示例或哪些示例显得奇怪/异常,然后让注释器标记这些示例。

    1.1。从不确定或极端情况样本中学习

    2. 主动学习技巧

    2.1。不确定性采样

    2.1.1.通过交叉验证训练第一个模型

    优势