半监督学习简介

关于半监督学习、不同算法所采用的方法以及使用未标记数据的局限性的入门读物。半监督学习简介一文首先出现在《走向数据科学》上。

来源:走向数据科学

一种解决分类问题的机器学习方法,即,当您必须确定特定数据点的类别或类别时,您可能会考虑收集一个训练数据集,其中每个数据点都标有其相应的类别。

这一系列机器学习算法称为监督学习。

然而,在训练机器学习模型时,数据是最大的瓶颈之一,其他瓶颈包括训练模型所需的计算资源和时间。

人们还可以认为所有这些限制都等同于金钱。例如,您需要资金来获取或投资创建更多数据,为更高的计算量配置硬件,并且您花费在培训和调整模型上的时间也代表了商业机会成本。

除此之外,还有几个问题领域很难获得高质量的标记数据。例如,获取图像分类或药物发现的数据既困难又昂贵。

为了解决现实世界中标记数据稀缺的问题,研究人员开发了一系列机器学习算法,除了使用标记数据之外,还可以使用未标记的数据点来训练分类器。

这一系列机器学习算法称为半监督学习。

监督学习与半监督学习

一个典型的监督学习问题在数学上是这样描述的

您有一组大小为 l 的标记数据点,并且每个数据点 (xi, yi) 都是空间 X 中的一个对象,因此每个 xi 属于空间 X 并与标签 yi [1] 关联。

在分类问题的情况下,标签 yi 是该数据点的真实标签或基本事实。

训练模型后,您可以给它一个以前从未见过的数据点 x*,模型将能够预测其标签 y*。

  • 标记数据点,即已知真实标签(ground thruth)的数据点
  • 因为更多的数据就等于更好的算法,不是吗?