Jumio 如何在 AWS 上构建实时特征存储

了解 Jumio 如何使用 Amazon SageMaker Feature Store、Amazon Managed Service for Apache Flink 和 Amazon Kinesis Data Streams 在 AWS 上构建集中式实时特征存储。该架构提供了 100 毫秒以下的欺诈检测功能,每年可节省约 120,000 美元。

来源:亚马逊云科技 _机器学习

如果您正在管理实时特征存储,您可能会面临数据重复、特征工程、特征一致性、手动部署和延迟等挑战。Jumio 是一家身份验证提供商,可帮助企业检测欺诈并建立数字信任。为了实时提供这些服务,Jumio 的机器学习 (ML) 模型需要一个实时特征存储来解决这些挑战。我们使用 Jumio 的案例研究向您展示如何构建实时特征存储。此架构模式适用于需要低于 100 毫秒延迟才能进行实时预测的 ML 用例。

在这篇文章中,我们向您展示架构、设计权衡及其对 Jumio 工作负载的影响。您将了解如何使用 Amazon SageMaker Feature Store、Amazon Managed Service for Apache Flink 和 Amazon Kinesis Data Streams 等服务来优化 AWS 上的 ML 功能管理。

问题陈述

在构建实时特征存储之前,特征工程和部署通常是分散且低效的。这导致了以下问题:

  • 数据重复:团队维护自己的离线特征存储,导致数据冗余和特征定义不一致。
  • 手动生产部署:团队手动重新实现在生产代码(Java 或 Python)中离线训练的功能,这增加了不匹配和错误的风险。
  • 延迟挑战:欺诈检测需要立即访问功能,包括上游模型输出。
  • 延迟事件处理:某些事件类型延迟到达或以不规则的模式到达。由于审核流程延长,它们可能会在初始活动后不久出现,也可能在几周后出现。
  • 由于 Jumio 的业务围绕身份验证解决方案展开,因此及时、准确的欺诈检测非常重要。 Jumio 的 ML 模型在很大程度上依赖于功能来做出明智的决策。为了应对这些挑战,Jumio 需要一个集中的、可重用的实时特征存储。

    技术要求

    架构