详细内容或原文请订阅后点击阅览
在 Amazon SageMaker Feature Store 中批量写入和发现记录
Amazon SageMaker Feature Store 现在支持两个新 API:BatchWriteRecord 在一次调用中跨多个功能组写入最多 25 条记录,ListRecords 枚举功能组内的记录标识符。在这篇文章中,我们将通过可用于入门的代码示例来介绍每个 API。
来源:亚马逊云科技 _机器学习Amazon SageMaker Feature Store 是一个完全托管的专用存储库,用于存储、共享和管理机器学习 (ML) 模型的功能。它为实时推理提供低延迟在线服务,为历史保留和训练特征数据提供离线存储,并支持流式传输和批量摄取模式。
随着机器学习平台的成熟,两个运营差距反复出现。首先,运行高吞吐量功能管道的团队必须循环调用 PutRecord(它将单个功能记录写入在线商店)。这意味着每个功能组每条记录一次 API 调用,这会产生连接开销和较差的吞吐量。欺诈检测管道每秒在五个功能组中摄取 10,000 条记录,必须每秒维持 50,000 次单独的 API 调用,才能保持功能最新。第二个挑战是使用内存存储层的团队无法浏览或枚举在线商店中存储的记录。如果记录标识符因错误或管道故障而丢失,这些记录将永久无法恢复。内存层没有可供依赖的离线存储,没有要运行的 Amazon Athena 查询,也没有 API 来发现存在的内容。
今天,我们宣布推出两个适用于 Amazon SageMaker Feature Store 的新 API:
在这篇文章中,我们将通过可用于入门的代码示例逐步介绍每个 API。
先决条件
要按照本文中的示例进行操作,您需要:
批量写入记录
单记录摄取的挑战
BatchWriteRecord 的工作原理
API 保留与 PutRecord 相同的基于 EventTime 的排序:
或
