AI驱动的元数据修正与协调

元数据协调(标准化标签、标识符和格式,以便数据集可以协同工作)仍然主要是手动的。这篇文章展示了人工智能驱动的元数据校正在实践中如何工作,涵盖两种方法:人机交互验证和自主代理驱动的工作流程,以及生产部署的治理注意事项。

来源:亚马逊云科技 _机器学习

随着数据收集和数据生成加速,我们生成原始数据的能力与标准化数据的能力之间的差距持续扩大。如果没有自动化,这种差距将成为关键的瓶颈,延迟分析、使解释复杂化,并限制共享数据集的全球价值。

元数据协调(标准化标签、标识符和格式,使来自不同来源的数据集能够协同工作)在很大程度上仍是手动的。AI驱动的元数据校正和协调提供了一条前进的道路,将元数据管理从耗时的责任转变为随数据量扩展并支持开放科学而非阻碍它的流程。

在本文中,我们将演示AI驱动的元数据校正在实践中如何运作,探讨两种实施方法(从人在回路中的验证到完全自主的智能体驱动工作流),并为在您的组织中部署这些解决方案提供治理考虑。

为了应对这一挑战,我们在AWS上开发了一个集中式元数据校正和协调工作流,旨在支持跨不同元数据源的一致性、互操作性和准确性。该系统使用Amazon Bedrock进行基于大型语言模型的模式对齐和校正建议,使用Amazon Simple Storage Service进行模式和结果存储,使用Amazon DynamoDB进行作业跟踪,使用Amazon Cognito进行身份验证,并使用Amazon Elastic Container Service进行计算。该工作流包括一个协调包,用于对齐元数据模式、验证数据完整性并生成校正建议。

元数据校正和协调系统作为一个循环工作流运行,引导数据通过验证,生成建议,并将控制权返回给用户进行最终批准。下图说明了这一高级流程:

图1:元数据校正和协调工作流

如图所示,该过程始于用户上传其元数据文件。然后,系统执行两个并行的验证流:模式对齐验证列结构是否符合预期格式,而元数据字段验证检查各个字段值是否符合要求。当检测到问题时,系统会生成有针对性的校正建议并将其呈现给用户,用户对更改拥有最终决定权。这种人在回路中的方法让自动化加速流程,同时保留研究人员的控制和领域专业知识。