构建代理就绪的数据仓库:传统架构的错误之处

授予 AI 代理访问数据仓库的权限并不会自动使其为代理做好准备。真正的挑战在于教导代理数据的含义以及数据何时足够可靠可以使用。文章《构建代理就绪的数据仓库:传统架构做错了什么》首先出现在《走向数据科学》上。

来源:走向数据科学

是为人类检查点而设计的。工程师准备数据,分析师制定查询,仪表板显示批准的指标,然后高管决定下一步。

人工智能代理削弱了这个检查点。

数据代理可以检查元数据、选择数据源、编写 SQL 并使用结果来建议后续步骤。有些系统还可以调用触发工作流程或修改活动的工具。因此,数据仓库成为可以根据查询结果采取行动的系统的一部分。

这正是许多旧的数据仓库架构无法解决的问题所在。代理可以生成有效的 SQL 并正确计算请求的指标。但是,它仍然可能建议错误的操作,因为虽然仓库提供数据,但它不提供告诉代理如何使用该数据或指标的业务规则。

可查询仓库不会自动为代理做好准备

乍一看,复杂的云数据仓库可能看起来支持人工智能。数据集中、管道监控、权限配置、表格有描述。此类措施有利于准入。但是,他们不保证代理会按照企业预期的方式读取数据。

模式可以告诉代理活动成本是一个数值。但它没有解释是否包含代理费、货币是否已标准化,或者退款是否已被扣除。也不显示最新的转换数据是否已完全处理。

当前的 BigQuery 数据代理依赖于选定的知识源和元数据以及特定于用例的查询处理指令。他们不仅仅依赖于表名。自然语言分析需要针对业务如何定义每个指标制定书面规则。

当正确的 SQL 产生错误的决策时

根据我在多源活动分析中遇到的模式考虑一个复合场景。

传统治理只能解决部分问题