TReNDS 如何使用 Amazon Bedrock 自动进行根本原因分析

乔治亚州立大学的研究中心 TReNDS 在 Amazon Bedrock 和开源 Strands Agents SDK 上构建了一个代理 AI 管道,可以实时自动调查生产错误,将根本原因分析从 15 到 30 分钟的手动工作减少到 60 秒以下。

来源:亚马逊云科技 _机器学习

这是与佐治亚州立大学 TReNDS 中心的 Vitaly Omelchenko 共同撰写的客座文章。

在神经影像和数据科学转化研究中心 (TReNDS),佐治亚州立大学、佐治亚理工学院和埃默里大学的联合中心,我们开发并应用先进的分析方法和神经信息学工具进行大脑健康研究。自 2019 年以来,我们一直在 Amazon Web Services (AWS) 上运行我们的基础设施,多年来我们构建了一组多样化的应用程序,包括研究工具和 API,所有应用程序都在 Amazon Elastic Kubernetes Service (Amazon EKS) 上运行,并使用 FluentBit 将日志发送到 Amazon CloudWatch。

随着我们的应用程序的增长,我们需要调查的错误量也随之增加。当我们开始探索 Amazon Bedrock 时,我们看到了我们一直想要的机会。我们可以自动化事件响应中最耗时的部分,即根本原因调查本身。

在这篇文章中,我们分享了我们在 TReNDS 的生产中构建和使用的架构。它结合了 Amazon CloudWatch 订阅过滤器、AWS Lambda、Strands Agents SDK 和 Amazon Bedrock 来实时检测错误,使用来自 GitHub 的日志上下文和源代码丰富错误,并向我们的团队提供由 AI 驱动的根本原因分析。

本文中的架构和建议反映了我们团队在 TReNDS 中心的经验,并不代表佐治亚州立大学、佐治亚理工学院或埃默里大学的官方指导。

我们想要解决的问题

像许多团队一样,我们有适当的警报和监控。我们知道事情何时破裂。然而,知道某件事失败了和理解失败的原因是两回事。我们的工程师仍然必须打开 Amazon CloudWatch Logs,读取堆栈跟踪,找到相关的源文件,并在心里跟踪执行路径。对于简单错误,这需要 15-30 分钟。对于涉及多个服务的复杂问题,需要更长的时间。