利用 AWS 上的生成式 AI 实现支持运营的现代化和扩展

了解如何在 AWS 上构建基于 AI 的生成式支持运营平台,将培训视频转换为结构化 SOP,应用检索增强生成来指导故障单解决,并使用机器学习来预测 SLA 风险并确定工作优先级。

来源:亚马逊云科技 _机器学习

扩展支持业务需要处理不断增加的票务量、满足严格的服务级别协议 (SLA)、适应不断变化的合规性要求以及维护很快就会过时的文档,所有这些都无需按比例增加员工人数。在许多团队中,解决问题单所需的知识分散在标准操作程序、记录和部落专业知识中,迫使分析师花费大量时间寻找指导而不是解决问题。

为了解决这些限制,团队可以使用 AWS 上的生成式 AI 从操作工作流程中捕获知识,在故障单解决过程中应用这些知识,并在风险影响 SLA 之前将其暴露出来。这种方法不是单独优化单个工单或文档,而是侧重于改进决定工作如何在团队之间流动的基础流程。本文演示了如何在 AWS 上设计和实施基于 AI 的生成式支持运营解决方案,该解决方案可自动根据培训视频创建标准操作程序 (SOP),应用检索增强生成 (RAG) 来指导故障单解决,并使用机器学习 (ML) 来优化工作负载分配并预测 SLA 风险。该解决方案还通过代理工作流程自动执行操作任务,例如工单标记、评论和状态更新,同时保持人员参与控制和准确性。这篇文章通过实际操作用例说明了该架构,并展示了该解决方案如何适用于其他行业,例如金融服务、医疗保健、物流、制造和能源。

运营挑战

企业支持操作依赖于流程知识。然而,随着组织的发展,这些知识在文档、人员和工具中变得支离破碎。结果不是一个单一的故障点,而是一连串的小效率低下,最终导致解决速度缓慢、质量不一致和反应性决策。

文档存在,但知识不会持久

支持团队维护数百或数千个 SOP,描述如何处理请求、批准和系统更改。然而,这些通常是根据特定功能的需要而开发的,而不是从系统角度设计的。每个团队都会记录自己的流程部分,但无法了解该工作如何连接到上游输入、下游交接或跨职能依赖关系。结果是文档涵盖了各个任务,但很少揭示工作实际上是如何端到端流动的。当流程发生变化时,更新会在本地发生(如果发生的话),从而扩大了记录内容与真实内容之间的差距。同时,大多数操作知识都是通过培训电话、演练和故障排除课程来共享的。会议结束后,知识仍然被锁在长长的录音中。几个月后,团队经常会重新观看过去的会议,只是为了重建任务的执行方式。组织不是在积累知识,而是反复重新发现知识。为了保持文档的准确性,团队必须直接从运营活动中获取知识,并以结构化、可搜索的格式保存它。

门票到达的速度比找到指南的速度还要快

工作已执行,但进程不可见

优先事项往往确定得太晚

领导者看到的是报告,而不是运营

解决方案概述

为了解决手动文档、分散的票证处理和反应性工作负载管理的局限性,该解决方案将执行和分析集成到 AWS 上的单个操作系统中。

1.1 视频转SOP

结论

每张收到的工单都必须经过解释并与正确的程序相匹配,然后才能开始工作。当票证到达的速度快于分析师处理它们的速度时(违反了精益六西格码的节拍时间原则),系统就会累积积压并导致延误。分析师花费大量时间在维基、共享驱动器、聊天线程和录音中搜索 SOP,以确定正确的步骤。即使找到了正确的 SOP,它通常也只涵盖一个职能部门对流程的看法。分析师必须在心里将多个文档、部落知识和过去的经验拼接在一起,以重建完整的解决路径,这项任务在很大程度上取决于个人的专业知识而不是组织设计。在许多情况下,票证被退回是因为解决了错误的问题或解决者没有掌握完整的情况。实际上,只有部分程序被正式记录。剩下的部分则以部落知识的形式存在,由少数经验丰富的分析师掌握。初级员工依赖升级,而高级员工则成为常规问题的瓶颈。系统必须根据请求本身的内容自动识别指导,而不是要求人们手动查找指令。

即使工单成功处理,团队也很少看到工作实际上如何跨角色和系统流动。有些请求需要多次批准和跨团队协调,而另一些请求只需几分钟即可解决。从表面上看,两者都只是简单的门票。如果无法了解交接和依赖关系,管理人员就无法区分高工作负载和高复杂性。工作分配变得不均匀,分析师承担的工作量不成比例,指导取代了标准化。提高一致性需要了解工作在组织中的移动方式,而不仅仅是存在多少票证。这种不可见性是 SOP 的创建方式(逐个功能)的直接结果,而没有映射端到端流程。当文档不能反映完整的工作流程时,操作视图也不能反映。

服务目标取决于在违反截止日期之前识别哪些票证存在风险。然而,虽然客户关系管理 (CRM) 系统中通常会根据影响和紧急程度自动分配优先级,但这些输入通常由分析师根据工单详细信息进行评估,而不是根据可衡量的指标得出。这一挑战因接收时的数据质量而变得更加复杂:当很大一部分票证以不准确或不完整的信息进入系统时,即使是经验丰富的分析师也很难评估真正的紧迫性。因此,高影响力(或高可见度)的请求会与常规请求竞争,直到出现明显的延误。团队通常只有在绩效指标下降后才发现问题。当事态升级时,违规行为已经发生。为了主动行动,团队需要早期信号来表明哪些请求最有可能错过目标。

该解决方案分为两个紧密耦合的层:分析师用于日常工作的运营智能工作区,以及分析师和领导者用于实时洞察和优化的分析和决策智能层。第二层直接在工作流程中呈现可操作的情报,因此一线分析师可以根据连接的数据流了解每张票证的真正影响和紧迫性,同时还为领导者提供用于监控绩效和指导决策的聚合视图。

图 1:AWS 上支持运营解决方案的端到端架构

  • 图2:用于上传录音的SOP Generator界面
  • 关于作者
  • 随着时间的推移,碎片化的知识、不均匀的工作量和被动的优先级会相互强化。专业知识集中在少数人身上,入职速度变慢,并且扩展需要增加人员而不是提高流程效率。领导者通常依靠回顾性报告来了解绩效。然而,报告解释了发生的事情,而不是即将发生的事情。如果没有持续的运营可见性,瓶颈就会被发现较晚,容量决策也会被延迟。因此,扩展支持运营需要了解流程设计决策(SOP 结构、审批路径、移交点)如何转化为运营结果,例如解决时间、SLA 风险和返工率。这意味着实时的运营洞察和指导,而不仅仅是历史指标。
  • 1. 运营情报工作区 (Amazon Bedrock 和 AWS Strands Agents SDK) – 该层充当分析师和运营商的主要执行环境,将文档、票据分析和价值流情报汇集在一个统一的界面中。它由三个核心功能组成:

  • 1.1 视频到 SOP:该工具通过 Amazon Bedrock 上模型调用的多步骤管道,自动将训练记录和系统演练转换为结构化 SOP。然后,它将视觉上下文、口头指令和界面交互转换为带有嵌入式屏幕截图和验证指南的分步过程。
  • 1.2 工单分析器:该组件使用自然语言处理、语义检索和 RAG 来分析收到的工单,以识别相关过程并生成上下文解决指南。该系统将检索到的 SOP 和政策文档与 Amazon Bedrock 上的基础模型相结合,生成符合组织标准的准确建议。此外,它还使用通过 AWS Strands Agents SDK 构建的代理工作流程,其中多个自治代理协作执行操作任务,例如票证标记、评论和状态更新。它在人机交互框架内执行这些操作,以支持准确性、控制和合规性。
  • 1.3 价值流智能:解决方案工作流程以交互式泳道图的形式呈现,显示工作如何跨团队和系统移动,突出持续改进的瓶颈。它连接上游和下游流程的数据集。利益相关者可以快速识别延迟、审批摩擦和协调差距。
  • 2. 分析和决策智能层 (Amazon Quick) – 分析层通过基于 Amazon Quick 构建的仪表板,为领导者提供工作负载分布、工单量和 SLA 风险的集中可见性。它使团队能够监控运营状况、识别新出现的风险并主动确定工作优先级。这一层由三个核心能力组成:

    2.1 工作负载管理和容量可见性:仪表板显示工单如何按数量和复杂性在分析师之间分配,使用可用性指标和趋势视图来突出显示过载和利用率不足。

    2.2 基于 ML 的工单分类和 SLA 风险预测:ML 模型将工单分为功能类别并分配 SLA 风险评分,呈现高风险案例,以便团队可以根据预测的影响确定优先级。

    2.3 嵌入式代理体验:智能 Amazon Quick 代理为工作负载重新平衡和优先级排序提供可操作的建议,这些建议通过具有完整审计跟踪的受监督工作流程进行审查和执行。

    多模态视频理解

    结构化 SOP 生成

    灵活的模板和组织标准

    重要的是,这些层并不是独立的。它们形成一个复合循环。视频到 SOP 捕获了以前锁定在录音和部落专业知识中的流程知识。票证分析器应用结构化知识来指导实时解决问题。价值流智能揭示了端到端的工作流程模式,而这些模式在按功能编写 SOP 时是不可见的。每个解决的问题单和每个新的 SOP 都会增强知识库,使下一个解决方案更快、更准确。随着时间的推移,系统从记录发生的事情转变为预测接下来会发生的事情。

    以下部分描述了每个组件背后的技术设计,并解释了它们如何集成到 AWS 上的统一、生产就绪的架构中。

    运营智能工作区由三个核心功能组成:视频转 SOP、工单分析器和价值流智能。

    支持和运营团队通常依靠屏幕录制、培训课程和现场演示来传递知识。这些工件捕获了宝贵的机构专业知识,但传统上必须对它们进行手动审查并将其转化为书面程序。这个过程缓慢、不一致,并且高度依赖主题专家,常常导致文档过时或不完整。

    视频到 SOP 工具用基于 Amazon Bedrock 和高级视频理解模型构建的全自动多模式文档系统取代了手动工作流程。通过结合大规模视频嵌入、语义检索和生成建模,该工具只需几分钟即可将非结构化录音转换为可立即投入生产的 SOP。下图显示了用于上传录音并端到端生成 SOP 的 SOP Generator 用户界面。

    提取视频时,首先通过 Amazon Bedrock 使用 Marengo Embed 2.7 模型对其进行处理。该模型将视频分成小的、可配置的片段并异步处理它们,使其适合长格式视频。该模型生成密集的多模态向量嵌入,共同表示视觉内容、口语和界面上下文。除了纯文本嵌入之外,这些表示还捕获屏幕上的操作、用户意图和系统响应与操作工作流程的关系。

    系统在 Amazon OpenSearch Serverless 中对生成的嵌入进行索引,它充当系统的可扩展向量存储。这支持跨大型视频库和历史记录的低延迟相似性搜索。因此,团队可以检索相关工作流程段以进行文档更新、识别程序差距并重用现有知识资产。随着时间的推移,该检索层会将孤立的训练视频转变为持久的、可搜索的知识库。

    同时,使用 Pegasus 1.2 模型分析相同的视频内容以进行生成视频理解。这两个模型扮演着不同的角色:Marengo 处理检索,将视频编码为可搜索向量,以便可以在不断增长的图书馆中找到相关内容,而 Pegasus 处理理解、阅读视频并生成驱动 SOP 生成的结构化文本。 Pegasus 执行细粒度的视频到文本转换,生成步骤级摘要、章节分段以及操作和 UI 状态的结构化描述。它提取操作元数据,例如所需的输入、系统输出、条件逻辑和批准检查点,创建每个流程的机器可读表示。

    带有时间戳链接播放的交互式验证

    持续获取知识

    卡拉·洛伦特

    这些输出被组合成一个统一的语义模型,将时间视频片段与提取的动作和决策点对齐。应用帧采样和视觉过滤技术来选择与有意义的工作流程转换相对应的代表性屏幕截图,例如配置更改、表单提交或系统确认。这些图像会自动链接到相关的程序步骤。

    然后,它将结构化视频理解传递给 Amazon Bedrock 上提供的 Claude Sonnet 4.6 模型,该模型生成正式文档。该生成层将中间表示转换为完整的 SOP,其中包括结构化步骤序列、嵌入的屏幕截图、验证检查和预期结果。

    该系统的一个关键区别在于其交互式 SOP 预览编辑器。生成的 SOP 中的每个程序步骤都用交互式时间戳进行注释,这些时间戳对应于源视频中发生该操作的确切时刻。当审阅者选择时间戳时,原始视频会在该精确点打开,因此他们可以根据源材料实时验证记录的步骤。这在书面程序与其视频证据之间建立了直接的可追溯性链接,作为事实的来源。审阅者可以在循环中与人一起验证每个步骤,而无需擦洗整个录音。

    图 3:具有时间戳链接播放功能的交互式 SOP 预览编辑器

    编辑器还支持实时编辑:审阅者可以优化措辞、重新排序步骤或直接在浏览器中添加说明,然后将最终的 SOP 导出为嵌入屏幕截图的格式化 Word 文档。

    为了支持多样化的治理和合规性要求,该工具提供了多个内置 SOP 模板,包括综合型、快速参考型、以培训为重点的模板以及具有控制格式的 ProServe SOP,其中包括控制点矩阵、角色和职责表以及业务成果映射。团队还可以上传自己的模板文件或定义完全自定义的部分结构,生成管道会动态调整其输出以进行匹配。

    可配置的术语词典可识别团队特定的首字母缩略词、内部工具和领域词汇,从而提高文档之间的一致性并减少歧义。

    当工作流程发生变化或添加新视频时,可以生成修订后的 SOP,而无需手动重新创作。这可以在业务增长的同时扩展知识获取。

    在生产环境中,该架构将 SOP 创建时间缩短了 80%,同时通过人机交互验证和审查保持质量。除了提高效率之外,它还支持更快的入职,提高审计准备情况,并帮助关键的机构知识在人员变动的情况下仍可访问。

    1.2 工单分析器

    捕获 SOP 后,下一个挑战是在实际操作中一致地应用它们。支持票证通常带有不完整的上下文、含糊的语言以及需要手动解释的附件。分析师通常会花费大量时间搜索相关文档并验证每个步骤。

    工单分析器组件通过结合自然语言处理 (NLP)、语义检索和 RAG 来解决这些挑战,直接在工单工作流程中提供上下文指导。如下图所示,该界面将优先问题、最近的票证历史记录和上下文指导整合到一个分析师视图中。

    图 5:票据分析器的架构

    图 4:分析人员工作区中的工单分析器视图

    当新的工单进入系统时,其内容会使用大型语言模型 (LLM) 进行标准化和丰富。从自由文本字段和附件中提取关键实体、意图信号和依赖关系,同时合并操作元数据以提供额外的上下文。

    丰富的表示形式将转换为向量嵌入并存储在 Amazon OpenSearch Serverless 中。

    为了生成分辨率指导,系统应用 RAG。它首先检索最相关的 SOP、政策和历史解决方案,然后将此材料作为 Amazon Bedrock 上的基础模型的上下文提供。该模型生成基于经过验证的组织知识的分步指导,减少幻觉并支持政策调整。该部署使用 Amazon Bedrock Guardrails 进行内容过滤和接地验证,以验证生成的指南是否符合组织策略。

    除了指导之外,该系统还结合了使用 AWS Strands Agents SDK 构建的代理工作流程,其中多个自主代理协作执行操作任务,例如票证标记、评论和状态更新。这些操作是在人机交互框架内执行的,因此分析师可以在执行之前审查和批准建议,以验证准确性、控制力和合规性。

    随着新信息的出现,建议会动态更新。置信度分数突出显示需要额外审查的案例,而内置反馈机制允许分析师标记文档差距并触发知识库更新。

    下图显示了 AWS Lambda 架构的概述。

    1.3 价值流智能

    该组件将解决工作流程呈现为交互式泳道图,显示工作如何跨团队和系统移动,突出显示瓶颈、低效率和非增值活动。通过连接上游和下游流程的数据集,该系统使利益相关者能够评估工作流程是否已准备好实现自动化,并确定在扩展之前应消除、优化或保留哪些手动内容。这为持续改进提供了结构化的基础,帮助团队快速识别延迟、审批摩擦和协调差距。

    下图提供了价值流智能可视化的简化表示,以突出显示关键概念。

    图 6:简化的价值流智能可视化

    通过将执行数据与流程图连接起来,可视化工具支持根本原因分析和持续改进计划。团队可以利用这些见解来简化审批路径、减少协调开销并确定自动化机会的优先级。

    2. 分析和决策智能层 (Amazon Quick)

    虽然自动化文档和指导解决方案改善了个人工单处理,但支持领导者还需要清楚地了解工作负载分布、工单量和 SLA 风险。由 ML 驱动的运营分析组件通过基于 Amazon Quick Sight 构建的集中式仪表板提供这种可见性。

    该仪表板结合了两个核心功能:工作负载管理和基于 ML 的工单分析。它们共同使团队能够监控运营状况、及早识别风险并更有效地确定工作优先级。

    2.1 工作负载管理和容量可见性

    图 7:工作负载管理和容量仪表板

    2.2 基于ML的工单分类和SLA风险预测

    工作负载管理视图显示工单如何按复杂性在团队中的各个分析师之间分配。仪表板使用可用性指标总结了总体容量,突出显示哪些分析师正在以最佳水平运行,哪些分析师已超载。使用按工单复杂性分段的堆叠条形图显示个人的工作量分配,清楚地显示高、中、低工作量的分配情况。

    除了此视图之外,仪表板还包括每周工作量趋势,显示每个分析师的分配如何随着时间的推移而变化。这些趋势可帮助管理人员识别持续超载、利用率不足或突然的工作负载峰值,并相应地重新平衡分配。通过将这些信息集中在一个视图中,仪表板支持更加一致和数据驱动的工作负载规划。

    同时,分析系统应用 ML 模型来分析工单内容并预测工单不满足 SLA 的风险。

  • 该过程从 Amazon Redshift 查询开始,该查询提取活动票证以及计算的操作功能。数据处理层在将数据集传递到建模阶段之前执行特征工程、创建派生属性并验证数据类型。工程变量包括操作信号,例如工单开放天数、当月剩余天数、工单复杂程度、先前升级次数、历史解决模式和工作负载指标。
  • 工单首先使用基于规则的分类逻辑分为七个业务集群(例如,一般支持、异常管理、访问和权限以及帐户合并)。仪表板展示了这些集群,以提供对票证分布和工作负载构成的实时可见性。
  • 对于 SLA 风险预测,系统使用 XGBoost 模型,该模型输出表示 SLA 未命中可能性的概率分数 (0–1)。该分数缩放为 0-100 SLA 分数,并使用预定义阈值映射到风险类别:
  • 高风险:SLA 缺失的概率≥ 0.7。

    中等风险:SLA 未命中的概率 ≥ 0.4。

    低风险:SLA 未命中的概率 < 0.4。

    最后,它将结果作为带有时间戳的分区 Parquet 文件写入 Amazon Simple Storage Service (Amazon S3),并显示在 Amazon Quick 控制面板中。下图提供了如何在仪表板上可视化跨业务集群的票证分配的说明性示例。

    图 8:跨业务集群的票证分布

    专用表格突出显示了高风险票证以及状态和集群信息,使团队能够在服务水平受到破坏之前进行干预。

    分析师和经理可以根据预测风险而不是到达时间来确定工作的优先级,从而帮助团队将注意力集中在对时间最敏感的案例上。在生产环境中,这种方法通过支持对高风险票据的早期干预,有助于将 SLA 性能从 89.5% 提高到 95%。

    虽然仪表板提供可见性和预测性见解,但有效的运营需要将这些见解转化为及时的行动。为了缩小这一差距,该解决方案将代理功能直接嵌入到分析体验中。

    2.3 嵌入式代理体验

    见解通过仪表板和充当工作负载分析顾问的智能 Amazon Quick 代理呈现,为重新平衡分配和提高性能提供简洁、注重结果的建议。

    维马尔·奥克塔维斯

    拉姆查兰·卡卡拉

    Amazon Quick 代理与现有工作流程(票务系统、Slack 和电子邮件)集成,因此用户无需手动导航控制面板即可获得可操作的见解。这将分析从被动报告转变为主动决策支持。

    在所有组件中,系统都使用具有人在环控制的代理工作流程。分析师审查并批准建议的操作后,人工智能代理会执行这些操作,例如更新工单状态、路由批准或关闭工单,同时自动生成审计跟踪以进行合规性和审查。

    这种方法将自动化的效率与企业支持操作所需的安全性和责任感结合起来。

    对于许多支持组织来说,日常运营仍然围绕着寻找正确的文档、向经验丰富的同事寻求指导以及在服务水平已经面临风险后对紧急请求做出反应。团队花费宝贵的时间重新创建流程、重新发现过去的解决方案以及跨团队和系统手动协调工作。

    AWS 上基于人工智能的生成解决方案可以改变支持团队获取知识、解决故障单和管理运营的方式。该系统自动将培训记录转换为结构化的 SOP,并随着工作流程的发展而保持最新状态。当票据到达时,分析师不再需要在多个系统中搜索指令。相反,该解决方案会检索正确的过程并直接在上下文中提供分步指导。管理人员不再依赖静态报告来了解绩效。相反,他们可以实时查看谁超载、哪些票证存在缺少 SLA 的风险以及何处形成瓶颈。

    在内部试点中,这种方法产生了可衡量的业务影响。组织可以实现 4:1 的投资回报率,将不准确的工单输入从 45.3% 减少到 10%,将 SLA 性能从 89.5% 提高到 95%,并通过自动 SOP 生成将文档效率提高 80%。这些收益直接转化为更快的解决时间、更低的运营风险和更一致的服务质量。

    随着时间的推移,这会创建不同的运营模式。新员工的生产力提高得更快。高级分析师花在救火上的时间更少,而花在改进流程上的时间更多。知识得到保存和重用,而不是丢失。服务级别风险在升级之前得到解决。

    通过将 Amazon Bedrock 上的多模式 AI、RAG 和 Amazon Quick 中的运营分析相结合,该解决方案将日常支持活动转变为持续学习和改进的源泉。每一个解决的问题都会强化知识库。每个工作流程更新都会改进未来的指导。每个绩效信号都有助于团队更有效地工作。

    迈出通过支持运营实施这些功能的第一步。立即联系我们,了解这些创新如何提高您组织的效率、可靠性和长期卓越运营。

    Carla 是 AWS 的高级生成式 AI 主管,专门构建人工智能驱动的系统,将复杂的操作流程转变为可扩展的数据驱动的工作流程。她拥有麻省理工学院的双学位(计算机科学硕士学位和 MBA),从事工程和战略交叉领域的工作,将生成人工智能、代理架构和机器学习系统方面的深厚技术专业知识与流程工程原理相结合,以产生可衡量的业务影响。她的工作重点是使用 Amazon Bedrock、多模式 AI 和分析来设计生产级解决方案,以优化整个 AWS 的运营。

    拉古·拉亚萨姆

    Vimal 是 AWS 的应用科学家,专门从事流程优化,将精益六西格码黑带专业知识与数据科学相结合,以推动业务转型。他专注于重新设计复杂的工作流程和开发代理人工智能解决方案,以提高运营效率和决策。在加入 AWS 之前,他曾与 GE、Wipro 和丰田汽车等组织合作,提供大规模的流程改进。 Vimal 带领团队实现了 CMMI 5 级,并在收入增长、运营绩效和客户满意度方面产生了可衡量的影响。他热衷于将人工智能/机器学习与精益六西格码方法相结合,以实现可扩展的高质量运营。

    Ramcharan 是 AWS 的数据科学家,拥有 UCLA 和 OSU 的管理和信息系统硕士学位。他热衷于使用 AI/ML 和数据科学来解决复杂的业务挑战,并成功地跨不同行业(包括保险、电信、媒体、金融和技术)提供可扩展的数据解决方案。

    Raghu 是 Amazon Web Services (AWS) 的高级人工智能/数据工程师,负责构建由代理开发框架和大型语言模型 (LLM) 提供支持的大规模分布式系统。他专门研究 GraphRAG、矢量数据库、多代理编排、AI 安全护栏和可扩展 GenAI 平台,为全球业务部门的数百个并发用户提供服务。 Raghu 拥有 AWS 认证 GenAI 开发人员专业认证、Databricks 数据工程认证、AWS 安全监护资格,并完成了 UT Austin 的 AI/ML 研究生课程。他在支付、商业服务、欺诈检测和企业运营方面提供了生产级数据工程和人工智能系统,在金融科技和云领域拥有近二十年的经验。