AI机会画布:如何评估AI项目是否值得做

并非每个AI想法都值得试点。本指南梳理了7个问题,以决定您的流程是否真正准备好应用AI。文章《AI机会画布:如何评估AI项目是否值得做》来自DLabs.AI。

来源:DLabs.AI

大多数公司知道他们应该对AI做些什么。困难的部分是知道从哪里以及如何开始。

我们反复看到的瓶颈几乎从来都不是缺乏好想法。而是缺乏一种共享的、结构化的方式来比较它们并选择最佳方案。有些流程听起来令人兴奋,但没有数据支持。另一些有很好的数据但没有明确的负责人。还有一些在理论上会节省实际资金,但房间里没有人能说出一个数字。

为了帮助领导团队克服这一瓶颈,我们构建了AI机会画布:一张一页的工作表,引导单一候选流程通过我们发现最重要的具体问题。为其中一个流程填写它,你就有了一个可以在下一次董事会会议上捍卫的书面答案。

该画布旨在保持诚实。并非每个经过它的流程都会获批,有时最有价值的答案是“还不是时候”。

在本文中,我们将逐步讲解七个部分中的每一个,分享我们在现场用来引导模糊答案的辅助问题,并使用示例展示强有力的回应实际上是什么样子。

这样,当你自己坐下来面对画布时,你已经知道要追求什么了。

1. 流程:你实际上在评估什么?

我们主办的几乎每个研讨会都以同样的方式开始。领导团队的某人说他们想将AI用于某些广泛的事情,如客户服务、营销内容或合同审查。房间里点头。这听起来像一个计划。

事实并非如此。这些每个都是一个类别,而不是一个流程。在“客户服务”下,有十个不同的工作流,由四个不同的团队运行,使用四个不同的系统。你不能为某个类别试点AI。你必须选择其中的一个工作流。

这就是画布第一部分迫使你做的事情。它要求一个具体的、可重复的流程,以文件或决策结束。这里的关键词是可重复的。AI需要示例来工作。

我们常在现场使用的辅助问题:“如果我把这个交给一个新员工,他们第一天能告诉我它从哪里开始和在哪里结束吗?”如果不能,你还没有流程。你有一类相关工作,需要先将其分解为更小的部分。

那么,对“你实际上在评估什么?”的好答案应该是什么样子?确切的工作流,用一两句话表述,有明确的触发器、明确的节奏和明确的产出。类似于:

“我们的客户支持团队为通过帮助台收到的产品问题撰写的回复,每周大约40个工单。”

一旦你明确命名了那一个工作流,画布的其余部分就有了具体的东西可以处理。

2. 负责人:谁对这个流程负责?

在你命名流程之后,下一个问题是谁负责运行它。这听起来很简单。在大多数研讨会中,这实际上是房间第一次安静下来的地方。

在许多组织中,诚实的答案是“所有人也无人”——多个团队接触该流程,没有人正式拥有它。而今天没有负责人的流程,不会仅仅因为添加了AI就突然有一个。如果说有什么不同,AI使所有权更加重要。

当AI加入一个流程时,有人必须做出软件无法处理的判断决策:

  • 这个输出足够好可以发送吗?
  • 当它第一次出错时我们该怎么办?
  • 当它出错时谁负责?

    如果没有有权限回答这些问题的人,试点在第一个异常案例出现时就会停滞。

    我们在这种情况下使用的辅助问题是:“如果明天AI起草了错误的东西,你团队中谁会注意到,谁来决定该怎么办?”如果人们互相看而不是说出名字,你就有了答案。

    那么,对‘谁负责这个流程?’的好答案应该是什么样子?

    以我们的支持工单为例:

    “Anna,客户支持主管。她制定回复质量标准,审查升级的工单,并每月向COO报告团队绩效。”

    部门名称不行。职位名称也不行。你需要一个具体的人,有名有姓,并有一句话说明他们今天已经负责什么。

    3. 数量和成本:这个流程今天花费你多少钱?

    下一个问题关于规模。这个流程现在消耗多少时间、金钱和精力?

    这是许多领导团队意识到他们从未真正衡量过的地方。流程发生,截止日期被满足,人们很忙。但其背后的具体数字不在任何人的脑海中。

  • 画布要求对四个方面的粗略数字:
  • 有多少人参与这个流程?
  • 一个周期需要多少小时?
  • 从开始到结束需要多长时间?
  • 当出错时会发生什么?

    这里不需要精确数字。粗略的就可以。但你需要的是真实的,而非猜测的。

    为什么这对AI很重要?因为没有基线,你就无法证明试点有效。如果没人知道这个流程今天需要多长时间,没人能判断明天AI是否使它更快。试点结束,每个人都耸肩,预算明年悄然转移到其他地方。

    尝试回答这个问题:“如果这个流程明天消失,你们团队的日历上每周会多出多少小时?”如果答案是“我真的不知道”,第一项工作不是AI。而是基本的度量。

    那么,对“这个流程今天花费你多少钱?”的好答案应该是什么样子?

    “两名全职支持代理每周处理大约40个工单。每个工单大约需要20分钟起草回复。当回复出错时,客户通常会再次回复,第二轮需要另外15分钟加上经理审核。”

    粗略的数字,但真实的。现在你有了一个可以衡量试点的基线。

    4. 数据:信息存储在哪里?

    现在是时候看看原材料在哪里了。AI处理这些流程产生的文档、记录和数据。这一部分决定试点是否在接下来的几个月内实际可行,还是你面对的是更长的跑道。

  • 画布询问关于流程背后数据的三件事:
  • 它物理存储在哪里?
  • 它使用什么语言?
  • 公司外部的人会有困难访问它吗?

  • 为什么这对AI很重要?因为你的数据状态同时决定三件事:
  • 试点是否能启动
  • 设置需要多长时间
  • 预算是花在基础设施上还是实际工作上

    我们常使用的辅助问题是:“如果我们需要给一个新员工访问做好这个流程所需的一切,他们需要多少个系统和密码?”如果答案超过三个,试点将在数据访问上花费实际时间,然后才能花在AI上。

    那么,对“信息存储在哪里?”的好答案应该是什么样子?

    “所有传入工单都通过Zendesk,使用英语,并存储在那里。过去三年的工单和回复在同一系统中可搜索。没有外部方需要访问。”

    那是试点的绿灯。如果答案涉及四个不同的工具、两种语言以及来自被收购公司旧邮件的PDF,诚实的答案将是“还不是时候”。

    5. 风险检查:开始前的问题

  • 现在是没人想回答,但每个人都必须在项目推进前回答的问题:
  • 公司中谁会签署AI建议的决策或文件?
  • 如果AI犯错会发生什么?
  • 当它犯错时谁负责?
  • 我们将如何发现它?
  • 进入AI的数据将存储在哪里,谁将有权访问?

    为什么这些特别重要?因为AI不承担责任。当模型出错时,问责仍必须落在组织架构图中的某个人身上。当数据流入模型时,它通常流经供应商的基础设施,这引发了关于安全、隐私和合规的真实问题。

    如果房间今天无法回答这些问题,试点今天就没准备好。不是因为流程不好,而是因为围绕它的治理尚不存在。

    一个辅助问题是:“如果CEO明天问谁对AI产出的结果负责,你有一个他们满意的答案吗?”如果答案是“我们必须搞清楚”,这些决定需要在试点之前做出,而不是之后。

    那么,对风险检查的好答案应该是什么样子?

    “升级的回复在发出前由团队负责人审核。如果回复出错,团队负责人纠正它并记录案例用于培训。工单数据留在Zendesk中,这已经涵盖在我们的GDPR协议中。”

    三个简短的回答,但每个都指定了一个人或一个边界。这就是它们有用的原因。

    6. 可衡量目标:你怎么知道它在工作?

    在流程、负责人、成本、数据和风险都写下来之后,下一个问题是:你怎么知道试点确实有效?

    这是大多数AI试点在开始之前就走错的地方。团队带着模糊的雄心启动(“让事情更快”、“减少错误”),然后六周后,没人能就试点是否成功达成一致。结果通常被描述为“有希望但很难确定”,这是礼貌地说没人会资助下一阶段。

    画布要求一个具体的、可衡量的结果,可以在4-6周内检查。不是“它会更快”,而是快多少。不是“更少的错误”,而是从什么到什么。

  • 画布甚至给了你三个示例可以参考:
  • 文档准备时间从X天降到Y天
  • 错误率降低X%
  • 信息查找时间从X分钟降到Y分钟

    为什么这很重要?如果没有开始时写下的数字,当需要为预算辩护时,这些胜利将不可见。

    这里有一个通常有帮助的问题:“如果有人在六周后问试点是否有效,你会指向哪个单一数字?”如果没有,你还没有目标。你有一个希望。

    那么,对“你怎么知道它在工作?”的好答案应该是什么样子?

    “平均回复时间从每个工单20分钟降至10分钟以下,至少80%的AI起草回复被代理接受而无需重大修改。”

    一个具体的数字,对照今天的基线测量,六周内可检查。这就是使目标真实的原因。

    7. 最小范围:你能测试的最小版本是什么?

    最后一个问题,它往往是拯救试点免受自身影响的关键。

    这里的诱惑总是搞大事:覆盖整个部门,处理每种工单类型、每种文档,从第一天开始。这就是大多数AI试点死亡的方式。

    画布向相反方向推动。它要求最小的有意义试点:一个流程、一个团队、一种文档类型。一些你实际上可以在四到六周内完成并测量的事情。

    试点的目的不是证明AI有效。而是找出当AI遇到你的真实流程、数据和团队时有什么会崩溃。较小的试点在数周内而非数季度内暴露这些问题。

    我们用来缩小范围的一个问题:“如果我们必须在两周而非六周内启动,我们会削减什么?”在那个削减中幸存下来的就是最小试点。

    那么,对“你能测试的最小版本是什么?”的好答案应该是什么样子?

    “在四周内,AI为一种类别的工单(退货和退款)起草回复,为一个由两名代理组成的团队。每个AI草稿在发送前由代理审核。在第四周结束时,我们测量回复时间和接受率与基线对比。”

    小到实际能完成,大到能学到真实的东西。

    准备好找出你的AI想法是否真的准备好了吗?

    挑选一个你一直在考虑的AI流程,并通过本文中的七个问题运行它。AI机会画布在大约45分钟内在一页纸上引导你完成它们。到最后,你将有一个明确的答案:可以、还不是时候,或不适用于这里。