AWS Machine Learning

超越节省的时间:为代理式自动化构建商业论证

AWS博客面向AI卓越中心负责人,提出“Agentic Value Model”框架,主张RPA时代的ROI模型(工时乘以人力成本减去构建成本)遗漏了代理创造的大部分价值,应衡量时间节省、异常处理、决策质量与变更韧性四类价值池,并以价值实现机制和责任人作为前提。文中给出理赔分诊示例数字,并引用Amazon Quick Automate在Kitsa、dLocal、Genpact的三个部署,同时指出这些部署并未证明全部四个价值池。

Two-by-two matrix plotting task complexity against decision risk, with four quadrants: keep it on RPA, the capacity play, the decision-quality play, and the guardrails play
配图来源 · AWS Machine Learning

智能体自动化(Agentic automation),即能够推理并适应环境以完成任务的软件,正出现在人工智能卓越中心(AI CoE)的路线图上。但公司用来论证自动化投资合理性的标准方法——节省的工时乘以劳动力成本再减去构建成本——是为机器人流程自动化(RPA)等基于规则的工具设计的。这种模型低估了智能体创造的大部分价值。

在本文中,我们介绍一个框架,AI CoE 领导者可以用它来构建能够捕捉智能体自动化全部价值的商业论证。您将了解为什么 RPA 时代的 ROI 模型存在不足、如何衡量它所遗漏的价值,以及哪些工作流值得使用智能体进行自动化。

为什么传统的商业论证不够充分

经典的投资回报率(ROI)模型是为稳定、大批量、基于规则的工作而设计的:统计交易数量,测算分钟数,乘以综合费率,再减去构建成本。RPA正是凭借这些条件赢得了自己的地位。

该模型假设世界是为其而构建的。它假设流程是稳定的,因此忽略了流程变化时维护自动化的成本。它假设任务是基于规则的,因此没有为异常情况设置预算项。它假设工作就是全部任务,因此从不计算人工监督的成本。而且它将节省下来的每小时视为已入账的价值,而腾出的产能往往被积压工作填满,从未体现在损益表(P&L)上。在将节省的时间转化为成果的工作上投入不足,正是麦肯锡所说的企业不断犯的错误:成功的AI转型遵循“1:3:5模式”,即“每在智能体技术上投入1美元,组织就要在流程重构上投入3美元,在能力建设和采用上投入5美元。然而,大多数公司完全颠倒了这一公式” (麦肯锡,《Agentic AI change management: Closing the adoption gap》,2026年).

我们默认自动化的价值在于任务本身,但在智能体自动化中,大部分价值存在于任务之外:判断力、例外情况处理以及跨系统的协调。真正的收益来自围绕智能体重新设计工作流程,而不是把一个智能体丢进一成不变的流程中。

旧模式所忽视的价值维度

更好的商业案例衡量四个价值维度,以及决定它们能否进入损益表的条件。我们称之为 智能体价值模型.

节省时间。 这仍然算数,但代理(agents)将其扩展到固定规则RPA处理不佳或只能通过大量异常逻辑来处理的工作上。衡量标准是一样的。代理将其应用于更广泛的工作范围。

异常处理。 异常承担了大部分成本。AWS指南给出了规划范围:纠正一个错误的成本可能是原始交易的1.5–4倍,而人为错误可能占运营成本的2–15% (AWS 规范性指导,《评估您当前的人工流程成本》). 返工乘数对您的团队捕获的例外情况进行定价。错误百分比对漏掉的例外情况进行定价。仅人工的案例则两者都不包含。

决策质量。 智能体可以在大规模应用统一政策并记录决策依据,但一致性和错误率需要持续测量。正如 AWS 所指出的,“低量、高价值的决策或许值得借助智能体辅助来提升决策质量,而非降低成本” (AWS 规范性指导,《理解智能体 AI 经济学》). 在信贷、定价或风险方面做出一个更好的决策,其价值可能超过一年节省下来的零星时间。

变更韧性与维护经济学。 这是双向的。脚本很脆弱:当屏幕或上游系统发生变化时,它们会失效,需要有人重建。智能体能吸收一些变化而无需重写,但它们把维护工作转移到了评估、提示词、监控和模型运维上,而非消除维护,运行它们本身也有成本。权衡的关键是比较避免的脆弱脚本维护成本与持续的智能体运行成本,因此在经常变化的流程中,账本可能偏向智能体,而在固定不变的流程中则未必。

支配这四者的条件是价值实现:每一项收益都需要一个明确的机制,将运营改进转化为经济价值,并有一位负责任的负责人。对于被释放的劳动力而言,这意味着降低支出,或将产能重新导向一个有明确名称、可衡量的成果。

考虑一个理赔分诊流程,以下用示意性数字说明。它每年处理200,000件理赔,每件约需12分钟(返工前), fully loaded 人力成本为每小时45美元,基础成本约1.8百万美元。将其中70%的例行工作自动化,可释放约28,000小时,即约1.26百万美元的产能,这还未扣除这些理赔仍需的监督时间。大多数案例正是在这里出错的,因为释放工时不等于省钱。只有当公司雇用更少的人,或削减承包商、加班或外包支出时,支出才会真正减少。否则,同样的人员仍在工资单上,损益表(P&L)永远看不到这1.26百万美元。如果人员流失和加班减少能实现其中一半,该案例应记为约630,000美元,而不是全额。

重新部署这些人员是更常见的结果,此时价值就是他们现在新创造的产出。 对于每释放的一小时,只计算重新部署的价值或现金成本削减之一,不可两者兼计。 然后再加上纯人力案例看不到的部分。在需要更正的8%(16,000件理赔)中,以约9美元处理成本(12分钟,每小时45美元)的3.5倍作为更正成本,每年的更正风险敞口约为504,000美元。这是基线,而非智能体价值。价值在于智能体消除的比例:40%的降低,再乘以75%的实现系数,得出的建模收益接近151,000美元。这还没包括任何一次改进的欺诈标记决策所带来的价值。由于12分钟的基线不包含返工时间,这一池与释放的产能不重叠。如果你的基线已包含返工时间,则这些节省只能计入一个池。这种版本的案例能得出财务部门可以辩护的数字。

为了保持计算一致,每个价值池都按同样的方式测算,并扣除成本,如下表所示。

价值池 基线 预期增量 实现系数 负责人
释放的产能 小时数 × 全负担费率 自动化百分比 仅当重新部署到明确的产出或支出下降时 运营负责人
例外和错误成本 更正成本 + 错误损失 预期降低 捕获比例 质量负责人
决策质量 更好决策的价值 每项决策的提升 可归因份额 领域负责人
变更韧性与维护经济学 脚本的修复成本 + 停机时间 避免的重建、更快的变更适应 避免重建的比例,智能体成本在公式中只净算一次 工程负责人

把整个案例表述为一行公式,将每项收益分配到唯一一个池中,以杜绝重复计算:年净价值 = 已实现的产能价值 + 避免的更正和错误成本 + 决策结果提升 + 避免的维护和停机成本,减去年化实施成本,减去智能体运行时、集成、评估、监督、治理和变更管理成本,再减去智能体引入的任何新错误造成的损失。智能体未能消除的错误本就不在避免成本项之内,因此不要再次扣减。对于多年期项目,实施成本应在支出的当年入账而非年化,收益随采用增长而爬坡,并对各年现金流折现以得出净现值(NPV)。

Amazon Quick Automate(其中 Amazon Quick,展示了这些维度在实际应用中的表现。 Kitsa是一家临床试验站点筛选公司,其自动化提取流程可从数十万个网站中提取50多个数据点。据其报告,成本节省了91%,数据获取速度提高了96%,覆盖率达到了96%,并将低置信度的案例转交给审查人员处理(时间节省和异常处理)。正如Kitsa联合创始人兼首席技术官Rohit Banga在AWS Machine Learning Blog文章中指出的,大规模统一高质量站点数据打破了一个核心瓶颈。这使得其Site Finder Agent能够以更高的精确度评估更多站点。

dLocal是一家跨境支付服务提供商,在受控评估中实现了对高达75%的商户合规审查的自动化。这让专家得以专注于复杂、高风险的案例(决策质量),并增加了对政策偏移的持续检查,而定期的人工审查会漏掉这些偏移(变化韧性)。dLocal表示,过去花费数小时进行例行检查的专家,现在将这些时间用于需要监管判断的案例。

还有 Genpact,其在多个SAP系统中实现供应链风险自动化,据报告将中断影响分析从2至3天缩短到几分钟。这是那种没有任何单一记录系统所能独揽的跨系统协调(时间节省和决策质量)。这些部署案例中没有一个能同时证明全部四个价值池,这正是为什么必须对每一个价值池分别进行评估论证的原因。

一个优先级排序框架

用两个维度对每个候选工作流打分。第一个是任务复杂度,即它需要多少推理、上下文和适应能力。第二个是决策风险,即做错事的代价,这决定了你可以授予多大的自主权。这两个维度都来自 AWS 的经济学指导,二者共同构成一个指导委员会可以使用的二乘二矩阵。

低复杂度、低风险:继续留在 RPA 上,因为代理在这里只增加成本而不增加价值。高复杂度、低风险是产能策略,因此应为实现吞吐量和吸收例外情况而自动化。高复杂度、高风险是决策质量策略,因此应保留人工参与环节,并以更好的决策作为正当理由。低复杂度、高风险是护栏策略,因此应围绕该步骤强化控制,而不是添加它并不需要的推理能力。

一个有用的捷径:如果一个人需要在多个系统之间切换并在每一步解读模糊的上下文,就评估代理式方法。如果路径保持确定性,RPA 可能仍然更便宜。使用 Agentic Value Model 来决定衡量什么,并使用这个矩阵来决定优先做什么。

Two-by-two matrix plotting task complexity against decision risk, with four quadrants: keep it on RPA, the capacity play, the decision-quality play, and the guardrails play

图 1:代理式自动化优先级矩阵,维度改编自 AWS Prescriptive Guidance,分类仅作示意

向领导层构建论证

将投资呈现为一个工作流组合,而不是单个项目。麦肯锡的研究说明了孤立的试点为何停滞:近三分之二的企业已经试用过代理,但只有不到 10% 将其规模化转化为实际价值 (麦肯锡,“Scaling agentic AI with data transformations”,2026 年)。价值来自于明确成果、将代理深度嵌入核心工作流,并围绕它们重新设计运营模式。向领导层提出三到五个优先领域,每个领域都附有其四维度论证。

能让持怀疑态度的首席财务官信服的一点是止损规则:分阶段投资,设定明确的盈亏平衡目标和预先定义的停止为表现不佳的代理提供资金的节点。将每个领域与领导层已经在跟踪的关键绩效指标(KPI)挂钩,无论是单位服务成本、周期时间、净推荐值还是合规风险。并将治理视为加速推进的方式:有边界的自主权、在高风险处设置监督以及设计层面的可审计性,让你能够在证据积累的过程中扩大代理的自主权。

开始使用 Amazon Quick

Amazon Quick 将研究、商业智能和自动化整合到一个代理式体验中。借助其自动化服务 Quick Automate,团队可以在企业工作流中编排 UI 操作、API 调用和人工审核。这会生成案例级执行数据,卓越中心(CoE)可以将其与运营和财务 KPI 配对,在价值实现的同时进行衡量。

这种衡量方式将第一个项目转化为一个组合。在你寻找四个价值池之后,你会发现它们往往存在于有人在系统之间切换、解读上下文并手动处理例外的任何地方。将一个工作流投入生产,为其价值池和运营成本建立基线,指定负责人,并证明这个数字。然后,随着每个新工作流报告结果,组合层面的论证便会不断累积。

结论

问题在于代理式自动化在哪些方面能提供现有工具无法提供的价值,以及如何在花费之前证明这一点。本文所描述的纪律——估算每个价值池的规模、应用切合实际的实现系数并设定止损规则——正是让这种证明可信的关键。在一个工作流上证明了价值的团队,可以用实际测得的结果而不是预测来为下一个工作流提供资金。关于底层经济学,一个好的起点是 AWS Prescriptive Guidance 关于代理式 AI 经济学的内容.


关于作者

原始出处

AWS Machine Learning

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准