← 返回文章列表

AI Agent 生产力怎么衡量?别只看速度,使用五层指标

从适用任务、质量、端到端周期、人工接管、客户结果和经营结果建立指标链,并用正确分母判断 Agent 是否真的提升生产力。

衡量 AI Agent 生产力,不能只看响应速度、调用次数或生成了多少内容。真正有用的口径是:在同一类可验收工作里,Agent 是否以不低于人工基线的质量,减少了端到端周期和人工投入,并且没有让异常、客户体验或风险变差。

这意味着生产力不是一个模型指标,而是一条从任务到经营结果的证据链。越靠后的结论,需要越完整的数据支持。

第一步:先定义“一个工作单元”

如果分母不断变化,任何提升百分比都可以被做出来。测量前先固定:

  • 什么事件算一次有效触发;
  • 哪些输入属于当前批准范围;
  • 什么结果才算通过验收;
  • 修改到什么程度算人工修正;
  • 什么情况算接管、失败或严重错误;
  • 从哪个时间点开始、在哪个时间点结束;
  • 人工基线使用同一种任务定义和质量门槛。

例如,“收到一封询价”不是稳定工作单元,因为垃圾信息、缺字段请求和完整请求的难度不同。可以把工作单元定义为:“进入指定渠道、包含最少识别字段、需要生成结构化任务卡并得到人工验收的一次请求。”不适用的请求单独记录,不能悄悄从失败样本里删掉。

五层 AI Agent 生产力指标

层级核心问题推荐指标最常见误区
适用范围到达的工作中,有多少真正属于当前边界?适用任务率、未知输入率只测最容易的样本,却对全部工作做结论
任务质量输出是否直接达到验收标准?自主验收率、一次通过率、修正率、严重错误率把“生成成功”当成“完成工作”
流程效率人和系统合在一起是否更快、更省复核?端到端 P50/P95、每个验收单元的人工分钟、接管率、恢复时间只报告模型延迟或 token 成本
客户结果流程变化是否改善了服务对象的体验?等待时间、重复联系、解决率、满意度、转化或留存用内部提速推断客户一定更满意
经营结果改善是否成为稳定的业务能力?单位成本、单位人时承接量、有效机会、收入、毛利与风险损失用节省分钟直接推断利润或裁员人数

每层都可以成为当前结论的终点。如果只测到人工复核时间下降,就只报告流程层改善;没有客户数据时,不要继续写“提升客户体验”。

四个必须使用正确分母的公式

1. 适用任务率

适用任务率 = 符合已批准输入规则的任务数 / 全部到达任务数

这个指标显示 Agent 当前边界能覆盖多少真实工作。适用率低不一定是模型差,也可能说明流程选择太宽或输入规则仍不清楚。

2. 自主验收率

自主验收率 = 无需强制人工修正且通过验收的任务数 / Agent 处理的适用任务数

分母不是所有成功调用,也不是只挑通过的任务。被接管、被拒绝、需要修正的适用任务都要留在分母或明确分组。

3. 每个验收单元的人工分钟

人工分钟/验收单元 = (复核分钟 + 修正分钟 + 异常处理分钟) / 通过验收的工作单元

实际计算时要先把分子相加再除。Agent 运行只需要 10 秒,但人仍要花 8 分钟复核,就不能宣称“把 8 分钟工作缩短到 10 秒”。

4. 单位验收成本

单位验收成本 = (模型成本 + 工具成本 + 人工复核成本 + 异常成本) / 通过验收的工作单元

便宜但错误更多的输出不是生产力。成本必须和质量、客户及风险护栏一起看。

接管率不是越低越好

预期接管说明边界正在工作,例如规则冲突、高影响动作或未知对象被正确交给人。失败型接管才表示 Agent 在本应完成的正常任务里丢失上下文、调用失败或输出不合格。

因此至少分开记录:

  • expected_boundary:命中已知停止条件;
  • quality_failure:输出未达到验收标准;
  • tool_failure:调用、权限或集成失败;
  • unknown_case:规则未覆盖的新类型;
  • human_override:人在边界内主动改变决定。

还要记录接管后能否恢复。只看“交给人了”会隐藏一个问题:人是否拿到了输入、规则、已执行动作、失败原因和恢复点。

一个合成计算示例

下面数字只是说明公式,不是客户结果或生产数据。

一周到达 100 个请求,其中 80 个符合批准范围。Agent 处理这 80 个任务:64 个无需修正通过,10 个修改后通过,6 个正确接管;人工复核、修正和异常处理合计 180 分钟。

指标计算结果
适用任务率80 / 10080%
自主验收率64 / 8080%
修正率10 / 8012.5%
接管率6 / 807.5%
人工分钟/验收单元180 / 742.43 分钟

这组数据仍不能证明“生产力提升”。还需要用相同 74 个可比任务或稳定历史样本得到人工基线,检查端到端周期、严重错误和客户护栏。若人工基线是每个验收单元 2 分钟,那么 2.43 分钟反而是退步。

怎样决定扩大、保持或降级

不要把所有指标压成一个看似精确的总分。用一张决策卡更可靠:

决定必要证据
扩大权限或范围质量不低于基线;严重错误在护栏内;人工分钟或周期改善;接管可以恢复;客户指标未恶化
保持当前边界样本不足;平均值改善但 P95 或某类异常仍不稳定;客户与经营结果尚未观测
降级或暂停严重错误;越权动作;恢复失败;修正成本持续上升;客户或风险护栏恶化

对一个低风险试点,可以把“至少 30 个适用任务或连续两个周度窗口”作为第一次复盘的工作门槛,但这不是统计保证,更不是所有行业通用标准。高风险、低频任务需要更长窗口、情景测试和更严格审批。

每个窗口都要按任务类型、权限级别和错误影响分组。把 95 个简单任务和 5 个高风险任务平均在一起,会让总体成功率看起来很好,却掩盖最需要关注的失败。

下载 AI Agent 生产力评分表(CSV)

证据与适用边界

  • 这是一套工作测量框架,不是行业基准或外部认证。
  • 合成示例只展示公式,不能用作预期收益。
  • 指标需要合法、必要的数据权限;客户对话和员工工时不应为了测量被无限收集。
  • “人均承接量提高”不等于应裁减岗位。人力下一步投入客户、规则、产品或增长的结果仍需单独验证。

先用正式工作单元与责任框架固定分母,再用权限矩阵约束动作、用人工接管清单记录恢复。完整学习顺序见AI Agent 接手正式工作专题

继续阅读
试点设计与评估
AI Agent 权限矩阵怎么设计?从只读到受控执行的五级框架 不要用“能不能自动执行”做二选一。把读取、草稿、批准后执行、内部自动化和有界外部动作分成五级,并为每次升级绑定审计、回退和 human owner。 AI Agent 接手正式工作后,人和组织怎样重新分工? 定义什么叫一段可交付、可验收的正式工作,再通过渐进授权扩大 Agent 的责任,并把人的能力迁移到客户、产品、创新和增长。 货代询价与报价流程,怎样拆成第一条 AI 工作流 从一线询价入口出发,拆解字段整理、规则判断、异常接管和结果回写,说明货代企业如何选择一条可验证的 AI 工作流。