AI Agent 生产力怎么衡量?别只看速度,使用五层指标
从适用任务、质量、端到端周期、人工接管、客户结果和经营结果建立指标链,并用正确分母判断 Agent 是否真的提升生产力。
衡量 AI Agent 生产力,不能只看响应速度、调用次数或生成了多少内容。真正有用的口径是:在同一类可验收工作里,Agent 是否以不低于人工基线的质量,减少了端到端周期和人工投入,并且没有让异常、客户体验或风险变差。
这意味着生产力不是一个模型指标,而是一条从任务到经营结果的证据链。越靠后的结论,需要越完整的数据支持。
第一步:先定义“一个工作单元”
如果分母不断变化,任何提升百分比都可以被做出来。测量前先固定:
- 什么事件算一次有效触发;
- 哪些输入属于当前批准范围;
- 什么结果才算通过验收;
- 修改到什么程度算人工修正;
- 什么情况算接管、失败或严重错误;
- 从哪个时间点开始、在哪个时间点结束;
- 人工基线使用同一种任务定义和质量门槛。
例如,“收到一封询价”不是稳定工作单元,因为垃圾信息、缺字段请求和完整请求的难度不同。可以把工作单元定义为:“进入指定渠道、包含最少识别字段、需要生成结构化任务卡并得到人工验收的一次请求。”不适用的请求单独记录,不能悄悄从失败样本里删掉。
五层 AI Agent 生产力指标
| 层级 | 核心问题 | 推荐指标 | 最常见误区 |
|---|---|---|---|
| 适用范围 | 到达的工作中,有多少真正属于当前边界? | 适用任务率、未知输入率 | 只测最容易的样本,却对全部工作做结论 |
| 任务质量 | 输出是否直接达到验收标准? | 自主验收率、一次通过率、修正率、严重错误率 | 把“生成成功”当成“完成工作” |
| 流程效率 | 人和系统合在一起是否更快、更省复核? | 端到端 P50/P95、每个验收单元的人工分钟、接管率、恢复时间 | 只报告模型延迟或 token 成本 |
| 客户结果 | 流程变化是否改善了服务对象的体验? | 等待时间、重复联系、解决率、满意度、转化或留存 | 用内部提速推断客户一定更满意 |
| 经营结果 | 改善是否成为稳定的业务能力? | 单位成本、单位人时承接量、有效机会、收入、毛利与风险损失 | 用节省分钟直接推断利润或裁员人数 |
每层都可以成为当前结论的终点。如果只测到人工复核时间下降,就只报告流程层改善;没有客户数据时,不要继续写“提升客户体验”。
四个必须使用正确分母的公式
1. 适用任务率
适用任务率 = 符合已批准输入规则的任务数 / 全部到达任务数
这个指标显示 Agent 当前边界能覆盖多少真实工作。适用率低不一定是模型差,也可能说明流程选择太宽或输入规则仍不清楚。
2. 自主验收率
自主验收率 = 无需强制人工修正且通过验收的任务数 / Agent 处理的适用任务数
分母不是所有成功调用,也不是只挑通过的任务。被接管、被拒绝、需要修正的适用任务都要留在分母或明确分组。
3. 每个验收单元的人工分钟
人工分钟/验收单元 = (复核分钟 + 修正分钟 + 异常处理分钟) / 通过验收的工作单元
实际计算时要先把分子相加再除。Agent 运行只需要 10 秒,但人仍要花 8 分钟复核,就不能宣称“把 8 分钟工作缩短到 10 秒”。
4. 单位验收成本
单位验收成本 = (模型成本 + 工具成本 + 人工复核成本 + 异常成本) / 通过验收的工作单元
便宜但错误更多的输出不是生产力。成本必须和质量、客户及风险护栏一起看。
接管率不是越低越好
预期接管说明边界正在工作,例如规则冲突、高影响动作或未知对象被正确交给人。失败型接管才表示 Agent 在本应完成的正常任务里丢失上下文、调用失败或输出不合格。
因此至少分开记录:
expected_boundary:命中已知停止条件;quality_failure:输出未达到验收标准;tool_failure:调用、权限或集成失败;unknown_case:规则未覆盖的新类型;human_override:人在边界内主动改变决定。
还要记录接管后能否恢复。只看“交给人了”会隐藏一个问题:人是否拿到了输入、规则、已执行动作、失败原因和恢复点。
一个合成计算示例
下面数字只是说明公式,不是客户结果或生产数据。
一周到达 100 个请求,其中 80 个符合批准范围。Agent 处理这 80 个任务:64 个无需修正通过,10 个修改后通过,6 个正确接管;人工复核、修正和异常处理合计 180 分钟。
| 指标 | 计算 | 结果 |
|---|---|---|
| 适用任务率 | 80 / 100 | 80% |
| 自主验收率 | 64 / 80 | 80% |
| 修正率 | 10 / 80 | 12.5% |
| 接管率 | 6 / 80 | 7.5% |
| 人工分钟/验收单元 | 180 / 74 | 2.43 分钟 |
这组数据仍不能证明“生产力提升”。还需要用相同 74 个可比任务或稳定历史样本得到人工基线,检查端到端周期、严重错误和客户护栏。若人工基线是每个验收单元 2 分钟,那么 2.43 分钟反而是退步。
怎样决定扩大、保持或降级
不要把所有指标压成一个看似精确的总分。用一张决策卡更可靠:
| 决定 | 必要证据 |
|---|---|
| 扩大权限或范围 | 质量不低于基线;严重错误在护栏内;人工分钟或周期改善;接管可以恢复;客户指标未恶化 |
| 保持当前边界 | 样本不足;平均值改善但 P95 或某类异常仍不稳定;客户与经营结果尚未观测 |
| 降级或暂停 | 严重错误;越权动作;恢复失败;修正成本持续上升;客户或风险护栏恶化 |
对一个低风险试点,可以把“至少 30 个适用任务或连续两个周度窗口”作为第一次复盘的工作门槛,但这不是统计保证,更不是所有行业通用标准。高风险、低频任务需要更长窗口、情景测试和更严格审批。
每个窗口都要按任务类型、权限级别和错误影响分组。把 95 个简单任务和 5 个高风险任务平均在一起,会让总体成功率看起来很好,却掩盖最需要关注的失败。
证据与适用边界
- 这是一套工作测量框架,不是行业基准或外部认证。
- 合成示例只展示公式,不能用作预期收益。
- 指标需要合法、必要的数据权限;客户对话和员工工时不应为了测量被无限收集。
- “人均承接量提高”不等于应裁减岗位。人力下一步投入客户、规则、产品或增长的结果仍需单独验证。
先用正式工作单元与责任框架固定分母,再用权限矩阵约束动作、用人工接管清单记录恢复。完整学习顺序见AI Agent 接手正式工作专题。