为什么需要一把尺子
AI 项目最常见的死法不是技术不行,而是没人能说清它到底带来了什么。
上线三个月后老板问「省了多少钱」,业务说「效率提升明显」,财务说「账上没看出来」,
IT 说「调用量涨了 5 倍」——三个人说的是三件事,没有一件能签字。
典型的伪验收:「响应速度提升 40%」(跟什么比?)·「准确率 95%」(拿哪批题考的?谁出的题?)·
「大幅节省人力」(几个人?他们现在做什么?)·「用户反馈良好」(几个用户?问了什么?)
五条规则
规则 01
先量人工基线,再碰 AI
在系统上线之前,把这条流程现在的成本量出来:单件耗时、单件人力成本、月处理量、返工率。
没有这个锚点,之后所有的「提升」都是浮的。
关键:基线必须在动手之前测——事后回忆出来的基线,人总会往对自己有利的方向记。
规则 02
基线要双方签字,写明谁签的、哪天签的
供应商单方面报的基线不算数,甲方单方面定的也不算数。
签字的意义不是形式,而是把「后来才说不认这个数」这条路堵死。
文档留档,写清签署人、日期、口径说明。
规则 03
质量用黄金集打分,不用形容词
由甲方业务专家标注一批标准答案(黄金集,建议 200–500 条,覆盖长尾),
质量 = 系统在这批题上的得分。黄金集归甲方所有,版本化管理。
供应商可以看题、可以调优,但不能改答案。
规则 04
先定验收线,再看结果
质量线要在开工前写死(例如「黄金集得分 ≥ 95%」)。
先看结果再定线,等于没有线。
达不到就是达不到——该整改整改,该停就停,但不能改线。
规则 05
效益 = 基线 × 实际处理量 − AI 全成本
「AI 全成本」要含模型调用费、平台费、运维人力摊销——不能只算 token 钱。
实际处理量必须来自系统流水,不是估的。
未达验收线的工作流,其数字不计入效益——这条最容易被绕过,也最重要。
一页纸模板
照着填即可,不需要任何工具。
【验收基线确认书】
工作流名称:____________________
适用范围:____________________(哪些场景算,哪些不算)
一、人工基线(AI 上线前实测)
单件耗时:______ 分钟 测量方式:____________________
单件人力成本:______ 元 口径:______ 年薪 ÷ ______ 有效工时
月处理量:______ 件 数据来源:____________________
当前返工/差错率:______ %
二、质量标准
黄金集条数:______ 标注人:____________________
黄金集版本:______ 存放位置:____________________
验收线:得分 ≥ ______ %(本行在开工前填写,此后不得修改)
三、效益口径
效益 = 单件人力成本 × 实际处理量 × AI 承接比例 − AI 全成本
AI 全成本包含:□ 模型调用费 □ 平台/许可费 □ 运维人力摊销
未达验收线的期间:□ 不计入效益
四、签署
甲方:____________ 职务:__________ 日期:__________
乙方:____________ 职务:__________ 日期:__________
常见的绕过方式(提前认出来)
- 基线虚高——把人工成本按最资深的人算,或把不属于这条流程的工时也算进去。
- 黄金集偷换——供应商「帮忙优化」了标注,答案往系统擅长的方向偏。
- 范围漂移——上线后把难处理的案子悄悄划出「适用范围」,得分自然上去。
- 成本漏项——只算 token 钱,不算平台费和运维人力。
- 时间窗挑选——只报表现最好的那两周。
使用许可:这份标准公开发布,任何人可以自由使用、复制、修改、用于商业项目,无需署名、无需告知我们。
拿去和别的供应商谈也完全可以——如果它帮你避免了一个糊涂项目,我们的目的就达到了。
为什么我们愿意公开:我们做的生意是「把账算清楚」。
行业里认真算账的人越多,我们越好做;只会讲故事的人越多,所有人都难做。
v1.0 · 2026-07 · 有改进建议写信到 hello@tokenpower.ai,我们会在下一版里注明来源。