控制台网关行业方案客户成果投资与收购Bootcamp成本体检白皮书验收基线标准关于English登录 / 注册
验收基线标准 v1.0 · 公开,可自由使用

别再用「感觉快了不少」
验收 AI 项目

这是一份任何人都能拿去用的验收基线标准——用不用我们无所谓
我们把它公开,是因为整个行业缺一把尺子,而缺尺子最终伤害的是所有认真做交付的人。

为什么需要一把尺子

AI 项目最常见的死法不是技术不行,而是没人能说清它到底带来了什么。 上线三个月后老板问「省了多少钱」,业务说「效率提升明显」,财务说「账上没看出来」, IT 说「调用量涨了 5 倍」——三个人说的是三件事,没有一件能签字。

典型的伪验收:「响应速度提升 40%」(跟什么比?)·「准确率 95%」(拿哪批题考的?谁出的题?)· 「大幅节省人力」(几个人?他们现在做什么?)·「用户反馈良好」(几个用户?问了什么?)

五条规则

规则 01
先量人工基线,再碰 AI
在系统上线之前,把这条流程现在的成本量出来:单件耗时、单件人力成本、月处理量、返工率。 没有这个锚点,之后所有的「提升」都是浮的。
关键:基线必须在动手之前测——事后回忆出来的基线,人总会往对自己有利的方向记。
规则 02
基线要双方签字,写明谁签的、哪天签的
供应商单方面报的基线不算数,甲方单方面定的也不算数。 签字的意义不是形式,而是把「后来才说不认这个数」这条路堵死。 文档留档,写清签署人、日期、口径说明。
规则 03
质量用黄金集打分,不用形容词
甲方业务专家标注一批标准答案(黄金集,建议 200–500 条,覆盖长尾), 质量 = 系统在这批题上的得分。黄金集归甲方所有,版本化管理。
供应商可以看题、可以调优,但不能改答案
规则 04
先定验收线,再看结果
质量线要在开工前写死(例如「黄金集得分 ≥ 95%」)。 先看结果再定线,等于没有线。 达不到就是达不到——该整改整改,该停就停,但不能改线。
规则 05
效益 = 基线 × 实际处理量 − AI 全成本
「AI 全成本」要含模型调用费、平台费、运维人力摊销——不能只算 token 钱。 实际处理量必须来自系统流水,不是估的。
未达验收线的工作流,其数字不计入效益——这条最容易被绕过,也最重要。

一页纸模板

照着填即可,不需要任何工具。

【验收基线确认书】 工作流名称:____________________ 适用范围:____________________(哪些场景算,哪些不算) 一、人工基线(AI 上线前实测) 单件耗时:______ 分钟 测量方式:____________________ 单件人力成本:______ 元 口径:______ 年薪 ÷ ______ 有效工时 月处理量:______ 件 数据来源:____________________ 当前返工/差错率:______ % 二、质量标准 黄金集条数:______ 标注人:____________________ 黄金集版本:______ 存放位置:____________________ 验收线:得分 ≥ ______ %(本行在开工前填写,此后不得修改) 三、效益口径 效益 = 单件人力成本 × 实际处理量 × AI 承接比例 − AI 全成本 AI 全成本包含:□ 模型调用费 □ 平台/许可费 □ 运维人力摊销 未达验收线的期间:□ 不计入效益 四、签署 甲方:____________ 职务:__________ 日期:__________ 乙方:____________ 职务:__________ 日期:__________

常见的绕过方式(提前认出来)

使用许可:这份标准公开发布,任何人可以自由使用、复制、修改、用于商业项目,无需署名、无需告知我们。 拿去和别的供应商谈也完全可以——如果它帮你避免了一个糊涂项目,我们的目的就达到了。

为什么我们愿意公开:我们做的生意是「把账算清楚」。 行业里认真算账的人越多,我们越好做;只会讲故事的人越多,所有人都难做。

v1.0 · 2026-07 · 有改进建议写信到 hello@tokenpower.ai,我们会在下一版里注明来源。

需要有人陪你把第一条基线量出来?

Bootcamp 第一周做的就是这件事 · 按成本价 · 签约后全额抵扣