为什么立项会卡住
多数 AI 采购不是死在价格上,而是死在这一句追问:「你说能提效,提多少?怎么算的?」
网上流传的「AI 让效率提升 40%」之类的数字,几乎都没有可复核的口径——测的是什么任务、多少人、和什么对比,往往都说不清。 把它写进立项说明,等于把自己放在一个随时会被拆穿的位置上。
更稳的做法是:花四周,拿一组自己的数据。数字可能不漂亮,但每一个都能回答「怎么算的」。
试点设计:3 个人、2 个场景、4 周
选人:挑本来就在做这件事的人
不要挑最感兴趣的人,也不要挑最闲的人。挑本来就每天要做这类任务的三个人——他们的基线数据才有意义,他们的反馈才代表真实工作流。 三个人是个平衡点:再少结论不可信,再多变量失控且成本上升。
选场景:高频、可量化、不碰红线
| 适合做试点的场景 | 不适合的场景 |
|---|---|
| 每天都要做(高频) | 一个月才做一次 |
| 有明确的完成标准(可量化) | 「质量更好」但说不清怎么衡量 |
| 输入不含个人信息与商业秘密 | 要把客户名单、合同原文贴进去 |
| 结果可以被同事判断对错 | 只有本人能判断好坏 |
第三行是硬红线。涉及个人信息或重要数据的场景,先做数据出境评估再说,不要为了试点抢进度。 哪些场景一开始就该排除,见 企业最常见的 5 种 AI 数据泄露。
四周节奏
| 时间 | 做什么 | 关键要求 |
|---|---|---|
| 第 0 周 | 选人、选场景、开通账号、约定记录方式 | 记录表当场填,不要事后回忆 |
| 第 1–2 周 | 只测基线,不用 AI | 这两周最容易被跳过,也最不能跳过 |
| 第 3–4 周 | 引入 AI,其余全部不变 | 只改一个变量,否则结论无效 |
| 每周五 | 30 分钟复盘 | 问三个固定问题,见下文 |
每周复盘固定问三个问题:哪类任务真的变快了?哪类反而更慢?遇到了什么不敢用 AI 的情况?第三个问题的答案最值钱——它会直接变成公司制度里的条款,模板见 企业内部 AI 使用管理制度模板。
测什么:四类指标
| 指标 | 怎么记 | 为什么需要它 |
|---|---|---|
| 耗时 | 同一类任务从开始到验收通过的分钟数 | 最直观,但单独看会骗人 |
| 产出量 | 同一周期内完成的件数 | 防止「单件更快但总量没变」 |
| 返工率 | 需要重做或大改的比例 | 防止「快了但质量掉了」 |
| 主观评分 | 使用者每周给 1–5 分 | 解释前三个数字为什么会这样 |
只测耗时是最常见的错误。真实情况往往是「初稿快了一半,但返工率上升」,只有四类一起看才能得出可靠结论。
另外记一个数:每人每周被限流打断的次数。这不是效果指标,是采购指标——它直接决定正式推广时买哪一档。 0–2 次说明入门档够用,3 次以上再按角色升 5x 档,算法见 10 人团队的 AI 预算怎么编。
一张可以直接填的数据表
| 场景 | 指标 | 基线(第 1–2 周) | 试点(第 3–4 周) | 变化 |
|---|---|---|---|---|
| [场景 A] | 平均耗时(分钟/件) | [ ] | [ ] | [ ] |
| 产出量(件/周) | [ ] | [ ] | [ ] | |
| 返工率 | [ ] | [ ] | [ ] | |
| 主观评分(1–5) | — | [ ] | — | |
| [场景 B]同上 | ||||
| 每人每周限流次数 | — | [ ] | 决定正式档位 | |
成本怎么算
试点成本分两块:订阅费(3 个人的入门档,一个月几百元)和时间成本(记录与复盘,每人每周约 1 小时)。 推广后的成本量级,可以用目前唯一的官方基准来校验:Anthropic 在 Claude Code 文档里公布,企业部署中平均每开发者每活跃日约 $13、每月 $150–250,90% 的用户每活跃日低于 $30。
立项说明里引用这个数字,比引用任何第三方提效百分比都稳——它来自厂商自己的公开文档,可以附链接。
立项说明的七段结构
控制在两页,原始数据放附件。
- 现状与痛点。一段话,说清哪个岗位、哪类任务、现在花多少时间。不谈 AI。
- 试点设计。谁、什么场景、多长时间、怎么对照。三行说完。
- 结果。四类指标的基线与试点对照表,直接放上面那张表。
- 成本测算。试点实际花费 + 推广后的月度预算 + 官方成本基准作为量级佐证。
- 风险与合规。哪些场景被排除、数据出境怎么处理、对外内容怎么标识、账号怎么管。这一段最容易被忽略,却是法务与财务最关心的。
- 推广方案。先给谁、按什么标准分档、谁负责开通与回收、多久复核一次。
- 需要的决策。明确写出你要什么:多少预算、什么时候开始、谁来拍板。不要让读的人自己猜。
三个常见失败
- 跳过基线。直接开始用 AI,两周后汇报「大家都觉得快多了」。这种结论过不了财务那一关。
- 一次改太多。同时换工具、换流程、换考核标准,最后说不清是哪一项起的作用。
- 只报好消息。把「哪类任务反而更慢」如实写进去,反而会大幅提高可信度——因为它证明你真的测了。
批准之后
推广阶段的三件事:按角色分层配档(别按人头买顶配)、CI 与批处理单独走 API key、账号由公司统一开通而不是员工自购报销。 最后一条尤其重要,原因见 员工离职,AI 账号和数据怎么办。
国内企业统一开通通常卡在官方只收支持地区的支付方式、只开境外凭证这两处。ClaudeMax 企业服务承接的正是这一段:统一开通、支持对公转账、可开具发票,已累计服务 90 多家企业客户。具体方案、报价与票种以商务沟通确认。 供应商怎么评估见 十项尽调清单。
一句话总结
四周、3 个人、2 个场景、四类指标,两页说明。 用自己的数据立项,比引用任何行业报告都更容易通过。