怎么读别人递过来的案例
给要当场判断一份 AI 落地案例值几分的人:甲方评估供应商、乙方研究竞对、内部推动者引外部数字给老板看。这一页给一套五步拆解法、六种常见注水手法的识别方式,以及一张现场能照着问的问题清单。
案例是 AI 交付生意里流通量最大、也是失真率最高的一种材料。它同时承担营销物料、评奖材料、内部述职、行业科普四种功能,而这四种功能对数字的要求完全不同——你手上那份 PDF 是为其中某一种写的,不是为你的判断写的。
所以读案例不是读理解,是做尽调。下面这套方法只解决一件事:在不联系甲方、不看合同、不做访谈的前提下,判断哪些部分可以引用、哪些部分只能当谈资。
一、五步拆解法
顺序不能换。每一步给下一步划定范围,跳步会让你在错误的层面上争论。
第一步:先找绝对值
翻完整份材料,先不看任何百分比,把能被审计的数字挑出来:金额、条数、人数、时长、件数、天数。
「年省 2300 万美元」「每月完成 53 万份合同审阅」「保函审核平均时间缩短至 2 小时以内」「日活 1800」——这类数字客户财务部门、系统日志或第三方能独立复核,做假成本高、含糊空间小。而「效率提升 300%」「数据准确性提升 100%」不构成事实主张,因为它们没有可被检验的形态。C7 实在智能的案例表里六个客户案例有四个写了「准确率 100%」或「数据准确性↑100%」,同一页上唯二可信的反而是「年省 1300 工时」和「成本节约 100 万元」。
一份案例一个绝对值都找不到,它就不是交付案例,是宣传页。
第二步:再找分母
有了绝对值,问它覆盖多大范围。分母是最容易被省略、也最容易改变结论的一项。三个高频缺口:
- 准确率的分母。 「风险点识别准确率超过 95%」——分母是识别出来的风险点总数,还是全部应被识别的风险点?前者不含漏报,后者含,两个数在真实系统里能差出一倍。C6 晋商银行公开材料没给分母,本库收录时把这句限定写进了正文。
- 效率对比的分母。 「单份文书从 15 小时降到 15 分钟」指的是哪一类文书、占全部工作多大比例。
- 覆盖率的分母。 「75% 以上交互由 AI 承接」比准确率好,正因为它自带分母(全部交互)。客服类项目优先约定承接率与升级率而不是准确率,理由就在这里(见 G14)。
随时可用的反问:这个百分比的分子和分母,各自从哪张表里查出来的? 答不上表名,只能当方向参考。
第三步:再找时点
问三件事:哪一天测的、测了多长时间、这个数字现在还成立吗。
上线首月的数字和一年后的数字是两个东西。Klarna 2024 年 2 月的官方通稿写着 AI 客服首月处理 230 万次会话、等价 700 名全职客服、平均解决时长从 11 分钟降到 2 分钟;2025 年 5 月公司公开转向,重新招聘人工客服,CEO 承认以成本为驱动的自动化带来了「更低的质量」(见 G19)。引用「700 人」而不引用回摆,就是断章取义。
时点还决定口径的版本:同一家公司改版前后的案例页可以是两套互不兼容的算法(见 G13)。涉及市场、薪酬、模型能力、工具版本的内容,时点缺失等于数字作废。
第四步:再找归因方
指标动了,有多少真是这套系统带来的?季节、促销、人员变动、新上任的主管都可能贡献了变化。这一步问:谁测的,怎么把杂音扣干净的。 按可信度排三档:
| 归因方式 | 可信度 | 案例里长什么样 |
|---|---|---|
| 有对照组 | 高 | 「组合模型方案相比单独的结构化数据模型,成单转化率提升约 30%」——「相比」那半句是关键(C8 循环智能) |
| 前后对比 + 显式扣除 | 中 | 逐项列出新员工熟练度、单量变化各贡献多少,扣完剩多少 |
| 只有前后对比 | 低 | 「上线后处理时长下降 60%」,没有任何扣除项 |
再看归因方是谁:当事人署名自述、上市公司披露、政府合同公告、审计与法院文件是一手;官网案例页、公司通稿、评奖选送材料是一方自述,方向可信但无第三方审计;未署名的公众号叙述、社群转述只能当教学素材。这三档对应本库的 A / B / C 证据等级,判定标准见 README。一条实操经验:有对照的小数字胜过没对照的大数字。
第五步:最后找它没说的那件事
前四步检验写出来的部分,第五步检验没写的部分。这一步收益最大,因为案例的失真主要靠省略实现,不靠编造。固定检查六项:
- 成本。 做了多久、投了多少人。只写收益不写成本,ROI 就是个残缺的分数。
- 失败的场景。 主动问「有没有做砸的、砸在哪」。答不上来的比答得上来的风险大。
- 后续。 还在跑吗、续费了吗、扩到几个部门了。时间戳停在两年前,通常说明后面没有更好的故事。
- 人的部分。 「AI 完成 90%」和「AI 完成 90%、剩下 10% 由新增的三个复核岗承接」是两个结论。
- 上下游的边界。 讲的是端到端流程还是其中一个环节。环节级的成功不等于流程级的成功。
- 谁不在案例里。 甲方哪个部门在这个项目里丢了预算或人头,决定项目能不能活到第二年。
二、六种常见注水手法
| # | 手法 | 一句话识别 | 本库实例 |
|---|---|---|---|
| 1 | 无基准百分比 | 提升 X%,不说从多少到多少 | C7 实在智能 |
| 2 | 口径切片 | 挑最好的那一类任务做全局对比 | G12 Anthropic 客户案例集 |
| 3 | 目标当结果 | 「实现覆盖率超 80%」,其实是立项目标 | C5 平安人寿 |
| 4 | 奖项当交付结果 | 通篇只有「入选某某优秀案例」 | C4 澜码 × 国网浙江 |
| 5 | 新旧口径相加 | 把不同版本、不同客户的数字加成总账 | G13 / G14 |
| 6 | 首月数字当长期结论 | 引上线首月的爆发,不引后来的回摆 | G19 Klarna |
手法一,无基准百分比。 「数据准确性提升 100%」在语法上就不成立——原来是 60%,提升 100% 是 120%?这句话说明它出自市场部不是交付团队。C7 收录的六个案例里「准确率 100%」出现四次;100% 不是结果,是口径,意思通常是「在我们定义的那部分任务里没出错」。正确写法:给起点和终点(「从 6.0 分钟降到 2.4 分钟」),或直接给绝对值。
手法二,口径切片。 有具体数字也有分母,但分母是被挑过的那一小块。G12 里 Anthropic 官方客户页公布 EvenUp「单份文书从 15 小时降到 15 分钟」,这个对比没有造假,但它指的是某一类标准化文书,不是律师的全部工作;同一张表里 Spellbook 的「每月完成 53 万份合同审阅」是绝对值,可信度高一档。正确写法:把切片写出来——「某一类标准化法律文书的起草时间,从 15 小时降到 15 分钟(Anthropic 官方客户页口径)」。
手法三,目标当结果。 C5 平安人寿的选送材料里,「2025 年内勤覆盖率超 80%、累计使用量突破 300 万次」是立项目标,「覆盖率 88%、累计内勤用户 2.4 万人」是已实现结果,而累计使用量的实际数字材料中根本没给。三句合成一句,就凭空造出一个从未公布过的数字。正确写法:目标和结果分两句写,缺的那项写「材料未给出」。
手法四,奖项当交付结果。 C4 澜码 × 国网浙江在公开材料里只有「入选中国信息通信研究院大模型揭榜挂帅优秀案例」这一个事实,本库因此把结果标为「未知」。评奖是评审事件,交付结果是业务事实;评奖材料由企业自己选送,评审看方案完整性与创新性,不看上线后的实际效果。正确写法:「该项目入选信通院揭榜挂帅优秀案例(评审事件);公开材料未披露量化交付结果。」
手法五,新旧口径相加。 Distyl 官网上有两个「预计节省超 2 亿美元」——G14 是财富 100 强电信运营商的运营支出,G13 是财富 20 强医保公司事前授权场景的成本,不同客户、不同场景,不能加成「Distyl 累计为客户省了多少钱」;早期「年省 2300 万美元」与 2026 年改版后按场景拆分的新口径同样不可相加。按客户拆开的对照表见 ../04-methodology/value-accounting.md 第 6.3 节。正确写法:一次只引一个场景、一个客户、一版页面,注明页面日期。
手法六,首月数字当长期结论。 G19 Klarna 是标本:2024 年 2 月首月数据惊人,2025 年 5 月公开回摆,中文圈至今仍在单独引用「700 人」。回摆的直接原因不是模型不行,是指标选错了——优化的是成本和处理量,没有优化复杂与情绪化工单上的满意度。正确写法:首月数字与最新状态成对引用;查不到最新状态,就写「该数字为 20XX 年 X 月上线首月口径,后续表现未公开」。更多流传版本与一手材料的对照见 ../00-start/myths-and-misquotes.md。
三、现场当场能问的十个问题
供应商讲完案例、留出提问时间时按顺序问。前五个问口径,后五个问真实性。对方的反应本身就是信息:交付出身的人会当场给你表名和分母,销售出身的人会说「会后拉个群细聊」。
- 这个百分比的起点是多少,终点是多少?
- 分子和分母分别从哪张表里查出来的?
- 这个数是哪一天测的,窗口多长?
- 现在还是这个数吗?最近一次复测是什么时候?
- 这个结果是全流程的,还是流程里某一个环节的?
- 有没有对照组?没有的话,你们扣掉了哪些其他因素?
- 这个数字是谁测的、谁认的——甲方财务、甲方业务部门,还是你们自己?
- 项目投了多少人、做了多久?(不问金额,只问人月)
- 上线之后新增了多少人工复核的工作量?
- 同类项目你们做砸过几个,砸在哪一步?
第 10 题值得留到最后。一家做过几十个项目的公司答不出任何一个失败案例,只有两种解释:项目量没有宣称的那么多,或者他们不做复盘。两种解释对你都是坏消息。
对方若是甲方的项目负责人而不是供应商,把第 8、9、10 题换成:这个项目里谁的预算被动了;一线现在是多了一步还是少了一步;明年预算砍半,这套系统会不会第一个被停。
四、反向用法:写自己的案例时逐条自查
同一把尺子掉转过来量自己,就是一份写作检查清单。和 case-template.md 配套用:模板管结构,这一页管口径。
| 五步 / 六手法 | 自查问题 | 对应模板要求 |
|---|---|---|
| 第一步 绝对值 | 结果一节里有几个能被审计的数?一个都没有就别发 | 「优先给绝对值和有分母的比率」 |
| 第二步 分母 | 每个百分比都写出分母了吗 | 「每个数字必须带口径」 |
| 第三步 时点 | 每个数字后面都跟了「截至 20XX 年 X 月」吗 | 「时点要写死」 |
| 第四步 归因方 | 写清是谁测的了吗?有没有对照或扣除 | 「每个数字必须带来源方」 |
| 第五步 没说的事 | 保留意见那一段写了吗,还是空着 | 「保留意见不是可选项」 |
| 手法 1 无基准 | 全文搜「提升」,每一处都有起点吗 | 投稿清单第 2、3 条 |
| 手法 2 切片 | 对比样本是不是只取了最好的一类 | 区分口径与全局 |
| 手法 3 目标当结果 | 目标和已实现分成两句写了吗 | 「区分目标和已实现」 |
| 手法 4 奖项 | 是不是在用评奖填补数字的空缺 | 结果一节不接受评审事件 |
| 手法 5 口径相加 | 有没有把不同项目的收益加成一个总账 | 「互相冲突的数字宁可都不用」 |
| 手法 6 首月 | 引的是上线初期的数吗,最新的呢 | 「时点要写死」 |
补充两条。写清成本:读者里有一半要拿你的案例去立项,只给收益不给人月,等于让他做一个必然做不平的账。写清你查不到什么:一份坦白承认「合同金额查不到、满意度为自述口径」的案例,比一份处处完美的案例更值得引用。
最后一条关于场景。抛开数字,看对方反复押注什么场景。 C7 的数字全部不可信,但它选的场景——回单分类、凭证录入、对账、合同审核——全是规则明确、有客观对错、单点闭环的活。场景选择比效果数字诚实,因为它反映这家公司内部对「AI 现在能干什么」的真实判断,这部分没有做假的动机。
延伸阅读
- README.md — 案例库索引、证据等级 A/B/C 判定标准、「成 / 败 / 未知」口径。
- case-template.md — 六段结构、脱敏规则、投稿检查清单,写案例时和本页配套用。
- china-cases.md、global-cases.md — 本页所有实例的完整案例卡。
- ../04-methodology/value-accounting.md — 第四节归因方法、第五节读数字的三条规则、第六节几家公开案例的算账方式对照。
- ../00-start/myths-and-misquotes.md — 中文圈流传但回一手核不到的说法,含 Distyl 新旧口径、MIT 95%、领英 42 倍。
- ../05-practice/anti-patterns.md — 案例里的失败模式在实践章有系统清单。
来源
本页方法来自对本库已收录案例的对照阅读,实例与一手链接按正文出现顺序列出。
- 实在智能官网客户案例页(自家营销页,数字为宣传口径)|手法一与「准确率 100%」的出处|见 C7。
- Anthropic 官方客户案例页|EvenUp「15 小时到 15 分钟」、Spellbook「每月 53 万份合同审阅」的出处|见 G12。
- Distyl 官网案例页(2026 年 9 月版)|两个「预计节省超 2 亿美元」与「75% 以上交互由 AI 承接」的出处;早期「年省 2300 万美元」口径见 Yespress 深度报道。
- Klarna 官方通稿(2024 年 2 月 27 日) 与 Forbes《Klarna Reverses AI Push》(2025 年 5 月 18 日)|手法六两幕的出处。
- 中关村互联网金融研究院公众号《优秀案例|中国平安人寿保险股份有限公司:平安人寿数字员工平台》(2026-02-21)与《优秀案例|晋商银行股份有限公司:智能保函审核》(2026-01-22),同属「2025 年数字金融服务创新与场景应用案例征集」64 项优秀案例系列|分别对应手法三与第二步的实例。微信公众号发布,永久链接不稳定,请按标题检索。
- 中国信息通信研究院大模型「揭榜挂帅」优秀案例名单|手法四的实例背景|本库调研未取得官方原始链接【待核实】,见 C4。
- 循环智能 × 招商信诺人寿「组合模型方案相比单独的结构化数据模型,成单转化率提升约 30%」|第四步「有对照的小数字」的正面样本|见 C8。
- 范冰(XDash)《前线部署工程师》附录 A 指标口径纪律、第 6 章按结果收费的合同五件事,GitHub 开源全文,2026 年 8 月。https://github.com/xdash/FDE-the-Guidance-Book-of-Forward-Deployed-Engineer
- 归因三档的方法来源为 Forrester Total Economic Impact™ https://www.forrester.com/policies/tei 与 Douglas W. Hubbard《How to Measure Anything》,整理见 ../04-methodology/value-accounting.md 第四节。