海外案例
给想看清「FDE 这套打法在海外到底交付出了什么」的人。20 条有公开来源的案例,含 4 条失败与回摆。每条标了证据等级,数字都写了口径。
阅读前请先看 README 里的证据等级约定:A = 一手可独立核对,B = 一方自述、来源可点开但无第三方核实,C = 二手转述或行业流传。等级低不等于假,等级低意味着不能拿去当统计引用。
本页按五组排列:Palantir 系(G1–G7)、前沿实验室系(G8–G12)、独立交付商(G13–G17)、企业内部团队(G18)、失败与回摆(G19–G20)。
本页目录
- 一、Palantir 系:G1 Airbus|G2 Tampa General|G3 Cleveland Clinic|G4 NHS FDP|G5 Maven|G6 Ferrari|G7 AIP Bootcamp
- 二、前沿实验室系:G8 Morgan Stanley|G9 John Deere|G10 Klarna 与 T-Mobile|G11 OpenAI Deployment Company|G12 Anthropic 客户案例集
- 三、独立交付商:G13 Distyl × 医保|G14 Distyl × 电信|G15 Sierra|G16 Decagon|G17 Harvey
- 四、企业内部团队:G18 Kavak
- 五、失败与回摆:G19 Klarna 回摆|G20 三个反面
- 一页总结|延伸阅读|来源
一、Palantir 系
G1 Palantir × Airbus,A350 产能爬坡与 Skywise
证据等级 A。
背景与问题。 2015 年夏,Palantir 伦敦办公室的工程师 Nabeel Qureshi 被派往法国图卢兹。客户是空客,题目由空客最高层亲自定:把 A350 的月产量从 4 架爬到 8 架,再往 16 架走。注意题目的措辞——不是「升级数据基础设施」,是「每个月能下线几架飞机」。Qureshi 在图卢兹住了一年半,每周四天泡在总装厂里;因为 A350 的部件在英国、西班牙、德国、法国四国生产,他常年在四国之间飞。
难在哪。 飞机在总装线各站位之间流转,上一站留了什么尾巴靠车间口口相传,缺件散落各处,质量问题的处置记录躺在另一个系统里。要回答「79 号飞机现在什么状态」得问好几拨人。所有生产数据锁在 SAP 里,表名长得像 S3F1_Z,字段含义只有极少数 IT 老兵说得清。
FDE 做了什么。 团队没有先在现有 SAP 表上搭报表(那样两三周就能演示,但界面上仍然是字段代号的世界),而是先花几周建了一个概念映射层,把外星表名映射成「零件、工单、飞机、站位」这些人和业务真正使用的概念,再在上面搭应用。代价是前期几乎没有可演示的东西,客户会问「你们这几周在干什么」。映射完成后做出统一界面,Qureshi 形容为「造飞机版的 Asana」:班组长打开屏幕就能看到 79 号飞机在 31 站、剩这些工单、零件在哪、历史上同类质量问题怎么处置。
结果。 制造节奏当年提升约 4 倍(当事人自述,播客交叉印证;空客官方未单独发布过归因数据)。这段合作长成了空客与 Palantir 共建的 Skywise 航空数据平台,Skywise 于 2017 年发布,如今服务上百家航司。当年那个概念映射层就是 Palantir ontology(本体) 的起源,后来成为 Foundry 最大的差异化功能。
教训。
- 客户用什么语言描述任务,你的交付定义就该是什么语言。听到自己把任务复述成「升级数据设施」时警惕——你正在把一个价值上亿的问题降级成一次 IT 采购。
- 遇到外星表名,先别急着出报表。检验标准只有一条:一线的人能不能用自己的话向系统提问。
- 「前期没东西可演示」的压力是真实的,扛法是把映射层的进度本身变成可汇报的里程碑。
- 端到端只为眼前这个客户建,抽象和规模化留给后方产品团队。
来源。 Nabeel Qureshi《Reflections on Palantir》(当事人一手自述);Lenny's Podcast 对谈 Nabeel Qureshi(补充任务措辞、SAP 表名、四国飞行细节);Palantir 官方推文确认合作始于 A350 产能爬坡。
G2 Palantir × Tampa General Hospital,护理协调
证据等级 B。
背景与问题。 坦帕总医院(Tampa General Hospital)是佛罗里达州的大型学术医疗中心。病床、麻醉恢复室(PACU)、转院接收、脓毒症患者的处置分散在多个系统里,床位与人力的供给和需求无法在同一个屏幕上对齐。
FDE 做了什么。 2024 年医院选定 Palantir AIP,建了一套覆盖全院的 Care Coordination Operating System(护理协调操作系统),把预测出院、床位供给、转运与临床路径放进同一个运营视图。医院方面反复强调的一点是交付节奏的变化:过去以月和年为单位解决的问题,现在以小时和天为单位迭代。
结果(医院与厂商自述口径)。 患者安置时间下降 83%;麻醉恢复室滞留下降 28%;脓毒症患者平均住院天数下降 30%;护理协调项目被医院归因为「帮助挽救了近 600 条生命」。最后这个数字是医院自己的归因计算,无独立审计。
教训。
- 医院这类场景的价值不在「AI 回答得准不准」,在于把分散在多个系统里的供需放进同一个视图——这和 G1 的概念映射层是同一件事。
- 「挽救 600 条生命」这类归因数字,引用时必须带上归因方和口径,否则会被当成临床试验结论。
来源。 Tampa General Hospital 官方新闻稿(2024 年 6 月);Healthcare IT News 报道;MedCity News《How Tampa General Hospital's Partnership with Palantir Is Shortening Its Innovation Timelines》(2025 年 2 月)。
G3 Palantir × Cleveland Clinic,虚拟指挥中心
证据等级 B。
背景与问题。 克利夫兰诊所要在床位与照护人力有限的前提下,尽可能多接收来自外院的转诊病人。难点是入院、出院、转运(ADT)三条流的预测彼此独立,谁也说不清明天下午还剩几张床。
FDE 做了什么。 在 Palantir Foundry 上建 Virtual Command Center,把入院、出院、转运的预测与床位、照护人力的供给放在一起做匹配。
结果(厂商与医院口径)。 上线后数月内,主院区接收的外院转诊病人增加约 8%。
教训。 值得注意的是这个案例的优化函数写在收入与服务能力侧(多接收多少转诊),不是成本侧(省了多少人力)。同一套技术能力,函数写法不同,长出来的东西完全不同——见 G18 Kavak。
来源。 BD Emerson《Palantir in Hospitals: On Top of the EHR》(第三方综述,转述医院公开表述;8% 这个数字未找到医院官方原始出处,引用前建议再核)。
G4 Palantir × NHS 联邦数据平台(FDP)
证据等级 A(合同与议会文件),结果未知**。**
背景与问题。 2023 年 11 月,Palantir 拿下英格兰 NHS 的 Federated Data Platform(联邦数据平台)合同,用于打通全国医院与整合照护系统的运营数据,官方目标是「让数百万患者获得更连贯的照护、帮助削减等待名单、减少出院延迟」。
合同口径(注意这里最容易被引错)。 合同总额常被写作 3.3 亿英镑 / 七年,但这是最高上限(随着更多 trust 接入才会用满),可覆盖至多 240 家 NHS 机构;授予 Palantir Technologies UK Ltd 的公布金额为 1.822 亿英镑。第一期在 2027 年 3 月到期,是否续约需要英国卫生与社会关怀部主动触发延期条款。
结果为什么标「未知」。 截至 2026 年,平台已在英格兰多数急症 trust 上线,NHS England 按季度公布收益数据;但一个跨党派议会委员会已正式建议政府退出该合同,英国医学会(BMA)则指示医生限制参与。2026 年 4 月英国下议院就 FDP 举行过专门辩论。这是本库里少见的「技术已部署、政治结论未定」的案例。
教训。
- 公共部门项目的「结果」有两层:运营指标和政治合法性。只交付前者、忽略后者的项目,会在续约节点上被推翻。
- 引用合同金额时区分「上限」和「已授予金额」,这两个数字差了将近一半。
来源。 NHS England 合同说明页;NHS England FDP 常见问题;英国议会 Hansard,2026 年 4 月 16 日下议院辩论记录;pharmaphorum 关于 3.3 亿英镑合同的报道;The Conversation《Palantir and the NHS – 10 things you need to know》。
G5 Palantir × 美国国防部 Maven Smart System
证据等级 A。
背景与问题。 Project Maven 起于 2017 年的算法战跨职能小组,目标是用 AI 处理卫星、无人机等传感器产生的海量影像,快速发现、识别、跟踪目标。Palantir 承接的是其中的 Maven Smart System(MSS)。
规模变化。 2025 年 5 月 21 日,美国国防部把 MSS 软件许可的合同上限上调 7.95 亿美元,至接近 13 亿美元、有效期到 2029 年;一年前这个上限还只有 4.8 亿美元。国防部给出的理由是「需求增长」。当时公开的用户规模为超过 2 万名活跃用户,跨 35 个以上的军种与作战司令部工具。新增经费首先覆盖五个作战司令部:中央司令部、欧洲司令部、印太司令部、北方司令部/NORAD、运输司令部。2026 年 Maven 进一步被确立为国防部的 program of record(正式列编项目)。
教训。
- 这是「从前线抽象出产品」这条路径最极端的样本:一个最初为特定任务定制的系统,在几年里变成跨多个司令部的通用工具,并最终拿到独立预算。
- 合同上限一年内涨 1.6 倍,说明在政府场景里采纳率本身就是最强的销售。
来源。 DefenseScoop《'Growing demand' sparks DOD to raise Palantir's Maven contract to more than $1B》(2025 年 5 月 23 日);DefenseScoop《DOD components face 'aggressive' timeline for Maven Smart System transition》(2026 年 4 月 15 日);SpaceNews 报道。
G6 Palantir × Scuderia Ferrari
证据等级 B,结果未知**。**
背景。 法拉利车队自 2016 年起使用 Palantir Foundry,技术团队用它围绕赛车性能、开发与可靠性做决策。2022 年 2 月双方扩大合作,Palantir 成为法拉利车队官方合作伙伴,动力单元(Power Unit)工程师用 Foundry 快速整合并分析多源数据,Palantir 品牌出现在赛车与车手赛服上。
为什么标「未知」。 公开材料里没有任何量化结果(圈速、可靠性、开发周期都没有公开数字)。这一条收进来的价值不在结果,在于它是一个赞助与交付混合的合作形态——品牌曝光是对价的一部分,因此案例本身不适合用来论证「FDE 交付带来了多少业务价值」。
教训。 看到「战略合作伙伴」「官方技术伙伴」这类措辞时,先找结果数字。找不到,就把它归到市场合作,不要当交付案例引用。
来源。 Business Wire 官方通稿(2022 年 2 月 10 日);法拉利官网。
G7 Palantir AIP Bootcamp:把交付前置成获客
证据等级 B。
背景与问题。 企业软件的传统销售周期是 12 到 18 个月:先谈,再 POC,再采购。Palantir 在 2023 年 AIP 发布后换了一套打法。
做了什么。 AIP Bootcamp 是 5 天的现场活动,客户带着自己的真实用例来,由 Palantir 工程师带着从零做出可用的东西。官网页面不标价,只有留资表单。官方博客里的口号写得很清楚:
"Learn to fish, eat a fish. An AIP Bootcamp isn't about abstract learning or using pre-baked apps. Bootcamps enable participants to tackle their real use cases today while developing the intuition and skills to build independently moving forward. Plan to do both."
同一篇博客还提到需求侧的状态:「We have a growing backlog of AIP Bootcamps due to the overwhelming demand.」
结果(二手聚合口径,慎引)。 到 2024 年 6 月累计完成的 bootcamp 超过 1300 场;转化率被广泛引述为 70% 到 75%(不同来源口径不同,有的写「一个季度内转为付费合同约 70%」);平均单笔交易额超过百万美元。这三个数字都不是 Palantir 官方口径,来自研究机构与财经媒体对财报电话会的汇总,属于二手。
教训。
- 培训不是产品,是获客成本。 5 天的免费或象征性收费交付,换来的是六到七位数的年合同和被压缩到数周的销售周期。
- 这一招能成立的前提是产品本身能在 5 天里做出真东西。没有这个前提,同样的动作只会变成一次昂贵的售前。
- 引用转化率时务必注明是二手数据,Palantir 从未在官方页面公布过这个数字。
来源。 Palantir 官方 AIP Bootcamp 页面(一手,无价格与转化率);Palantir 官方博客《Deploying Full Spectrum AI in Days: How AIP Bootcamps Work》;GTM Foundry《Palantir's Bootcamp GTM Strategy》(二手分析,转化率与单笔金额出处)。
二、前沿实验室系
OpenAI 的 Forward Deployed Engineering(FDE)团队由 Colin Jarvis 领导,公开自述的定位是:进入企业现场,解决「价值在数千万到数十亿美元量级」的问题,交付可进生产的 LLM 应用,而不是做长期咨询。团队规模从 2024 年初的 2 人涨到 2024 年底的约 52 人。方法上强调 eval 驱动开发、深度嵌入业务领域、确定性组件与概率性组件的配比、以及从单个客户的方案里抽出可产品化的部分。
G8 OpenAI FDE × Morgan Stanley
证据等级 B。
背景与问题。 摩根士丹利的财富管理顾问需要在数十万份研究报告里找答案,传统检索方式让报告的实际使用率很低。
做了什么。 OpenAI FDE 团队与摩根士丹利共同交付了面向财富顾问的 GPT-4 助手,重点在检索质量、评测框架与合规护栏,而不是模型本身。
结果(OpenAI 团队公开自述口径)。 财富顾问中的采纳率 98%;研究报告的使用量增至原来的 3 倍。
教训。 采纳率是这类案例里最硬的指标,因为它无法靠口径注水——没人用的系统做不出 98%。反过来说,任何只报「准确率」不报「采纳率」的企业 AI 案例,都值得多问一句。
G9 OpenAI FDE × John Deere
证据等级 C。
背景。 John Deere 是 OpenAI FDE 团队在起步阶段的第一批客户之一(团队自述)。项目是给农户提供 AI 驱动的农事建议。
结果(二手转述,慎引)。 多家媒体转述称,该部署帮助农户减少约 70% 的化学品用量,并使客户互动量增至 6 倍。这两个数字没有找到 OpenAI 或 John Deere 的官方原始出处,只在二手报道与聚合分析中出现,因此本卡定为 C 级,不建议作事实引用。
教训。 这一条收录的意义是提醒:FDE 领域大量流传的「客户 + 数字」组合是二手的。 看到一个漂亮的数字,先找它的第一手出处;找不到就降级。
来源。 MarketScale《OpenAI's $150 million enterprise push puts forward deployed engineers inside client operations》(二手);John Deere 作为团队早期客户的表述见 ZenML LLMOps Database 整理。
G10 OpenAI FDE × Klarna 与 T-Mobile:从客户现场长出产品
证据等级 B。
背景与问题。 Klarna 的客服场景里有 400 多条政策规则,最初的做法是人工为每条政策写 prompt——不可维护。T-Mobile 的客服场景被 OpenAI 团队描述为「复杂度是 Klarna 的 10 倍」。
做了什么。 团队把「为每条政策手写 prompt」改造成参数化系统。这条路径后来的走向很值得注意:Swarm 这个实验性框架先在 Klarna 得到验证,再在 T-Mobile 的 10 倍复杂度下得到二次验证,加上 GitHub 上的社区反响,OpenAI 才决定把它产品化为 Agents SDK。
结果(团队自述口径)。 FDE 团队整体在客户处实现 20% 到 50% 的效率提升;一家欧洲半导体制造商的早期部门效率节省 20% 到 30%,整体目标 50%。
教训。
- 产品化的决策门槛应该是「在两个量级不同的客户现场都验证过」,不是「一个客户说好用」。 这条是本库里最可迁移的一条。
- 前线做定制、后方做产品的分工,在 Palantir(G1)和 OpenAI 是同一套逻辑。
来源。 ZenML LLMOps Database《OpenAI / Ramp / Nominal / Dataland: Forward-Deployed Engineering for Enterprise LLM Adoption》;ZenML LLMOps Database 对 Colin Jarvis 访谈的整理。
G11 OpenAI Deployment Company:把 FDE 做成一家公司
证据等级 A(事件本身),结果未知**。**
事件。 2026 年 5 月 11 日,OpenAI 宣布成立 OpenAI Deployment Company,专门帮助企业在核心工作流中构建与部署 AI 系统(官方公告:OpenAI launches the Deployment Company,产品页 openai.com/business/the-openai-deployment-company)。要点:
| 项 | 内容 |
|---|---|
| 初始资金 | 超过 40 亿美元 |
| 关键收购 | 收购英国应用 AI 咨询与工程公司 Tomoro,带来约 150 名有经验的 Forward Deployed Engineer 与 Deployment Specialist |
| Tomoro 背景 | 2023 年成立,与 OpenAI 结盟,总部伦敦,另有爱丁堡与曼彻斯特办公室 |
| 股权结构 | OpenAI 持有多数并控制;与 TPG 领投的 19 家机构合作,Advent、Bain Capital、Brookfield 为联合领投的创始合作方 |
为什么重要。 这是 FDE 这个岗位在 2026 年最大的结构性变化:前沿实验室不再只是「顺便派几个工程师去客户现场」,而是把交付独立成一家有 40 亿美元资本的公司。 对想入行的人来说,这直接改变了岗位供给的形状;对做 AI 交付生意的人来说,这意味着最上游的模型厂商开始亲自下场做交付。
结果标「未知」的原因。 截至 2026 年 9 月,这家公司成立才四个月,没有任何可核对的交付结果。
教训。 判断一个岗位是不是真趋势,看有没有人愿意为它单独设一家公司、配一笔独立资本。
来源。 digit.fyi《OpenAI acquires Scottish AI firm Tomoro in $4bn deployment drive》;Techstrong.ai《OpenAI Launches $4 Billion Venture for Enterprise Market, Acquires Tomoro》;MediaPost 报道(2026 年 5 月 12 日)。官方公告页 https://openai.com/index/openai-launches-the-deployment-company/ 本次直连返回 403,正文要点经上列多家媒体交叉印证,与 ../09-now/2026-timeline.md 的口径一致。发布日期以官方口径的 2026 年 5 月 11 日为准(部分媒体记为 12 日)。
G12 Anthropic 客户案例集:EvenUp、Spellbook、Notion
证据等级 B。
背景。 Anthropic 的 Applied AI 团队承担的是与 FDE 类似的职能:把 Claude 落进企业的真实工作流,并把踩到的坑反哺回产品。官方客户案例页公开了一批带数字的结果。
结果(Anthropic 官方客户页口径)。
| 客户 | 场景 | 公布结果 |
|---|---|---|
| EvenUp | 法律文书起草 | 单份文书从 15 小时降到 15 分钟 |
| Spellbook | 合同审阅 | 每月完成 53 万份合同审阅 |
| Pictet | 工程与研究 | 「把数周的工作变成数小时」(无量化) |
| DXC | 保险核心系统 | 覆盖「数十亿份保单」的后台(无效率数字) |
| Deepgram | 软件工程 | 交付「4 到 10 倍」更耐用的代码(口径不明) |
| League | 产品开发 | 开发周期缩短一半 |
一条值得单独记的观察。 Notion 在 2022 到 2026 年间为把 agent 做进生产环境,完整重建了四到五次 agent 基础设施,才最终发布 Custom Agents。这条比任何效率数字都更接近交付现场的真相。
教训。
- 「15 小时到 15 分钟」这类对比要看清分母:它通常指某一类标准化文书,不是全部工作。厂商案例页给的是最好的那个切片。
- Notion 的四到五次重建说明:agent 类产品的失败大多不是一次性的,而是反复重来。 给项目排期时,把「会推倒重来」当默认,不是当风险。
来源。 Anthropic 官方客户案例页;ZenML LLMOps Database《Anthropic: Building Production AI Agents: Lessons from Claude Code and Enterprise Deployments》(Notion 反复重建的出处)。
三、独立交付商
G13 Distyl AI × 财富 20 强医保公司
证据等级 B。
背景。 Distyl AI 由前 Palantir 的 Arjun Prakash 和 Derek Ho 于 2022 年创办,判断浓缩成一句话:「The model is not the bottleneck. The operating model is.」他们把 FDE 本身做成商业模式——工程师驻场不走、亲手重建流程、收入和结果挂钩,并自研 agent 平台 Distillery,合同是「平台订阅 + 派驻工程师」打包卖。
问题。 客户最初想要的是一个能问答的 AI 助手,最好一个季度上线。Distyl 的诊断指向另一个方向:如果只把聊天机器人架在现有流程上,分析师该翻的文档还得翻、该等的排期还得等。要动真格,得先花几个月把调查工作流拆开重建,然后才谈部署 AI。
做了什么。 团队驻进客户现场,先重构调查工作流,再部署 AI Insight Engine:分析师用自然语言提问,引擎生成可执行的 SQL、分析结论和可视化。定价原则是能量化结果的场景按结果收费,难量化的用传统服务计费。
结果(Distyl 官网口径,客户名未公开,无第三方审计)。 早期公布的口径是:2000 余名分析师的单次调查从以小时、以天计压缩到分钟级,客户每年节省超过 2300 万美元。截至 2026 年 9 月,Distyl 官网案例页已更新为按场景拆分的口径:事前授权场景「预计节省超 2 亿美元、每月 20 万+ 案件加速审批」,合同场景「年省 1600 万美元、60 万+ 合同变为可查询」,RPM 场景「年省约 5000 万美元、政策更新周期从 12 个月缩到 3 个月」。新旧口径不可直接相加,同一版页面里不同客户、不同场景的数字也不可相加(见 G14 的提醒),引用时请指明你用的是哪一版页面、哪一个场景。按客户拆开的对照表见 ../04-methodology/value-accounting.md 第 6.3 节。
公司层面。 2023 年 4 月种子轮 700 万美元(Khosla Ventures、Lightspeed);2024 年 11 月跟投 2000 万美元;2025 年 9 月 B 轮 1.75 亿美元、估值 18 亿美元(官方通稿未指明领投方,参与方 Coatue、Dell Technologies Capital、DST Global 跟投)。公司宣称部署项目 100% 进入生产环境(自述口径,无第三方核实)。注意:../01-lineage/fde-as-a-service.md 依据 Crunchbase News 把 B 轮领投方写成 Khosla Ventures 与 Lightspeed,与本卡依据的 PR Newswire 官方通稿不一致;以官方通稿为准,Khosla 与 Lightspeed 是 2023 年种子轮的投资方。
教训。
- 客户开口就要 chatbot 时,先陪一个一线分析师把完整流程走一遍,数清楚时间花在哪。时间大头在找数拼数,就先修流程,模型放最后。
- 谈按结果付费之前,先和客户财务一起把「节省怎么算」的口径写死。口径算不清的场景老实收服务费。
- 「先重构流程,再部署 AI」这个顺序本身就是差异化。信号很好认:如果你的方案不需要客户改任何工作方式,它多半也改不了任何业务数字。
- 小公司打大客户,一个可公开引用的数字(比如 2300 万美元)值得多冒一点商业风险。
来源。 Distyl 官网案例页(2026 年 9 月版);Distyl B 轮融资通稿(PR Newswire,2025 年 9 月);Yespress 深度报道(运营模式与定价原则)。
G14 Distyl AI × 财富 100 强电信运营商
证据等级 B。
背景与做法。 同样是「平台 + 驻场」的打包合同,场景是客服与运营交互。Distyl 采用的案例写法是匿名客户 + 具名数字:不点客户名,但把成果数字做得很显眼。
结果(官网口径)。 预计运营支出节省超过 2 亿美元;75% 以上的交互由 AI 承接(AI-contained)。
⚠️ 别和 G13 的「2 亿美元」搞混。 Distyl 官网上有两个「预计节省超 2 亿美元」:本条是财富 100 强电信运营商的运营支出,G13 那条是财富 20 强医保公司事前授权场景的成本。两者是不同客户、不同场景,不可相加,也不能合并成一个「Distyl 累计为客户省了多少钱」的数字。同一批官网数字在 ../04-methodology/value-accounting.md 第 6.3 节有按客户拆开的对照表。
教训。 「AI-contained(AI 承接率)」是比「准确率」好得多的指标,因为它自带分母(全部交互)。做客服类项目时,优先和客户约定承接率与升级率这两个指标,而不是准确率。
来源。 Distyl 官网案例页。
G15 Sierra AI × Chime、Airtable、SoFi
证据等级 B。
背景。 Sierra 由 Bret Taylor 创办,做面向企业的对话式 AI agent,按解决量(per resolution)计费。它的交付模式是产品加深度实施,接近「产品化的 FDE」。
结果(Sierra 官网客户页口径)。
| 客户 | 公布结果 |
|---|---|
| Airtable | 80% 解决率 |
| Chime | 70%+ 解决率 |
| SoFi | NPS 提升 33 个点 |
| Rocket Mortgage | 转化率 4 倍 |
| Redfin | 房源浏览量 2 倍 |
| Singtel Group | 上线周期不到 10 周 |
一条必须写的纠错。 第三方广泛流传的 Sierra「每次解决 1 到 2.5 美元」或「1.5 美元」的单价,Sierra 官网从无此数字,公司也从未确认,不要采信。
教训。
- 按解决量计费把「AI 有没有干活」和「客户付多少钱」绑在了一起,这是目前海外最清晰的一种结果导向定价。
- 「上线周期不到 10 周」这类交付速度指标,在评估交付商时比效果百分比更有区分度——效果可以调口径,周期不能。
来源。 Sierra 官网客户页;关于定价的公开表述见 Stripe《Cheeky Pint》播客对谈 Bret Taylor(2026 年 3 月 10 日)转录。
G16 Decagon × Duolingo、ClassPass、Chime
证据等级 B。
背景。 Decagon 做面向消费品牌的客服 AI agent,同样是产品加实施。
结果(Decagon 官网口径)。
| 客户 | 公布结果 |
|---|---|
| Duolingo | 80% 分流率(deflection) |
| Chime | 70% 聊天与语音解决率 |
| ClassPass | 成本下降 95%;上线时分流率比预期高 10 倍 |
| Hunter Douglas | 完全由 AI 处理的会话带来 100 万美元收入 |
| Oura | CSAT 提升 3 倍 |
| Curology | 成本下降 65% |
| Valon | 语音场景分流率 50%+ |
| Rippling | 分流率提升 32% |
注意一个细节。 Duolingo 的客户在案例里说的不是「AI 多准」,而是「以前每周至少半周时间花在维护他们的系统上」。维护成本是客服 AI 真正的隐藏账单,这一点在国内案例里几乎没人写。
教训。
- 同一批指标(分流率、解决率、CSAT)在 Sierra 和 Decagon 的客户页上口径接近,说明这个细分市场已经形成了行业通用口径——这是一个赛道成熟的信号,也是你和客户谈验收标准时可以直接引用的行业基准。
- 「成本下降 95%」这类极值要看清基数。ClassPass 的对照物是它原来的外包客服,不是零。
来源。 Decagon 官网与案例页。
G17 Harvey × 律所与企业法务
证据等级 B。
背景。 Harvey 做法律领域的 AI,客户是律所与企业法务部门。
结果(Harvey 官网口径,截至 2026 年 9 月)。 覆盖 70 个国家、2400+ 组织、20 万+ 律师;月度采纳率 92%;典型用户每月节省 25 小时以上;客户包括 A&O Shearman、Dentons、CMS、Reed Smith、O'Melveny & Myers、Vinson & Elkins、Orrick、Blank Rome 等一百多家律所,以及德国电信、Repsol、Bridgewater、KKR、Comcast、宝洁、PwC UK 等企业。官网单独列了一个案例:CMS 通过把 Harvey 变成日常习惯,达到 95% 的采纳率。
教训。
- 法律是**「结果难以自动验证、但错误代价极高」**的典型领域。Harvey 能跑起来靠的不是自动化程度,而是把 AI 放在律师的复核之前而非之后。
- 律所这类合伙人制组织,采纳率是唯一有意义的指标——没有一个合伙人会因为 KPI 去用一个不好用的工具。CMS 的 95% 值得当作采纳率的天花板参照。
来源。 Harvey 官网客户页。
四、企业内部团队
G18 Kavak:内部技术团队从降本增效走到开疆拓土
证据等级 A(多来源交叉),结果成,但后续估值腰斩**。**
背景与问题。 Kavak 出现之前,墨西哥的二手车交易没有标准、没有质保,欺诈和里程表造假普遍。比车况更难的是钱:传统银行拒绝约 60% 的车贷申请,通过的年利率高到 30%。新兴市场约 80% 的人口因此无法获得汽车。
做了什么(第一阶段)。 Kavak 先定客户体验目标,再组建技术团队去开发买、卖、融资全流程的系统。每辆收进来的车走 240 项检查,在此之上用机器学习按里程、品牌、使用情况预测每个零件需要更换的概率,检测流程提速 70% 以上;定价上把公开行业数据和自己的成交数据合起来算,给出公允且持续更新的价格。
撞墙。 车检干净了、价格公允了、质保也给了,客户站在展厅里点头,最后还是走了——因为贷不到款。这个卡点不在 Kavak 的任何一个系统里,它在别人家的风控模型里,而那个模型看的是征信历史,而这个国家大部分人根本没有征信历史。
做了什么(第二阶段)。 Kavak 自己下场做金融,成立 Kavak Capital:用交易数据和算法评估还款能力而不是看征信历史,客户只需身份、地址、收入证明即可申请,年利率 14% 到 20%(对照银行的 30%)。
结果。 超过 50% 的 Kavak 成交带自家融资,而地区传统行业的平均水平只有 10%。 同期建了 75 个运营中心、90 天免费质保(可延长到 2 年)、7 天无理由退货、库存超 3 万辆车。六年内进入 9 个国家,进入两年内土耳其拿到约 10% 市场份额、阿联酋约 15%,峰值员工约 7000 人。
另一面(必须一起读)。 2021 年估值 87 亿美元,是拉美最值钱的创业公司。2023 年成本上升、扩张受挫,开始裁员,关闭哥伦比亚和秘鲁业务。2025 年三四月间完成 1.27 亿美元新融资,估值被砍到 22 亿美元,跌了 75%(SoftBank 与 General Atlantic 联合领投,另从高盛和汇丰拿到共 2 亿美元授信)。同年全球员工从峰值大幅收缩,管理层被重组,Bloomberg Línea 报道过前员工集体批评客服失灵与管理混乱。
教训。
- 优化函数决定了这批人是什么人。 同一批技术能力,函数写成「内部成本」就长出效率工具,写成「客户能不能拥有一辆车」就长出一块占成交一半的金融业务。
- 找新市场,去看现有系统正在拒绝谁。 银行拒了 60% 的人,那 60% 就是市场。企业内部要问的三个问题是:我们现在拒绝服务的是谁,为什么拒绝,如果用今天的数据和模型重算一遍还需要拒绝吗。
- 遇到「客户体验的卡点不在我们系统里」,别急着划到范围之外。判断标准是你手上有没有对方没有的数据——Kavak 有交易数据和车况数据,银行没有。
- 要论证「不只是降本增效」,用一个带对照的数字:自家融资渗透率 50% 对行业平均 10%。
- 开疆拓土的优化函数和资本市场的耐心是有冲突的。 估值跌 75%、关掉两个国家、管理层重组,这三件事和 50% 的渗透率是同一个故事的两半。在企业内部做这件事的正确顺序是,先用降本增效的项目建立信用和预算,再把优化函数换到客户侧。
来源。 Emerald Emerging Markets Case Studies(2024 年学术案例研究,摘要);Harvard Digital Initiative Kavak 数据战略分析(检测提速 70% 出处);Emergent《Kavak: The King of Used Car Sales》(240 项检查、50% 渗透率、利率区间、运营中心与员工数出处);a16z 投资公告;Contxto 关于 1.27 亿美元融资与估值跌 75% 的报道;Mexico Business News 关于关闭秘鲁与哥伦比亚业务;Bloomberg Línea 前员工批评报道。保留意见:Kavak 的 NPS 公开资料查不到具体数值,本卡不使用任何 NPS 数字;2026 年 2 月 F 轮 3 亿美元与「已实现盈利」的说法来自二手数据库,无第一手财报佐证,未写进正文。
五、失败与回摆
G19 Klarna:从替代 700 人到回聘人工
证据等级 A。
第一幕(2024 年 2 月 27 日,Klarna 官方通稿)。 Klarna 与 OpenAI 合作的 AI 客服助手上线首月:
| 指标 | 数字 |
|---|---|
| 处理会话 | 230 万次,占客服会话的三分之二 |
| 等价人力 | 700 名全职客服 |
| 平均解决时长 | 从 11 分钟降到 2 分钟 |
| 重复咨询 | 下降 25% |
| 覆盖 | 23 个市场、35 种以上语言 |
| 2024 年利润改善预估 | 4000 万美元 |
通稿称 AI 在客户满意度评分上与人工持平。
第二幕(2025 年 5 月)。 Klarna 公开转向,开始重新招聘人工客服。CEO Sebastian Siemiatkowski 承认,以成本为驱动的自动化带来了「更低的质量」,并承诺客户「只要想要,永远能找到人」。公司转向混合模式:AI 处理高频常规问题,人工处理升级、复杂与高价值场景;新招聘面向学生、乡村劳动者和 Klarna 忠实用户,全远程岗位。
教训。
- 上线首月的数字和一年后的数字是两个东西。 引用「700 人」这个数字时,必须同时引用 2025 年的回摆,否则就是断章取义。这条对所有做 AI 交付案例传播的人都适用。
- 回摆的直接原因不是模型不行,是指标选错了:优化的是成本和处理量,没有优化复杂与情绪化工单上的满意度。
- 「AI 优先、人工兜底」和「人工优先、AI 提效」是两条不同的路,在合同和 SLA 里写清是哪一条,比事后调模型有用得多。
来源。 Klarna 官方通稿《Klarna AI assistant handles two-thirds of customer service chats in its first month》(2024 年 2 月 27 日);Forbes《Klarna Reverses AI Push, Says Customers Prefer Human Support》(2025 年 5 月 18 日)。
G20 三个反面:Builder.ai / Scale AI / Deloitte 澳洲
证据等级 A。 这三条不是同一类失败,放在一起是因为它们分别打在 AI 交付生意的三个不同要害上。
反面一:Builder.ai——用人力冒充 AI
2016 年成立(原名 Engineer.ai),创始人 Sachin Dev Duggal,宣传口号是让做 App「像点披萨一样简单」。2018 年 A 轮 2950 万美元,2023 年融资 2.3 亿美元(投资方含微软、Insight Partners、软银、卡塔尔投资局),估值一度超 10 亿美元,2023 年被 Fast Company 列为最具创新力的 AI 公司前三。
- 2019 年 8 月,《华尔街日报》报道称 Engineer.ai「大部分编码工作用的是人类工程师而非 AI」,与其营销宣称矛盾。一位 2018 年底入职的高管在 2019 年 2 月提起诉讼,称公司是「smoke and mirrors」。
- 2025 年 5 月,彭博社指其在 2021 至 2024 年间与印度公司 VerSe 做对倒交易(round-tripping)虚增营收,部分销售数字被夸大超过 20%。
- 2025 年 2 月 27 日创始人辞任 CEO;2025 年 5 月 20 日新任 CEO 宣布进入破产程序,债权人扣押 2024 年 10 月借出的 5000 万美元;2025 年 6 月裁员约 1000 人(约 80% 员工)。
要害:诚实的边界。 Builder.ai 做的事本质是「用便宜的人力冒充 AI,按 AI 的价格收费」。它同时证明了两件事——这个套利空间真实存在,以及它一定会被戳穿。任何做 AI 交付的公司都在这条光谱上,区别只在于你是诚实地卖「人 + AI 的组合交付」,还是卖「纯 AI」然后偷偷用人补。
反面二:Scale AI——三周失去半数大客户
2025 年 6 月,Meta 以约 148 亿美元收购 Scale AI 49% 的无投票权股份(部分报道写作 143 亿美元),创始人兼 CEO Alexandr Wang 转投 Meta,首席战略官 Jason Droege 接任 CEO。随后数周内,谷歌(当年原计划支付约 2 亿美元的最大客户)计划切割、OpenAI 停止合作,微软与 xAI 也在撤离。2025 年 7 月,Scale AI 裁员,当时员工约 1200 人。2024 年营收为 8.7 亿美元。
要害:客户关系就是股东名单的函数。 服务生意的护城河不在技术,在客户关系;而客户关系可以因为你的股东结构一夜清零——尤其当你的客户互为竞争对手时,你的股东名单就是你的业务风险清单。
反面三:Deloitte 澳洲——用 AI 做交付,因为幻觉退款
客户是澳大利亚就业与工作场所关系部(DEWR),合同金额略低于 44 万澳元。报告于 2025 年 6 月交付,2025 年 10 月初公开:报告中有 12 条虚构的悉尼大学某法学教授报告引用、2 条虚构的瑞典教授引用、Robodebt 案法院判决引用错误,甚至把法官姓名拼错并伪造了归属于他的引语。Deloitte 退还了合同最后一期款项,官方声明措辞克制:
"The report has been updated to correct those citations and reference list entries which contained errors in the previously issued version..."
要害:交付环节的验证机制比生成能力更重要。 这是目前唯一一个「用 AI 做交付、因为幻觉被抓、被迫退款」的公开案例。任何要用 AI 生成交付物的团队,引用与事实核验必须是一道独立的、有人签字的工序,不能寄望于模型自查。
来源。 Builder.ai:Wikipedia 词条(汇总《华尔街日报》2019 年报道、彭博 2025 年报道与破产时间线)。Scale AI:Wikipedia 词条。Deloitte 澳洲:事件经过与合同金额来自本项目 2026 年 8 月生态调研的整理,原始报道链接待补(澳大利亚 DEWR 官网与主流媒体 2025 年 10 月报道)。
一页总结
七条可以直接带走的判断:
- 看结果先看采纳率,不看准确率。G8 的 98%、G17 的 92%、C1 的 50% 都是这个家族。
- 客服类项目优先约定承接率与升级率(G14、G15、G16),这是这个赛道已经形成的行业口径。
- 交付速度(G15 的「不到 10 周」)比效果百分比更难注水,评估交付商时更有区分度。
- 产品化的门槛是在两个量级不同的客户处都验证过(G10),不是一个客户说好用。
- 政府与公共部门项目的结果有两层,运营指标和政治合法性,只交付前者会在续约节点被推翻(G4)。
- 「AI 优先、人工兜底」和「人工优先、AI 提效」要在合同里写清是哪一条(G19)。
- 用 AI 生成交付物时,引用与事实核验必须是独立工序(G20)。
延伸阅读
- china-cases.md — 中国案例,与本页对照读,注意商业结构与场景选择的差别。
- case-template.md — 想投稿或写内部复盘,先看这里的口径规则。
- ../01-lineage/README.md — Palantir 起源与 2023–2026 扩散的脉络。
- ../04-methodology/README.md — 案例里反复出现的动作对应的方法论。
- ../09-now/README.md — G11(OpenAI Deployment Company)这类 2026 年的最新动态。
来源
按正文出现顺序(同一来源仅列一次):
- Nabeel Qureshi《Reflections on Palantir》,当事人自述,无日期署名(约 2024 年)。https://nabeelqu.co/reflections-on-palantir/
- Lenny's Newsletter《Inside Palantir》对谈 Nabeel Qureshi,2025 年。https://www.lennysnewsletter.com/p/inside-palantir-nabeel-qureshi
- Palantir Technologies 官方推文,确认与空客的合作始于 A350 产能爬坡。https://x.com/PalantirTech/status/2046562892376400283
- Tampa General Hospital 官方新闻稿,2024 年 6 月。https://www.tgh.org/news/tgh-press-releases/2024/june/tgh-selects-palantir-ai-software-connected-care-coordination
- Healthcare IT News,坦帕总医院护理协调项目报道。https://www.healthcareitnews.com/news/tampa-generals-investment-ai-enabled-care-coordination-software-saves-nearly-600-lives
- MedCity News,2025 年 2 月。https://medcitynews.com/2025/02/palantir-tampa-general-innovation-tech/
- BD Emerson《Palantir in Hospitals: On Top of the EHR》,第三方综述。https://www.bdemerson.com/article/palantir-healthcare-hospital-operations
- NHS England,FDP 合同说明页。https://www.england.nhs.uk/digitaltechnology/nhs-federated-data-platform/security-privacy/contract-explainer/
- NHS England,FDP 常见问题页。https://www.england.nhs.uk/digitaltechnology/nhs-federated-data-platform/fdp-faqs/
- UK Parliament Hansard,下议院 NHS Federated Data Platform 辩论,2026 年 4 月 16 日。https://hansard.parliament.uk/Commons/2026-04-16/debates/2FDCA71C-D0C1-4738-BEE8-A4BDA311DB99/NHSFederatedDataPlatform
- pharmaphorum,《Concerns voiced as Palantir wins £330m NHS data contract》。https://pharmaphorum.com/news/concerns-voiced-palantir-wins-ps330m-nhs-data-contract
- The Conversation,《Palantir and the NHS – 10 things you need to know》。https://theconversation.com/palantir-and-the-nhs-10-things-you-need-to-know-281165
- DefenseScoop,2025 年 5 月 23 日,Maven 合同上限上调。https://defensescoop.com/2025/05/23/dod-palantir-maven-smart-system-contract-increase/
- DefenseScoop,2026 年 4 月 15 日,Maven 转型时间表。https://defensescoop.com/2026/04/15/palantir-maven-smart-system-pentagon-program-transition-feinberg/
- SpaceNews,五角大楼扩大 Project Maven 预算。https://spacenews.com/pentagon-boosts-budget-for-palantirs-ai-software-in-major-expansion-of-project-maven/
- Business Wire,Palantir 与法拉利合作通稿,2022 年 2 月 10 日。https://www.businesswire.com/news/home/20220210005312/en/Palantir-Technologies-Extends-Partnership-with-Ferrari-to-Bring-Data-Driven-Performance-Decisions-to-Race-Operations
- Ferrari 官网,续约公告。https://www.ferrari.com/en-US/formula1/en-AE/articles/ferrari-renews-partnership-with-palantir
- Palantir 官方 AIP Bootcamp 页面。https://www.palantir.com/platforms/aip/bootcamp/
- Palantir 官方博客《Deploying Full Spectrum AI in Days: How AIP Bootcamps Work》。https://blog.palantir.com/deploying-full-spectrum-ai-in-days-how-aip-bootcamps-work-21829ec8d560
- GTM Foundry《Palantir's Bootcamp GTM Strategy》,二手分析。https://www.gtmfoundry.vc/p/palantirs-bootcamp-gtm-strategy
- ZenML LLMOps Database,OpenAI FDE(Colin Jarvis 访谈整理)。https://www.zenml.io/llmops-database/forward-deployed-engineering-bringing-enterprise-llm-applications-to-production
- ZenML LLMOps Database,OpenAI / Ramp / Nominal / Dataland 条目。https://www.zenml.io/llmops-database/forward-deployed-engineering-for-enterprise-llm-adoption
- MarketScale,OpenAI 企业推进与 FDE 报道,二手。https://www.marketscale.com/industries/software-and-technology/openais-150-million-enterprise-push-puts-forward-deployed-engineers-inside-client-operations
- digit.fyi,OpenAI 收购 Tomoro 报道。https://www.digit.fyi/openai-acquires-scottish-ai-firm-tomoro-in-4bn-deployment-drive/
- Techstrong.ai,OpenAI Deployment Company 报道。https://techstrong.ai/articles/openai-launches-4-billion-venture-for-enterprise-market-acquires-tomoro/
- MediaPost,2026 年 5 月 12 日。https://www.mediapost.com/publications/article/414994/openai-launches-ai-services-outsourcing-company.html
- Anthropic 官方客户案例页。https://claude.com/customers
- ZenML LLMOps Database,Anthropic 生产级 agent 经验条目。https://www.zenml.io/llmops-database/building-production-ai-agents-lessons-from-claude-code-and-enterprise-deployments
- Distyl AI 官网案例页。https://distyl.ai/case-studies/
- PR Newswire,Distyl B 轮融资通稿,2025 年 9 月。https://www.prnewswire.com/news-releases/distyl-ai-raises-175-million-at-1-8-billion-valuation-to-help-global-enterprises-become-ai-native-302564270.html
- Yespress,Distyl 深度报道。https://yespress.io/distyl
- Sierra 官网客户页。https://sierra.ai/customers
- Cheeky Pint(Stripe)播客对谈 Bret Taylor 转录,2026 年 3 月 10 日。https://cheekypint.substack.com/p/bret-taylor-of-sierra-on-ai-agents
- Decagon 官网与案例页。https://decagon.ai/
- Harvey 官网客户页。https://www.harvey.ai/customers
- Emerald Emerging Markets Case Studies,Kavak 学术案例研究,2024 年(全文付费,本卡只用到摘要)。https://www.emerald.com/insight/content/doi/10.1108/eemcs-04-2024-0181/full/html
- Harvard Digital Initiative(d3),Kavak 数据战略分析。https://d3.harvard.edu/platform-digit/submission/kavak-leveraging-data-to-become-the-most-valuable-startup-in-latin-america/
- Emergent(Mikal Khoso),《Kavak: The King of Used Car Sales》。https://www.reademergent.com/p/kavak-the-king-of-used-car-sales
- a16z 投资公告。https://a16z.com/announcement/investing-in-kavak/
- Contxto,Kavak 1.27 亿美元融资与估值下跌 75%。https://www.contxto.com/en/funding/kavak-raises-127-million-round-and-ends-up-with-75-lower-valuation/
- Mexico Business News,Kavak 关闭秘鲁与哥伦比亚业务。https://mexicobusiness.news/automotive/news/kavak-cease-operations-peru-and-colombia-2024
- Bloomberg Línea,前员工批评 Kavak 客服与管理,单向视角。https://www.bloomberglinea.com/english/former-employees-lambast-kavak-for-customer-service-failures-bad-management/
- Klarna 官方通稿,2024 年 2 月 27 日。https://www.klarna.com/international/press/klarna-ai-assistant-handles-two-thirds-of-customer-service-chats-in-its-first-month/
- Forbes,Klarna 转向报道,2025 年 5 月 18 日。https://www.forbes.com/sites/quickerbettertech/2025/05/18/business-tech-news-klarna-reverses-on-ai-says-customers-like-talking-to-people/
- Wikipedia,Builder.ai 词条(汇总《华尔街日报》2019 年、彭博 2025 年报道)。https://en.wikipedia.org/wiki/Builder.ai
- Wikipedia,Scale AI 词条。https://en.wikipedia.org/wiki/Scale_AI
全页保留意见。(一)G3 的「8%」、G9 的「70% / 6 倍」、G20 中 Deloitte 澳洲一节的原始报道链接,本次调研未拿到一手出处,已在正文中逐条标注,引用前请自行再核。(二)G7 的转化率与单笔金额、G11 的官方公告页,均缺一手链接。(三)所有厂商官网客户页(G12、G13、G14、G15、G16、G17)的数字都是一方自述口径,无第三方审计,引用时必须写明。(四)本页不使用任何未标注出处的「某财富 500 强企业」类传闻数字。