干系人与数据获取
给正在一个真实现场里卡住的 FDE:需求聊完了、方案想好了,但是数据要不到、流程改不动、大家都同意却没人拍板。这一页讲怎么画干系人地图、四类人各自的激励结构是什么、拿数据该怎么谈、拿到数据后 48 小时内要做完哪些体检,以及权限与脱敏怎么设计。
为什么这一页排在技术之前
Nabeel Qureshi 在 Palantir 八年的总结里给了两条判断:一个 AI 项目里九成五的工作是数据的接入、清洗和关联;以及,在大企业里拿到自己公司的数据难于登天,一个 8 到 12 周的试点,光拿数据就可能耗光全部时间(Reflections on Palantir)。
这两条在 2026 年仍然成立,只是含义变了。模型是买的、脚手架是开源的、代码是 agent 写的,这几块的成本塌了一个数量级。没塌的是「把业务的真实规则、老师傅的隐性判断、组织的真实权力关系,搬进模型能用的形态」这件事,而这件事的入口是人,不是接口。
所以这一页讲的不是数据工程,是谈判。
一、干系人地图:五种人,名字写出来
不要画组织架构图。组织架构图上没有你需要的信息。要画的是这张表,每一格必须填一个具体的人名。
| 角色 | 定义 | 他的激励结构 | 你要从他那里拿到什么 | 不搞定的后果 |
|---|---|---|---|---|
| 拍板人(D) | 有权说「这个流程可以改」的那一个人 | 他的季度目标、他向谁汇报、他今年最怕出什么事 | 每周 2 小时 + 验收当天到场 | 「大家都同意,但没人拍板改流程」 |
| 掏钱的 | 预算归谁 | 预算科目、审计口径、他的成本考核 | 知道他的考核指标是什么 | 结项汇报时他会问你不想被问的问题 |
| 天天用的 | 一线用户 | 他的计件 / 工时 / 差错率考核 | 至少 3 个人愿意当第一批试用 | 上线后周活个位数 |
| 被动了奶酪的 | 这件事做成之后谁的价值感或权力被削弱 | 信息不对称带来的不可或缺性 | 提前知道他是谁 | 他不会正面反对,他会在你需要配合的每一个环节慢半拍 |
| 数据看门人 | 那张表只有他懂口径 | 责任规避 + 地位确认 | 数据 + 口径解释 | 项目在第二周停摆 |
决策权只借一条:D 必须唯一
Bain 的 RAPID 模型(Paul Rogers & Marcia Blenko,《Who Has the D?》,Harvard Business Review,2006)有五个角色,对一场 30 天单场景是过度设计。只借「D 必须唯一」这一条就够。
但在中国企业里要加一层拆分。最典型的烂尾形态是:技术方案的 D 是 IT、流程变更的 D 是业务、上线授权的 D 是老板,三个人互相等。所以地图上不要只写一个 D,按决策类型写三个:
- 技术方案谁定?
- 流程变更谁定?
- 上线授权谁定?
三个格子填不满,别往下走。
怎么把这张表填出来
三个动作,按可靠性排序:
- 走廊观察(最可靠)。跟班的时候看别人遇到问题时去问谁、谁一说话别人就停下来、谁的名字在别人的抱怨里反复出现。
- 尸体考古。把上一个失败项目挖出来:谁做的、什么时候没的、当时谁在反对。反对者的名单基本就是这次的「被动了奶酪的」名单。
- 直接问,但要问对方式。对部门负责人问:「这件事做成了,您这边会不会有人不高兴?」——这句能问出来的都是宝贵信息,问不出来说明信任还不够。
二、四类人各自的激励结构
干系人地图只写「他是谁」,这一节写「他为什么这么反应」。看不懂激励结构,所有沟通技巧都是猜。
老板 / 掏钱的人
他要的通常不是 AI,是一个能在他自己的汇报里立得住的数字。判断依据有两条公开可引的:
- 一位受访 CIO 的原话是「谁能解决问题我用谁,FDE 不 FDE 我不在乎」(转引自公众号「一荔说OPC」《你招的不是 FDE,是月薪十万的外包》,2026-08-25)。名词卖不动,结果才卖得动。
- MIT NANDA 的《The GenAI Divide: State of AI in Business 2025》分析了 300 个公开的企业生成式 AI 部署项目,结论是 95% 的项目对损益表没有可衡量的影响,行业当年在此投入 300 至 400 亿美元(报告 PDF)。老板见过这条新闻,你要预设他心里已经打了折扣。
对他要问的第一个问题不是「您有什么需求」,是「如果这件事做成了,您手上哪个数字会变?」
业务方 / 拍板人
他的风险感受和你不对称:项目失败他要承担改流程的政治成本,项目成功功劳未必是他的。所以他真正在计算的是「这件事出错的时候,我怎么解释」。
这决定了两件事:一是方案不能降低他现有的风险防御能力(哪怕现有做法很笨);二是必须给他一个可以体面停止的出口。允许以「建议停止」结项,且不计负面绩效,写下来。
IT / 数据团队
IT 部门的激励是稳定与合规,不是创新。他的考核里有故障率、有等保测评、有审计整改,没有一项是「配合业务做 AI 试验」。所以他对你的默认反应不是敌意,是风险规避。
对 IT 最有效的一笔交易是:用「不碰生产系统」换「不走常规上线评审流程」。具体写成四个约束:不写入生产库、不对外网开放、访问日志完整留存、涉及个人信息按公司现行规范处理。这四条列全了,安全和 IT 才可能签字;少一条都不会签。
(安全审查的完整问题清单见 安全、采购与法务。)
数据看门人
他的诉求往往不是技术,是地位确认。表面上他在问「你要这个数据干什么、有没有审批」,实际上他在确认自己是不是还不可或缺。
一份公开的中文交付病历里记录了同一个人身上的两次谈判:第一次谈「我要数据」,谈崩,白等六天;第二次谈的是行级权限和审计日志,当天就给了。当事人自己的结论是「这六天是我自己的学费」(任鑫《中国 FDE 手册》03-模板库《交付病历》填好样例)。
三、拿数据的五个筹码
按顺序用,不要跳。
| # | 筹码 | 怎么说 | 为什么有效 |
|---|---|---|---|
| 1 | 地位确认(先给地位,别先要数据) | 「这几张表的口径,全公司还有谁懂?」 | 这句话看起来是技术问题,实际是在请他确认自己的位置。他确认了,才会开始帮你 |
| 2 | 挖坑 | 「哪个字段我要是直接用了,会踩坑?」 | 把他从「审批者」变成「保护你的人」 |
| 3 | 署名 | 「口径文档我写好之后署您的名,可以吗?」 | 让他成为规则的定义者,而不是被绕过的人 |
| 4 | 减负 | 「您每周手工出的那张报表,我顺手自动化掉」 | 用一件与主线无关的小事,换一次真配合。花两天,值 |
| 5 | 安全牌 | 「数据进来之后是只读副本,有行级权限和完整审计日志,比现在散在各人电脑里安全」 | 这是化解数据看门人的标准打法,而且它是真的 |
| — | 收尾必须落到日期 | 「那我们定 X 月 X 日之前拿到第一批切片,可以吗?」 | 没有日期的承诺在企业内部成本为零 |
一句要背下来的反例:对方说「数据没问题,你先开始,流程我们后面补」——这不是配合,是把风险从他那边挪到你这边。数据切片没实际到你手上之前,一行代码都不要写。
四、被动了奶酪的人:识别与处理
这一类人是所有交付里最贵的隐性成本,而且埋点日志里看不到,agent 诊断不出来。
三个识别信号
- 他现在的价值来自信息不对称。「只有他知道那个表怎么算」「只有他清楚哪个客户不能得罪」。你的系统一旦把这些变成公开的,他就从「不可或缺」变成「一个岗位」。
- 这件事会让他的考核数字变难看。比如你的系统第一次把隐性的返工次数统计出来,而且会进他领导的报表。
- 他管的人会变少。
一个几乎不会错的行为特征
极度配合,零抱怨,零使用。
真正嫌产品烂的人会骂你;真正不会用的人会问你;只有这一类会对你笑。
三种处理,按优先级
- 给他署名,让他成为规则的定义者。 系统里的判定规则标注「本规则由李工定义」,汇报里点名感谢。成本最低、效果最好,而且这不是权术——评估标准本来就该由他定。
- 让他先受益一次。 先做一件让他自己轻松的事,哪怕和主线无关。
- 给他退路。 如果他管的活确实要被替代,这件事不该由你来谈,但必须由你来提——提给你的负责人,让他去谈。抵抗的成本远高于安抚的成本。
Prosci 的 ADKAR 模型(Jeff Hiatt,2006)说一个人完成一次改变要依次达成认知、意愿、知识、能力、巩固五个结果,进度被第一个不足的环节卡死。ADKAR 原版假设组织利益是对齐的,这个假设在真实企业里不成立,所以「受损者的出路」必须被显式设计,而不是靠培训或者考核硬推。
五、数据质量摸底清单
拿到第一批切片之后 48 小时内跑完。agent 一小时能出前八项,人负责后四项。
| # | 检查项 | 怎么查 | 红线 |
|---|---|---|---|
| 1 | 字段空值率 | 逐字段统计 | 关键字段空值率 > 30%,方案要重新设计 |
| 2 | 取值分布与异常值 | 直方图 + 极值 | 出现「9999」「1900-01-01」这类哨兵值 |
| 3 | 时间断层 | 按月统计行数 | 某个月突然为 0 或翻倍,一定有故事 |
| 4 | 编码 / 口径变更史 | 问看门人:「这张表 20XX 年前后,算法有变过吗?」 | 变更点之前的数据可能整段作废 |
| 5 | 主键与关联 | 尝试 join | 两张表用两套主键、客户 ID 不通,是最常见的隐藏工作量 |
| 6 | 重复与冲突 | 唯一性检查 | — |
| 7 | 时区与单位 | 抽样人工核对 | 金额含税 / 不含税、时间是本地还是 UTC |
| 8 | 数据量级与代表性 | 与业务方核对总量 | 切片只覆盖一个分公司却被当成全量 |
| 9 | 自由文本字段的真实用途 | 人工读 100 条 | 「拒赔理由」字段可能 87% 是复制粘贴,或者「缺陷等级」被质检员挪用成了备注栏 |
| 10 | 标注 / 判定日志的质量 | 抽样让老师傅复核 | 历史判定本身就是错的,会「用错误喂养错误」 |
| 11 | 脱敏之后还能不能解决原问题 | 用脱敏数据跑一遍第 2 周的手动验证 | 关键特征被脱掉了,问题就不再是原来那个问题 |
| 12 | 两个数打架的地方 | 主动找矛盾 | 见下 |
第 12 项单独说:找互相打架的数
内部数据里最有信息量的地方,不是最漂亮的那个数,是两个互相矛盾的数。
看到两个打架的数字,不要选一个信,去把它们的分母问出来。问出来之后通常是三种情况之一:
- 两个部门在用同一个词说不同的事——这就是口径冲突,你找到了;
- 有一个数字是给上面看的,另一个是内部真用的——你找到了一条关于这家公司的重要信息,记下来;
- 两个数都没人负责,是不同时期不同人算的——这个指标不能当基线,目标指标要换一个。
就绪度分级:一套不得罪人的共同语言
Neil Lawrence 的 Data Readiness Levels(arXiv:1705.02245,2017)把数据分三档:
- Band C(可及性):数据「据说存在」,但你还没拿到、也没验证过;
- Band B(忠实性):拿到了,但是生数据,字段含义、缺失、口径都没验过;
- Band A(可用性):已经和你的具体问题对齐了,可以直接用。
Lawrence 论文里最有用的一句话是:这套分级的价值在于给双方一套共同语言,去谈「数据到底准备好了没有」。
这对内部 FDE 特别有用。「你们给我的数据还不能用」这句话在中国企业里说出来是得罪人的;有了 Band 这个词,你说的就不是「你们不行」,而是**「这份数据现在在 B 档,我们一起把它推到 A」**。
六、权限与脱敏
五条设计原则
- 只读副本,不接生产库。 这是换取「不走常规上线评审」的对价,也是安全部门唯一关心的事。
- 最小权限 + 行级权限。 按业务范围切,而不是按系统切。「华东区退货单 2025 年 1 月至今」比「ERP 只读账号」好谈十倍。
- 完整审计日志。 谁在什么时候查了什么,可回溯。这一条是你的护身符,不是负担。
- 默认不出域。 数据不落个人电脑、不进公网 SaaS、不进未审批的模型 API。跨境传输另有专门规则,见 安全、采购与法务。
- 有期限、有销毁。 授权期结束后副本销毁,并留销毁记录。
脱敏方式对照
| 方式 | 做法 | 保留什么 | 什么时候不能用 |
|---|---|---|---|
| 掩码 | 手机号中间四位打星 | 格式 | 需要按号码去重或关联时 |
| 泛化 | 出生日期 → 年龄段;地址 → 城市 | 分布 | 需要精确地理或时序时 |
| 假名化 | 真实 ID → 稳定映射的假 ID | 可关联性 | 映射表本身泄露即失效,映射表要单独管控 |
| 删除 | 直接去掉字段 | 无 | 该字段是判断依据时 |
| 合成数据 | 生成统计相似的假数据 | 分布 | 验证真实问题时不能用,它是演示用的 |
必须做的一步:脱敏之后,用脱敏数据把第 2 周那 10 到 30 条手动验证再跑一遍。如果跑不出原来的结论,说明脱敏把问题本身脱掉了,回去重谈脱敏规则,而不是硬着头皮往下做。
三条红线
- 不把真实业务数据贴进未经审批的外部模型接口。 这是中国企业目前最高频的一类事故,而且它通常不是恶意,是赶进度。
- 不绕开看门人自己找路径拿数。 你能拿到一次,之后这个人会用两年时间让你拿不到第二次。
- 不把「我有权限」当成「我可以看」。 权限是技术边界,授权范围是合规边界,两者经常不一致。
七、过关检查
- [ ] 五种人的名字都写出来了
- [ ] 三类决策的 D 分别是谁,写清楚了
- [ ] 被动了奶酪的那个人找到了,且已经想好用哪种方式处理
- [ ] 数据地图六列填满,每张表标了 Band
- [ ] 至少一批数据实际到手(不是承诺到手)
- [ ] 12 项数据体检跑完,异常项逐条有处置结论
- [ ] 口径文档写了,且数据看门人是署名作者之一
- [ ] 脱敏后的回测做过,结论没变
- [ ] 权限申请里写清了范围、期限、销毁方式,且有审计日志
延伸阅读
- 本库:进场前与前 30 天清单 —— 这一页的动作在时间轴上的位置
- 本库:安全、采购与法务 —— 权限与脱敏之外的合规链
- 本库:中国现场特有的约束 —— 「数据不给」在中国的具体成因
- 本库:../04-methodology/context-engineering.md —— 拿到数据之后怎么变成 Context
- 库外:Neil Lawrence《Data Readiness Levels》 —— 十页论文,给甲乙双方一套谈数据的共同语言
- 库外:Prosci ADKAR 模型 —— 「障碍点」这个概念比五个字母本身有用
来源
- Nabeel Qureshi,《Reflections on Palantir》,2024。https://nabeelqu.co/reflections-on-palantir
- Paul Rogers & Marcia Blenko,《Who Has the D? How Clear Decision Roles Enhance Organizational Performance》,Harvard Business Review,2006 年 1 月。https://hbr.org/2006/01/who-has-the-d-how-clear-decision-roles-enhance-organizational-performance
- Jeff Hiatt,《ADKAR: A Model for Change in Business, Government and our Community》,Prosci,2006。https://www.prosci.com/methodology/adkar
- Neil D. Lawrence,《Data Readiness Levels》,arXiv:1705.02245,2017。https://arxiv.org/abs/1705.02245
- MIT NANDA,《The GenAI Divide: State of AI in Business 2025》,2025。https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
- 王一荔,《你招的不是 FDE,是月薪十万的外包》,微信公众号「一荔说OPC」,2026-08-25。文中「谁能解决问题我用谁,FDE 不 FDE 我不在乎」为作者转述一位资深 CIO 的原话,属【转述】,被引者身份未公开。
- 任鑫(Mars),《中国 FDE 手册》(fde-arsenal),02-方法论「培养旅程 · 04 真问题与 Context」,03-模板库《交付病历》。第一人称手册,主张企业内部培养。公开发布地址【待核实】。
- Everett M. Rogers,《Diffusion of Innovations》,Free Press,1962 初版 / 第 5 版 2003。