06 · 工具箱
给要在客户现场一个人把活干完的 FDE。这一章回答一个具体问题:今天进场,我该用什么? 五页内容分别覆盖模型、agent 开发栈、数据与平台、Eval 与观测、文档模板。
这一章时间敏感度最高。 本章所有版本号、价格、能力、维护状态均标注「截至 2026 年 9 月」,并由 GitHub API 与厂商官方页面于 2026-09-06 逐项核实。你读到它的时候一定已经有变化了——每一条都给了链接,用之前点开复核。凡本次没能从官方来源取到的数据,各页写「未找到公开数据」或「【待核实】」,不用二手转述的数字凑数。
一、FDE 一人工作台:六层
这张图要读出三件事:
- 模板层是虚线,因为它不产生代码,但它决定其余五层是否有人买单。 FDE 交付里有一半的产物不是软件,是让别人做决定的纸。跳过模板层的项目,技术做得再漂亮也可能在验收会上翻车。
- 数据与知识层的箭头指向 agent 层,不是被它指向。 决定效果上限的是「模型看到了什么」,不是「用了哪个框架」。这条在现场反复被验证:把中档模型配上干净的上下文,几乎总是打得过旗舰模型配一坨原始 PDF。
- 部署层往往是第一个约束,不是最后一步。 「数据能不能出网」这个问题的答案,会一路反向删掉上面四层的大部分选项。这个问题要在第一周问。
二、五页导航
| 页面 | 回答什么问题 | 什么时候翻 |
|---|---|---|
| models-2026.md | 这个环节用哪个模型?多少钱? | 方案设计时、报价时、每次换模型时 |
| agent-dev-stack.md | 用什么工具造、用什么框架装、交付给客户维护什么 | 技术选型时 |
| data-and-platforms.md | 客户的 IT 版图里怎么落地?私有化怎么做? | 进场调研后、写方案前 |
| eval-tools.md | 怎么证明这套东西行?用什么工具? | 立项后立刻,不要等到验收前 |
| templates.md | 那些「纸」长什么样?出处是谁? | 全程 |
models-2026.md — 模型选型
Claude 5 系列(Fable 5.1 / Opus 5 / Sonnet 5 / Haiku 4.5)、OpenAI GPT-6 Astra 与 5.6 系列、Google Gemini 3.x、以及国产与开源(DeepSeek、Qwen、GLM、Kimi、MiniMax、豆包)的官方定价表与型号清单,加上按场景(长文档、代码、结构化抽取、中文、本地部署、成本)的选型起点。
这一页最该记住的一条:不要按 token 单价比价——不同厂商的分词器切同一段中文得到的 token 数能差三成以上。正确的比价单位是「每次完成任务的成本」,拿你自己的 20 条真实样本各跑一遍。
agent-dev-stack.md — Agent 开发栈
分四层写:编码 agent(Claude Code、OpenAI Codex、Cursor、Gemini CLI、Cline、OpenHands)、agent 框架(Claude Agent SDK、OpenAI Agents SDK、LangGraph、CrewAI、Microsoft Agent Framework、Google ADK)、低代码平台(Dify、Coze、BISHENG、RAGFlow、FastGPT、n8n)、MCP 与 A2A 生态。每项给定位、适用场景、上手成本、开源还是商业、以及 2026-09-06 的实际状态。
这一页最该记住的一条:不要把第 1 层的爽感当成第 3 层的交付能力。 你用编码 agent 两小时做出的 demo,和客户三个月后还能自己改的系统,中间隔着的是框架与平台的选型判断。
data-and-platforms.md — 数据与平台
Palantir Foundry/AIP(Ontology、公开的 Use Case Life Cycle 方法论、AIP 产品线、Bootcamp、免费课程)、Databricks、Snowflake、微软 Foundry 与 Copilot Studio、AWS Bedrock 与 AgentCore、Google Gemini Enterprise、国内四家(百炼、火山方舟、腾讯、千帆)、向量库与文档解析、以及私有化部署的三个真实成本。
这一页最该记住的一条:Palantir 把一整套完整的交付方法论免登录公开在 palantir.com/docs 上,包括 scoping 六段模板、功能需求五元组句式、团队七角色、企业采纳四阶段。这是这个岗位最好的免费教材,而且几乎没有中文材料系统引用过它。
eval-tools.md — Eval 与观测
Braintrust、LangSmith、Langfuse、Promptfoo、Inspect(UK AISI)、DeepEval、Ragas、OpenAI Evals、Arize Phoenix、W&B Weave 的逐项现状与对比表,外加一条用免费工具就能跑起来的最小可行 eval 流程(五步,一周,零软件预算)。
这一页最该记住的一条:Eval 的成本瓶颈从来不是工具,是那一个人日的人工判断。说不出「人工标注了多少条、judge 一致率是多少」的评估报告,是空的。
templates.md — 文档模板与权威出处
丰田 A3、美军 AAR 与 BLUF、医疗 SOAP 与 SBAR、Minto 金字塔原理、Amazon PR/FAQ 与六页纸这六件通用祖先,加上落到 AI 交付场景的十二件具体模板(场景海选、访谈提纲、客户准备协议、一页立项书、任务拆解卡、Eval 设计卡、MVD 范围切割卡、采纳设计检查表、ROI 测算表、汇报一页纸、交付病历、内部授权书),每件写清祖先是谁、原版结构、什么时候用、去哪儿拿。
这一页最该记住的一条:先学原版,再用改编版。 说不出「这张表的祖先是谁、我改了哪一格、为什么」,你就只是在填表。
三、这一章的收录标准
- 能点开链接核对。 每个 star 数、价格、版本、许可证都给出处与核实日期。查不到的写「未找到公开数据」,不编。
- 一手优先。 官方定价页、官方文档、GitHub API > 媒体报道 > 二手总结。本章的 star 数与提交日期全部来自 GitHub REST API 的实时拉取,不是引用别人的统计。
- 写清维护状态。 一个工具好不好用,和它还有没有人维护,是两件事。本章明确标出停滞与归档的项目——截至 2026-09-06 记录到的就有 Flowise 已归档、AutoGen 停滞约五个月、Aider 停滞约三个半月、Ragas 停滞约六个半月、OpenAI 平台版 Evals 将于 2026-11-30 下线(10-31 转只读)、Humanloop 平台已于 2025-09-08 下线。改名与并购同样要记:Windsurf 已并入 Cognition(windsurf.com 跳转 devin.ai/desktop)、Azure AI Foundry 改名 Microsoft Foundry、AIP Agent Studio 改名 AIP Chatbot Studio、Claude Code SDK 改名 Claude Agent SDK。
- 中立。 不替读者选。给的是判断维度和适用边界,不是排行榜。
- 不收「看起来很酷」的清单。 每一项都要能回答「它解决交付流程里的哪个具体问题」。
更新节奏:本章按季度复核一次,每次复核重跑三件事——GitHub API 拉一遍 star 与最近提交日期、逐个打开厂商定价页、检查有没有新的改名与并购。复核后更新每页的 updated 字段并在正文标注变化点。如果你发现某一条已经过期,最有价值的贡献不是补上新数字,是补上「它是什么时候变的、官方公告在哪」。
四、三条跨页的判断
其一:约束先于选型。 进场后要在第一周问清三件事——数据能不能出网、客户运维团队有几个人、有没有必须国产化的要求。这三个答案会一路删掉上面几十个选项,剩下的选择通常只有两三个。先问约束,再谈工具,能省掉一半的方案返工。
其二:可维护性优先于优雅性。 你交付的东西,客户的人要能重启它、看日志、改配置。一个客户运维不动的系统,交付完成那天就是它开始腐烂的那天。 这条在选低代码平台和决定要不要私有化时权重最高。
其三:工具替代不了那两成判断。 2026 年 9 月,发明 FDE 这个岗位的公司自己发布了一个叫「AI FDE」的 agent 产品(详见 data-and-platforms.md),它能建管道、建模、写函数、生成应用——做的正是 FDE 工作里可被自动化的那一半。它不做的另一半是:选哪个场景、怎么让干系人配合、什么算好、什么条件下该停止。这一章所有的工具都在帮你把执行做掉;判断得自己赢。
五、按处境走一遍这一章
这一章不是给人从头读到尾的。下面按四种最常见的处境给阅读顺序。
处境一:我刚接到一个客户,还没进场。 先读 data-and-platforms.md 里的 Palantir Use Case Life Cycle 一节,拿到 scoping 六段模板和功能需求五元组句式;再读 templates.md 的场景海选、访谈提纲、客户准备协议三件。这个阶段一行代码都不该写,工具页可以先不看。
处境二:场景定了,要出技术方案。 按 data-and-platforms.md(先确认部署约束)→ models-2026.md(选模型并算账)→ agent-dev-stack.md(选框架与平台)的顺序读。顺序不能反——先选了框架再发现客户不能连外网,方案要重写。
处境三:东西做出来了,客户问「这玩意儿到底准不准」。 直接看 eval-tools.md 的第四节,那条五步流程一周能跑完,零软件预算。配套的 Eval 设计卡在 templates.md。
处境四:一个周期做完了,要汇报,要决定扩大还是停止。templates.md 里的 ROI 测算表(立项和复盘用同一张表)、管理层汇报一页纸(结论必须是扩大 / 调整 / 停止三选一)、交付病历。「停止」必须是真实存在的选项,否则前面所有数据都会被读成表演。
六、这一章不解决什么
- 不教怎么用这些工具的具体操作。 官方文档写得比任何二手教程都好,本章的任务是帮你选对该读哪份文档。
- 不做排行榜。 「哪个 agent 框架最好」这个问题没有脱离场景的答案。本章给的是判断维度。
- 不追每日新闻。 工具层的日常变化去 ../09-now/README.md,这一章保持季度级的更新节奏。
- 不覆盖方法论。 「怎么切范围」「怎么设计采纳」「怎么和干系人谈」都在 ../04-methodology/README.md 与 ../05-practice/README.md。
延伸阅读
- ../04-methodology/README.md — 工具之上的方法论:交付生命周期、Context、Eval、MVD
- ../05-practice/README.md — 最佳实践与反模式:前 30 天、demo 到生产、中国现场
- ../03-role/competency-model.md — 这些工具对应的是能力模型里的哪一块
- ../09-now/README.md — 本章之后的变化去哪里追
- ../00-start/glossary.md — MCP、Ontology、Eval、MVD 等术语的定义
来源
- GitHub REST API(star 数、最近提交日期、许可证、归档状态),拉取于 2026-09-06
- Anthropic, Pricing,https://platform.claude.com/docs/en/about-claude/pricing,核实 2026-09-06
- Palantir, AI FDE overview,https://www.palantir.com/docs/foundry/ai-fde/overview/,核实 2026-09-06
- Palantir, Use Case Life Cycle,https://www.palantir.com/docs/foundry/use-case-life-cycle/overview/,核实 2026-09-06
- Model Context Protocol 规范(版本 2026-07-28),https://modelcontextprotocol.io/specification/latest,核实 2026-09-06
- 各页面内的分项来源见对应页面的「来源」一节