模型选型(截至 2026 年 9 月)
给要在客户现场当场决定「这个环节用哪个模型」的 FDE。这一页给出截至 2026-09-06 各家官方定价页上的口径、按场景的选型建议,以及一份「怎么算账」的方法。
时效声明与免责:模型这一层的半衰期是月,不是年。本页所有价格与型号均取自厂商官方定价页,核实日期 2026-09-06,并逐条给出链接。你读到这一页的时候,大概率已经有新型号了——把本页当成「怎么看这张表」的方法,不要当成结论。 凡是本次没能从官方页拿到的数据,本页写「【待核实】」并给出应查的官方入口,不用搜索结果里的转述数字凑数。
一、先说三件比型号更重要的事
1. 按 token 单价比价,会得出错误结论
不同厂商的分词器(tokenizer)切分同一段文本得到的 token 数不同,同一段中文在不同模型下的 token 数可以差 30% 以上。Anthropic 官方文档明确写着:Claude 4.7 及以后的模型换了新分词器,「对同一段文本产生约多 30% 的 token」(定价页注释)。
所以正确的比价单位不是 $/1M token,而是 $/次完成的任务:拿你自己场景的 20 条真实样本,各模型实跑一遍,记 usage 里的实际 token 数乘以单价。这件事花半天,能省掉整个项目的口径争议。
2. 缓存(prompt caching)和批量(batch)的折扣,通常比换模型省得多
- Claude:缓存命中价 = 基础输入价的 0.1 倍(Fable 5.1 是 0.025 倍);Batch API 输入输出各打五折。
- OpenAI:cached input 普遍是标准输入价的 1/10。
- Gemini:context caching 读取约为输入价的 1/10;batch 五折。
- DeepSeek:缓存命中价约为未命中价的 1/30,且有分时段(peak / off-peak)折扣。
先把系统提示词和固定文档挪到缓存前缀里,再谈降级模型。 一个前缀稳定的 agent,缓存命中率上去以后省的钱经常超过从旗舰降到中档模型省的钱,而且不损失质量。
3. 「最强模型」和「最合适模型」在交付现场几乎从不是同一个
FDE 现场真正决定成败的,是上下文里塞了什么,不是模型排行榜第几。把一个中档模型配上干净的 Ontology / 检索 / 工具,几乎总是打得过一个旗舰模型配上一坨原始 PDF。这条见 ../04-methodology/context-engineering.md。
二、海外三家(官方定价,2026-09-06 核实)
Anthropic Claude
来源:platform.claude.com/docs/en/about-claude/pricing(下表为「基础输入 / 输出」,单位 USD / 每百万 token)
| 模型 | 模型 ID | 上下文 | 输入 | 输出 | 缓存命中 | Batch(输入/输出) |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 | claude-fable-5-1 | 1M | $10 | $50 | $0.25 | $5 / $25 |
| Claude Fable 5 | claude-fable-5 | 1M | $10 | $50 | $1 | $5 / $25 |
| Claude Opus 5 | claude-opus-5 | 1M | $5 | $25 | $0.50 | $2.50 / $12.50 |
| Claude Opus 4.8 | claude-opus-4-8 | 1M | $5 | $25 | $0.50 | $2.50 / $12.50 |
| Claude Sonnet 5 | claude-sonnet-5 | 1M | $2 | $10 | $0.20 | $1 / $5 |
| Claude Sonnet 4.6 | claude-sonnet-4-6 | 1M | $3 | $15 | $0.30 | $1.50 / $7.50 |
| Claude Haiku 4.5 | claude-haiku-4-5 | 200K | $1 | $5 | $0.10 | $0.50 / $2.50 |
要点:
- Sonnet 5 的 $2/$10 已经从「限时导入价」转为标准价。官方定价页注明:原计划 2026-09-01 涨到 $3/$15 的调整不会发生。这是 2026 年性价比变化最大的一条。
- Claude 4.6 及以后的模型,1M 上下文按标准价计费,没有长上下文加价档。
- Fable 5.1 是最贵的一档($10/$50),换来的是最强的长程 agentic 能力;它的缓存命中价被降到 $0.25(基础价的 2.5%),长前缀重复调用的场景下,实际单价可能反而比想象中低。
- Fast mode(研究预览,仅 Opus 5 / Opus 4.8,仅一方 API)按 $10/$50 计价,换约 2.5 倍输出速度。
- 服务端 web search 另计 $10 / 1,000 次搜索;web fetch 不额外收费。
- 还有一条限量供给的 Mythos 5.1(Project Glasswing),价格与 Fable 5.1 相同,普通读者接触不到,知道有这回事即可。
OpenAI
来源:developers.openai.com/api/docs/pricing(USD / 每百万 token)
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| gpt-6-astra | $10 | $1 | $50 |
| gpt-5.6-sol | $4 | $0.40 | $20 |
| gpt-5.6-terra | $2 | $0.20 | $12 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5 | $0.50 | $30 |
| gpt-5.5-pro | $30 | — | $180 |
| gpt-5.4 | $2.50 | $0.25 | $15 |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 |
| gpt-5.4-nano | $0.20 | $0.02 | $1.25 |
| gpt-5.1 / gpt-5 | $1.25 | $0.125 | $10 |
| gpt-5-mini | $0.25 | $0.025 | $2 |
| gpt-5-nano | $0.05 | $0.005 | $0.40 |
要点:
- 2026 年 OpenAI 的命名从「数字版本」转向「数字 + 代号」(Astra / Sol / Terra / Luna),同一代里 sol > terra > luna 是能力与价格递减。
- 定价页对部分型号标注「长上下文变体按双倍费率计费」,超长输入的场景要看清所选型号有没有长上下文档。
-pro后缀档($30/$180)是给「一次调用值这个钱」的高价值判断场景准备的,不适合放进高频循环。
Google Gemini
来源:ai.google.dev/gemini-api/docs/pricing(USD / 每百万 token,标准档)
| 模型 | 输入 | 输出 | 缓存 | 免费档 |
|---|---|---|---|---|
| gemini-3.8-flash | $0.75※ | $3.75※ | $0.075※ | 有 |
| gemini-3.7-flash | $0.75※ | $3.75※ | $0.075※ | 有 |
| gemini-3.5-flash | $1.50 | $9.00 | $0.15 | 有 |
| gemini-3.5-flash-lite | $0.30 | $2.50 | $0.03 | 有 |
| gemini-3.1-flash-lite | $0.25 | $1.50 | $0.025 | 有 |
| gemini-3.1-pro-preview | $2.00 | $12.00 | $0.20 | 无 |
| gemini-2.5-pro | $1.25 | $10.00 | — | 有 |
| gemini-2.5-flash-lite | $0.10 | $0.40 | — | 有 |
| gemini-embedding-2 | $0.20(文本) | — | — | 有 |
※ 官方标注为促销价,有效期至 2026-12-31,2027-01-01 起翻倍。把 Gemini Flash 写进长期成本模型的,要按翻倍后的价格做敏感性分析。
要点:
- Gemini 是三家里唯一在 API 层保留实用免费档的,做 POC 和给学员做练习环境时优势明显。
pro与部分型号的价格按提示长度分档(≤200k vs >200k),长文档场景要看清自己落在哪一档。
三、开源与国产(截至 2026-09-06)
这一节的价格数据可得性明显低于海外三家:多数国内厂商的定价页是前端渲染的,自动抓取拿不到表格。本页只写从官方页面确认到的部分,其余标【待核实】并给官方入口。
DeepSeek
来源:api-docs.deepseek.com/quick_start/pricing
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| deepseek-v4-flash | $0.007–$0.014 | $0.22–$0.44 | $0.66–$1.32 |
| deepseek-v4-pro | $0.022–$0.044 | $0.66–$1.32 | $1.98–$3.96 |
| deepseek-v4-flash-vision-exp | $0.007–$0.014 | $0.22–$0.44 | $0.66–$1.32 |
区间来自分时段计费(UTC 工作时段为高价,非高峰为低价)。官方文档记录的当前快照版本为 Flash-0731 与 Pro-0813。全系 1M 上下文、最大输出 384K,支持 JSON 输出、工具调用,并兼容 Anthropic API 格式——这一条对已经写了 Claude 客户端的团队意义很大,切换成本极低。flash 档并发上限 2,500,pro 档 500。
DeepSeek 是国内唯一把「缓存命中价压到未命中价 1/30」写进公开定价的厂商,对长系统提示词的 agent 场景是结构性优势。
阿里 Qwen / 百炼
来源:help.aliyun.com/zh/model-studio/models
官方模型列表页上确认到的当前主力商用型号:qwen3.8-max(旗舰)、qwen3.7-plus(能力与成本平衡)、qwen3.8-flash(快速档)、qwen3.5-omni-plus(多模态)、text-embedding-v4(向量)。
值得注意的是:百炼平台上同时上架了第三方模型——deepseek-v4-pro / v4-flash、kimi-k3、GLM-5.3、MiniMax-M3 都能在同一个控制台调用。对于「客户只批了一个云厂商」的现场,这意味着换模型不必换供应商关系。
具体单价与免费额度:【待核实】——官方定价表为前端渲染,本次未取到。请以 百炼控制台的模型广场 页面为准。
智谱 GLM
来源:docs.bigmodel.cn/cn/guide/start/model-overview
| 模型 | 上下文 | 官方描述 |
|---|---|---|
| GLM-5.3 | 1M | 旗舰,官方称「编程与智能体能力比肩 Claude Fable 5」 |
| GLM-5.3-Flash | 1M | 多模态 |
| GLM-5.2 | 1M | 长程任务 |
| GLM-5.1 | 200K | 官方称「Coding 能力对齐 Claude Opus 4.6」 |
| GLM-5 / GLM-4.7 / GLM-4.6 | 200K | 通用推理与工具调用 |
| Embedding-3 | 8K | 向量 |
「比肩 / 对齐某某模型」是厂商自述,不是第三方评测结论,写进方案前请自己在客户场景上跑一遍对比。价格:【待核实】,官方入口 https://open.bigmodel.cn/pricing。
月之暗面 Kimi
来源:platform.kimi.com/docs/pricing/chat(原 platform.moonshot.cn 已 301 跳转到此域名)
当前三个主力型号:Kimi K3(旗舰,1M 上下文)、Kimi K2.7 Code(编码专用,支持多模态)、Kimi K2.6(视觉 + 文本)。中文按约 1 token ≈ 1.5–2 个汉字估算。逐档单价:【待核实】。
MiniMax、豆包(火山方舟)、百度千帆
- MiniMax:当前主力为 MiniMax-M3(在阿里百炼模型列表上确认到)。官方入口 https://platform.minimaxi.com/。单价【待核实】。
- 豆包 Doubao / 火山方舟:官方入口 https://www.volcengine.com/product/ark。本次自动抓取返回空页,型号与单价均【待核实】。火山方舟的公开卖点一直是「同档位价格最低 + 企业级私有化」,验证请以控制台价格表为准。
- 百度千帆:官方入口 https://cloud.baidu.com/product/wenxinworkshop。【待核实】。
开源权重
需要权重落地到客户机房时,2026 年可用的路径见 data-and-platforms.md 的私有化一节。运行时(Ollama、vLLM、SGLang、llama.cpp、Xinference)的选型也在那一页。
选开源权重时问三个问题,顺序不能反:
- 许可证允许商用吗? 部分国产权重带附加条款(用户规模上限、需要额外授权),交付合同签之前必须让法务看过。
- 客户有没有能跑它的卡? 一个 70B 级模型的推理机器成本,很多时候超过一年的 API 费用。先算这笔账再谈情怀。
- 谁负责它未来一年的升级? 私有化部署的隐性成本不在部署那天,在第 6 个月开源社区已经迭代三代、而客户机房里还是老权重的那天。
四、按场景的选型建议
下面每一格给的是起点,不是答案。任何一格都要用你自己的 20 条样本验证过再写进方案。
| 场景 | 起点建议 | 理由 |
|---|---|---|
| 长文档理解 / 全库问答 | Claude Sonnet 5、Gemini 3.x Flash、DeepSeek v4 | 三者都是 1M 级上下文且中档定价;先试「整篇塞进去」,跑不通再上 RAG |
| 代码生成 / 编码 agent | Claude Opus 5 或 Fable 5.1;成本敏感用 Sonnet 5 | 编码是目前最吃模型能力、也最容易验证收益的场景,别在这里省钱 |
| 结构化抽取(发票、合同、工单) | 便宜档 + 强约束输出:Haiku 4.5、gpt-5.6-luna、gemini-3.x-flash-lite、deepseek-v4-flash | 这类任务的质量主要由 schema 约束和后校验决定,不由模型档位决定;一定要开结构化输出 / strict schema |
| 中文业务对话与写作 | 国产模型(Qwen、GLM、Kimi、豆包)与 Claude / Gemini 都要实测 | 中文能力差距在 2026 年已经不像 2024 年那样一边倒,别凭印象站队 |
| 本地 / 私有化部署 | 开源权重 + vLLM / SGLang;小规模用 Ollama | 见 data-and-platforms.md |
| 高频、低价值的批量任务 | 最便宜档 + Batch API + 缓存 | 三个折扣叠起来常常是一个数量级 |
| 一次性的高价值判断(尽调、风控复核) | -pro / 旗舰档,单次成本无所谓 | 这里省下的钱远小于判错的代价 |
| 客户要求数据不出境 | 国内云上的模型服务,或私有化开源权重 | 这是合规约束,不是技术选型;先问清楚再设计 |
五、给客户算账的最小模板
在方案里放这张表,比放任何 benchmark 截图都有用:
| 项 | 怎么填 |
|---|---|
| 单次任务平均输入 token | 实测 20 条取均值,别估 |
| 其中可缓存的固定前缀占比 | 系统提示词 + 固定文档的占比 |
| 单次任务平均输出 token | 实测 |
| 每天任务数 | 业务方给,写清是现状还是目标 |
| 单价(输入 / 缓存 / 输出) | 抄本页表格,附链接和核实日期 |
| 每月模型成本 | 算出来 |
| 每月节省的人力成本 | 用 templates.md 里的 ROI 测算表口径 |
| 比值 | 低于 5 倍的项目,扩大之前要再想想 |
一个反复出现的经验:在绝大多数企业内部场景里,模型 API 费用只占项目总成本的个位数百分比,人力和数据治理才是大头。因此「为了省 API 费用而降级模型导致效果不达标」,是 FDE 现场最不划算的一种省钱。
延伸阅读
- agent-dev-stack.md — 选完模型,用什么框架把它装进 agent
- eval-tools.md — 换模型必须重跑同一套 eval,工具在这里
- data-and-platforms.md — 私有化部署与国内云平台的选项
- ../04-methodology/context-engineering.md — 比选模型更重要的:往上下文里放什么
- ../05-practice/security-procurement-legal.md — 备案义务、数据出境门槛:决定这张表里哪几行你根本不能选
- ../05-practice/china-specifics.md — 国产模型的六条选型判据与备案硬门槛
- Anthropic 模型概览 https://platform.claude.com/docs/en/about-claude/models/overview — 每个型号的能力、上下文、弃用时间表,官方唯一权威口径
- Anthropic 模型弃用页 https://platform.claude.com/docs/en/about-claude/model-deprecations — 做长期交付一定要订阅这一页
来源
- Anthropic, Pricing(模型价格、缓存倍率、Batch 折扣、分词器变更说明、Sonnet 5 定价维持公告),核实 2026-09-06,https://platform.claude.com/docs/en/about-claude/pricing
- OpenAI, API Pricing,核实 2026-09-06,https://developers.openai.com/api/docs/pricing
- Google, Gemini API Pricing(含促销价到期日说明),核实 2026-09-06,https://ai.google.dev/gemini-api/docs/pricing
- DeepSeek, Models & Pricing,核实 2026-09-06,https://api-docs.deepseek.com/quick_start/pricing
- 阿里云百炼,模型列表,核实 2026-09-06,https://help.aliyun.com/zh/model-studio/models
- 智谱 BigModel,模型概览,核实 2026-09-06,https://docs.bigmodel.cn/cn/guide/start/model-overview;定价入口 https://open.bigmodel.cn/pricing
- Kimi 开放平台,计费说明,核实 2026-09-06,https://platform.kimi.com/docs/pricing/chat
- 火山引擎方舟平台,https://www.volcengine.com/product/ark(本次未取到结构化数据)
- 百度智能云千帆,https://cloud.baidu.com/product/wenxinworkshop(本次未取到结构化数据)
- MiniMax 开放平台,https://platform.minimaxi.com/(本次未取到结构化数据)