Eval 与观测工具
给要向客户证明「这套 AI 到底行不行」的 FDE。这一页把截至 2026 年 9 月还在维护的主流 Eval(评估)与 observability(可观测)工具摆在一起对比,并给出一条用免费工具就能跑起来的最小可行流程。
时效声明:本页所有 star 数、价格、许可证、维护状态均为 2026-09-06 核实,同章其他页的时效口径见 README。这个品类换手率极高(本页记录到的 2026 年内变动就有三起:Langfuse 被 ClickHouse 收购、Ragas 换了仓库主体、OpenAI 平台版 Evals 宣布下线;另有 2025 年 9 月 Humanloop 平台下线),引用前请点开链接复核。
一、先分清三件事:Eval、Trace、Guardrail
FDE 现场最常见的混乱,是把三样东西都叫「评估」。它们解决的问题不同,工具也不同。
| 概念 | 回答的问题 | 什么时候做 | 典型工具 |
|---|---|---|---|
| Eval(离线评估) | 在一批固定样本上,这版方案得几分?改了以后是变好还是变差? | 上线前、每次改 prompt / 换模型 / 改检索 | Promptfoo、Inspect、DeepEval、Ragas、Braintrust |
| Trace / Observability(在线观测) | 线上这一次调用,模型看到了什么、调了哪些工具、花了多少 token、为什么慢? | 上线后持续 | Langfuse、LangSmith、Phoenix、Weave、Opik |
| Guardrail(在线拦截) | 这一条输出能不能放出去? | 每次请求的出口 | 各平台的 online evaluator / 规则层 |
对 FDE 来说,Eval 是交付的验收凭证,Trace 是排障和续单的燃料,Guardrail 是甲方合规部门要的东西。三者的优先级通常也是这个顺序:先有一份能跑的 Eval,再谈观测平台。
Eval 的方法论部分(怎么和业务方定义「什么算好」、怎么切 golden set、怎么设计 LLM-as-judge)在 ../04-methodology/evaluation.md,本页只谈工具。
这个闭环里最贵的是「抽样标注」那一格,而它恰恰是工具帮不上忙、必须人来赢的一格。
二、逐个工具:截至 2026 年 9 月的状态
开源、可自托管的评估框架
Promptfoo — promptfoo.dev|github.com/promptfoo/promptfoo 截至 2026-09-06:24,846 star,MIT 许可证,当日仍有提交。定位是「YAML 配置驱动的 prompt / 模型对比评测 + 红队扫描」,npx promptfoo@latest init 即可开始,不需要注册账号,评测结果本地存储。免费社区版包含全部评测能力和红队测试(探针数每月有上限);Enterprise 与 On-Premise 版本另外定价(未公开)。对 FDE 最友好的一点:客户不同意数据出网时,它可以完全离线跑。
Inspect — inspect.aisi.org.uk|github.com/UKGovernmentBEIS/inspect_ai 英国 AI Security Institute(AISI)开发并开源的评测框架,MIT 许可证。截至 2026-09-06:2,710 star,最近提交 2026-09-05。配套的 inspect_evals 仓库收录了 200 多个已实现的公开基准,658 star。Python 写 task,内置 solver / scorer 抽象和一个查看轨迹的 Web UI。star 数不高,但它是唯一一个由国家级评测机构维护的框架,在做「安全性 / 能力上限」类评估和需要向监管方交代方法论时,出处比 star 数重要。
DeepEval — github.com/confident-ai/deepeval|confident-ai.com 18,120 star,Apache 2.0,最近提交 2026-09-03。特点是「pytest 风格」:把 eval 写成单元测试,assert_test() 直接接进 CI。内置 G-Eval、忠实度、答案相关性、幻觉等一批现成 metric。背后的 Confident AI 云平台是商业化部分,免费档 2 席位 / 1 项目 / 每周 5 次测试运行,Starter $200/月,Team $2,000/月。
Ragas — docs.ragas.io|仓库已迁至 github.com/vibrantlabsai/ragas 15,629 star,Apache 2.0。注意维护状态:截至 2026-09-06,最近一次提交是 2026-02-24,已停滞约六个半月;原 explodinggradients/ragas 路径现在 302 跳转到 vibrantlabsai/ragas。Ragas 提供的是 RAG 专用指标体系(context precision / recall、faithfulness、answer relevancy),概念仍然是这个领域的通用词汇,但把它当成长期依赖前要评估维护风险。
OpenAI Evals — github.com/openai/evals 19,390 star,最近提交 2026-04-14,已趋于停滞。更重要的是平台侧:OpenAI 官方文档明确写着,平台内置的 Evals 产品将于 2026 年 10 月 31 日转为只读,2026 年 11 月 30 日正式下线,建议改用新的 Datasets 产品(developers.openai.com/api/docs/guides/evals)。如果你手上有基于 OpenAI Evals 的交付资产,2026 年内必须迁移。
商业 / 混合的观测与评估平台
Braintrust — braintrust.dev 定位是「Eval 优先」的平台:数据集、实验对比、打分器、prompt playground 一体。2026 年 2 月完成 8,000 万美元 B 轮(Iconiq 领投),公司独立运营。定价:Starter $0(每月 1GB 处理数据、10,000 次打分)、Pro $249/月、Enterprise 定制;符合条件的早期创业公司可申请 6–12 个月免费 Pro。SDK 开源,核心平台不开源、不支持完整自托管——这是在强合规甲方现场的硬门槛。
LangSmith — smith.langchain.com|langchain.com/pricing-langsmith LangChain 官方的追踪 + 评估平台,与 LangGraph 深度绑定,但不要求你用 LangChain 也能接。定价:Developer 档免费座位(含基础 trace 额度,超出按量)、Plus $39/座/月、Enterprise 定制。自托管只在 Enterprise 档提供,没有自助自托管路径。
Langfuse — langfuse.com|github.com/langfuse/langfuse 34,237 star,最近提交 2026-09-05。2026 年 1 月 16 日被 ClickHouse 收购(官方公告),ClickHouse 承诺 Langfuse 保持 100% 开源、MIT 许可、可生产级自托管,Langfuse Cloud 继续运营。核心仓库 MIT,ee/ 目录下的企业功能另有商业许可。云版:Hobby 免费、Core $29/月、Pro $199/月、Enterprise $2,499/月。这是本品类里「开源自托管 + 明码标价企业档」都齐的少数选择,也是数据不能出网场景里最常被选中的那个。
Arize Phoenix / Arize AX — github.com/Arize-ai/phoenix|arize.com/pricing Phoenix 11,340 star,最近提交 2026-09-05,开源、本地优先,pip install arize-phoenix 后可以在笔记本里起一个本地 UI。商业平台是 Arize AX:Free $0、Pro $50/月、Enterprise 定制(支持自托管)。Phoenix 同时维护 OpenInference 这套 LLM 追踪语义规范。
W&B Weave — wandb.ai/site/weave|github.com/wandb/weave Apache 2.0,最近提交 2026-09-04。Weights & Biases 于 2025 年 3 月被 CoreWeave 收购(约 17 亿美元),Weave 作为其 LLM 侧产品继续演进,2026 年的重点转向 agent 会话级(session / turn)追踪与护栏。官网未列出独立定价,只提供免费试用。
Opik(Comet) — github.com/comet-ml/opik 21,814 star,Apache 2.0,最近提交 2026-09-05。开源自托管免费,云版有免费档,企业版定制。在「完全开源 + star 数够高 + 维护活跃」这三条上同时达标的,2026 年只有 Langfuse 和 Opik 两家。
其他值得知道名字的:Galileo(Free 5,000 traces/月、Pro $100/月、Enterprise 含 VPC 与本地部署)、HoneyHive(Free 1 万事件/月,Enterprise 支持自托管)、Patronus AI(Developer 免费、Base $25/月)、LangWatch(github.com/langwatch/langwatch,3,523 star,Apache 2.0,可自托管)、OpenLLMetry / Traceloop(7,413 star,Apache 2.0,把 OpenTelemetry 语义扩到 LLM)。
已经消失的:Humanloop 平台于 2025 年 9 月 8 日下线,团队以 acquihire 形式加入 Anthropic。老文章里推荐 Humanloop 的,都过期了。
标准层
OpenTelemetry GenAI 语义约定 已迁到独立仓库 open-telemetry/semantic-conventions-genai,截至 2026-09-06 核心文档状态仍标记为 Development(未 Stable)。这意味着:现在选平台时,「支持 OTel」这句话不等于「换平台无痛」。OpenInference(Arize 维护)是同方向的补充规范,Phoenix 与 Arize AX 原生支持。
Terminal-Bench(tbench.ai)是 2025–2026 年间起来的 agent 能力基准,由 Stanford、Harbor 与 Laude Institute 主办,衡量 agent 在终端环境里完成任务的成功率与成本,截至核实已迭代到 4.0。它不是给你交付项目用的,但在和客户讨论「编码 agent 到底有多强」时,是一个可引用的公开口径。
三、对比表
按 FDE 最关心的四个维度排。
| 工具 | 类型 | 开源 / 自托管 | 免费档 | 付费起价 | 维护状态(2026-09-06) |
|---|---|---|---|---|---|
| Promptfoo | 离线 Eval + 红队 | MIT,完全可离线 | 全功能社区版 | Enterprise 定制 | 活跃(当日提交) |
| Inspect | 离线 Eval | MIT,完全可离线 | 全部 | 无商业版 | 活跃 |
| DeepEval | 离线 Eval(pytest 风) | Apache 2.0,可离线 | 框架全免费 | 云版 $200/月 | 活跃 |
| Ragas | RAG 指标库 | Apache 2.0 | 全部 | 无 | ⚠️ 停滞约 6.5 个月 |
| OpenAI Evals | 离线 Eval | 仓库停滞 | — | — | ⚠️ 平台版 2026-11-30 下线 |
| Braintrust | Eval + 观测平台 | 否(SDK 开源) | Starter $0 | Pro $249/月 | 活跃,2026-02 完成 B 轮 |
| LangSmith | 观测 + Eval | 否(自托管仅 Enterprise) | Developer $0 | Plus $39/座/月 | 活跃 |
| Langfuse | 观测 + Eval | MIT,自托管免费 | Hobby $0 | Core $29/月 | 活跃,2026-01 被 ClickHouse 收购 |
| Arize Phoenix | 观测 + Eval | 开源,本地优先 | Phoenix 全免费 | AX Pro $50/月 | 活跃 |
| W&B Weave | 观测(agent 会话级) | Apache 2.0 | 试用 | 未公开 | 活跃,母公司属 CoreWeave |
| Opik | 观测 + Eval | Apache 2.0,自托管免费 | 云版有免费档 | Enterprise 定制 | 活跃 |
怎么选,三句话:
- 数据不能出客户网 → Promptfoo(离线 eval)+ Langfuse 自托管(观测)。这是 2026 年国内私有化现场最省事的组合。
- 能上云、想少写代码、预算在项目里 → Braintrust 或 LangSmith,二选一看你是否已经在用 LangGraph。
- 只想先证明「这事能做」,一周内要给客户看东西 → Promptfoo 单机跑,配一个 Google Sheet 存 golden set。别在第一周装平台。
四、一个用免费工具搭的最小可行 Eval 流程
目标:**一周内,用零预算,产出一份能拿给业务方签字的评估报告。**能满足这个目标的最小配置是「一个电子表格 + 一个开源 evaluator + 一次人工对齐会」。
第 1 步:先写「什么算对」,不写代码(半天)
拉上真正会判对错的那个业务方(不是他的领导),当场对着 10 条真实数据一条条问「这条模型输出,你认为对还是不对?为什么?」。把他的理由写成不超过 5 条判定规则。这一步的产物是一张 Eval 设计卡——目标、输入、输出、判定口径、谁是最终裁判、达到多少分算通过(模板见 templates.md)。
不做这一步就动手的项目,后面 100% 会在验收会上吵起来。
第 2 步:造 golden set(1–2 天)
- 数量:起步 50–100 条就够开始,不要一上来做 1,000 条。
- 来源:优先用真实历史数据,不要自己编。没有历史数据就说明这个场景还不该做 AI。
- 分层:按你在第 1 步听到的失败模式分层抽样,必须包含难例和边界例,不能全是简单样本。
- 存放:一个 CSV / Google Sheet,两列起步(
input、expected或rubric)。
第 3 步:跑 Promptfoo(半天)
npx promptfoo@latest init # 生成 promptfooconfig.yaml
npx promptfoo@latest eval # 跑
npx promptfoo@latest view # 本地 Web UI 看逐条对比配置里同时挂 2–3 个候选(不同 prompt、不同模型),一次跑出横向对比表。断言可以混用:
- 确定性断言(
contains、is-json、javascript自定义函数)——能用规则判的一律用规则,便宜、稳定、可复现。 - LLM 断言(
llm-rubric、model-graded-closedqa)——只用在规则判不了的地方,且judge 模型要比被评模型强或至少同级。
全流程本地进行,模型 API key 用你自己的,不需要注册任何 SaaS。
第 4 步:人工校准 judge(半天)
LLM-as-judge 不是免费午餐。抽 30 条同时让人和 judge 打分,算一致率。一致率低于 80% 就回去改 rubric,不要拿一个没校准过的 judge 出的分去汇报。这一步是整条流程里最容易被跳过、也最容易让整份报告作废的一步。
第 5 步:接上线追踪(1 天,可延后)
docker compose up 起一个自托管 Langfuse,在应用里加 SDK,把线上每一次调用记下来。上线后每周从 trace 里捞坏例子,回填到第 2 步的 golden set——这个回填动作才是 Eval 从「一次性验收」变成「持续资产」的地方,也是续单的理由。
成本核算
| 项 | 花费 |
|---|---|
| Promptfoo | $0 |
| golden set 存放(表格) | $0 |
| Langfuse 自托管 | $0 软件成本 + 一台小机器 |
| 模型 API(100 条 × 3 个候选 × 若干轮) | 通常低于 $20,用便宜档模型跑批可以更低 |
| 人工标注 100 条 + 校准 30 条 | 约 1 个人日 |
结论:Eval 的成本瓶颈从来不是工具,是那 1 个人日的判断。 任何一份「我们用了 XX 平台所以评估很完善」的汇报,如果说不出人工标注了多少条、judge 一致率是多少,那份评估就是空的。
五、三条容易踩的坑
- 拿平台当方法论。 装了 LangSmith 不等于有 Eval。Trace 只告诉你发生了什么,不告诉你好不好。见过太多项目 trace 铺满了,验收时还是拿不出一个分数。
- golden set 全是简单样本。 从日志里随机抽 100 条,大概率抽到的都是模型本来就能做对的。分数很高,上线就崩。分层抽样、刻意加难例。
- 换模型不重跑。 2026 年模型迭代速度是月级的(见 models-2026.md)。换模型、改 prompt、动检索,任何一项变了都要重跑同一套 eval,否则「变好了」只是错觉。
延伸阅读
- ../04-methodology/evaluation.md — Eval 的方法论:怎么定义好、怎么设计 rubric、谁是裁判
- agent-dev-stack.md — 被评估的东西是怎么造出来的
- models-2026.md — 换模型前先看这里的能力与价格口径
- templates.md — Eval 设计卡模板与其权威出处
- ../05-practice/demo-to-production.md — 上线之后:监控四层里的「质量」与「使用」两层怎么和这里的工具接起来
- ../05-practice/security-procurement-legal.md — 客户不许数据出网时,为什么只剩可离线的那几个选项
- Hamel Husain,《Your AI Product Needs Evals》 https://hamel.dev/blog/posts/evals/ — 这个领域被引用最多的一篇实践文,提出「三层评估」框架,讲清了为什么大部分 AI 产品死在没有评估上
- Anthropic,《Building Effective Agents》 https://www.anthropic.com/engineering/building-effective-agents — 官方 agent 设计文,其中关于「清晰可衡量的成功标准」和 agent-computer interface 的部分与 Eval 直接相关
来源
- Promptfoo 官网与定价页,https://www.promptfoo.dev/pricing/;GitHub https://github.com/promptfoo/promptfoo(star 与提交日期核实于 2026-09-06)
- UK AI Security Institute, Inspect 官方文档,https://inspect.aisi.org.uk/;https://github.com/UKGovernmentBEIS/inspect_ai;https://github.com/UKGovernmentBEIS/inspect_evals
- Confident AI, DeepEval 仓库与定价,https://github.com/confident-ai/deepeval、https://www.confident-ai.com/pricing
- Ragas 文档与迁移后仓库,https://docs.ragas.io/en/stable/、https://github.com/vibrantlabsai/ragas
- OpenAI, Evals 指南(含下线时间表),https://developers.openai.com/api/docs/guides/evals;仓库 https://github.com/openai/evals
- Braintrust 定价页,https://www.braintrust.dev/pricing;B 轮报道 SiliconANGLE, 2026-02-17, https://siliconangle.com/2026/02/17/braintrust-lands-80m-series-b-funding-round-become-observability-layer-ai/
- LangChain, LangSmith 定价页,https://www.langchain.com/pricing-langsmith
- ClickHouse,《ClickHouse acquires Langfuse》, 2026-01-16, https://clickhouse.com/blog/clickhouse-acquires-langfuse-open-source-llm-observability;Langfuse 定价 https://langfuse.com/pricing
- Arize, Phoenix 仓库与定价,https://github.com/Arize-ai/phoenix、https://arize.com/pricing/;OpenInference https://github.com/Arize-ai/openinference
- Weights & Biases, Weave 产品页,https://wandb.ai/site/weave/;仓库 https://github.com/wandb/weave
- Comet, Opik 仓库,https://github.com/comet-ml/opik
- OpenTelemetry, GenAI 语义约定仓库,https://github.com/open-telemetry/semantic-conventions-genai
- Terminal-Bench 官网,https://www.tbench.ai/
- Hamel Husain,《Your AI Product Needs Evals》,https://hamel.dev/blog/posts/evals/
- Anthropic,《Building Effective Agents》,2024-12-19,https://www.anthropic.com/engineering/building-effective-agents