AI Agent 发布决策与治理平台不是再做一个评测引擎,
不是再做一个评测引擎,
而是回答:这个 Agent 能上线吗?
DeepEval 负责执行评测,Phoenix 提供 Trace 证据,Release Guard 把结果转化为可解释、可审计的发布决定。
能力分工
复用评测与观测能力,重点建设治理层
DeepEval
测试集、评测执行、案例级指标
Release Guard
硬门槛、人工复核、发布决策、审计
Phoenix
生产 Trace、检索证据、性能信号
发布治理闭环
从评测执行到上线监控的完整决策链路
- 01配置发布评测创建评测 →
选择 V1 基线、V2 候选、40 条案例和六项门禁。
- 02观察评测运行查看运行 →
DeepEval 执行案例,Release Guard 持续计算发布门禁。
- 03发现 P0 回归查看阻断 →
总体分达到 88.6,但 RAG-02 引用了已废止政策。
- 04下钻 Trace 根因查看 Trace →
Phoenix 证据显示旧政策排名第一,生成环节未校验版本。
- 05完成修复回归运行回归 →
先运行 7 条失败集,再完成全量 40 条评测。
- 06人工批准发布查看报告 →
平台给出建议和证据,产品负责人保留最终决定权。
- 07监控灰度上线查看监控 →
生产 P0 触发冻结扩量,由人工记录回滚决定。