纯演示模式 · 全部为合成数据吴珊个人原创作品,未经许可不得复制或用于商业用途
AI Agent 发布决策与治理平台

不是再做一个评测引擎,
而是回答:这个 Agent 能上线吗?

DeepEval 负责执行评测,Phoenix 提供 Trace 证据,Release Guard 把结果转化为可解释、可审计的发布决定。

40呼叫中心测试案例
6发布治理指标
1P0 回归触发阻断
全链路评测、复核、发布、监控
能力分工

复用评测与观测能力,重点建设治理层

评测引擎
DeepEval

测试集、评测执行、案例级指标

评测结果
治理平台
Release Guard

硬门槛、人工复核、发布决策、审计

Trace 证据
可观测平台
Phoenix

生产 Trace、检索证据、性能信号

发布治理闭环

从评测执行到上线监控的完整决策链路

约 5 分钟
  1. 01
    配置发布评测

    选择 V1 基线、V2 候选、40 条案例和六项门禁。

    创建评测
  2. 02
    观察评测运行

    DeepEval 执行案例,Release Guard 持续计算发布门禁。

    查看运行
  3. 03
    发现 P0 回归

    总体分达到 88.6,但 RAG-02 引用了已废止政策。

    查看阻断
  4. 04
    下钻 Trace 根因

    Phoenix 证据显示旧政策排名第一,生成环节未校验版本。

    查看 Trace
  5. 05
    完成修复回归

    先运行 7 条失败集,再完成全量 40 条评测。

    运行回归
  6. 06
    人工批准发布

    平台给出建议和证据,产品负责人保留最终决定权。

    查看报告
  7. 07
    监控灰度上线

    生产 P0 触发冻结扩量,由人工记录回滚决定。

    查看监控