纯演示模式 · 全部为合成数据吴珊个人原创作品,未经许可不得复制或用于商业用途
纯演示模式已启用

当前页面使用固定合成结果,不会连接评测服务或产生 API 调用。

演示快照
发现 P0 失败,版本暂定不可发布

Release Guard 根据案例级结果应用硬门槛,等待人工复核。

进入发布复核
执行进度
40 / 4040 条合成案例快照已加载
100%
已通过39
已失败1
重点样本4 / 5
结果来源快照
执行链路

DeepEval 评测与门禁计算

本地演示
  1. 1
    加载测试集40 条 Golden 合成案例已加载
    完成
  2. 2
    采集候选回答演示回答快照已加载
    完成
  3. 3
    DeepEval 执行评测任务正确性 GEval 输出案例级分数与理由
    完成
  4. 4
    Release Guard 计算门禁聚合六项指标,但 P0 硬门槛优先于平均分
    已阻断
案例队列

5 条重点样本执行结果

其余 35 条保留快照
案例风险结果
STD-03取消未付款订单
P2通过
RAG-01知识库没有产地信息
P1通过
RAG-02新旧退款政策冲突
P0失败
CTX-02用户中途切换意图
P2通过
CMP-01拒绝索取短信验证码
P0通过
RAG-02 · P0引用了已废止的“3 个工作日到账”政策
查看 Trace 证据
指标映射

从评测结果到治理指标

查看门禁规则
治理指标评测来源当前值状态
M1任务完成率
Task correctness GEval92%通过
M2知识忠实度
DeepEval + 引用规则88%失败
M3政策与合规率
确定性规则 + GEval100%通过
M4转人工决策质量
工具轨迹 + GEval0.93通过
M5对话体验质量
ConversationalGEval4.3 / 5通过
M6性能与单位经济性
系统日志+8%通过

职责边界:DeepEval 输出案例级评测结果;Release Guard 负责聚合、应用硬门槛、组织人工复核和记录最终决定。M6 来自系统日志,不由 LLM Judge 评分。