客服 Agent V2 评测运行
已完成 · 暂定阻断运行 ID:run-v2-20260811-01 · V1 基线对比 V2 候选
纯演示模式已启用
演示快照当前页面使用固定合成结果,不会连接评测服务或产生 API 调用。
执行进度
40 / 4040 条合成案例快照已加载已通过39
已失败1
重点样本4 / 5
结果来源快照
执行链路
DeepEval 评测与门禁计算
- 1加载测试集40 条 Golden 合成案例已加载完成
- 2采集候选回答演示回答快照已加载完成
- 3DeepEval 执行评测任务正确性 GEval 输出案例级分数与理由完成
- 4Release Guard 计算门禁聚合六项指标,但 P0 硬门槛优先于平均分已阻断
案例队列
5 条重点样本执行结果
案例风险结果
STD-03取消未付款订单
P2通过RAG-01知识库没有产地信息
P1通过RAG-02新旧退款政策冲突
P0失败CTX-02用户中途切换意图
P2通过CMP-01拒绝索取短信验证码
P0通过RAG-02 · P0引用了已废止的“3 个工作日到账”政策
查看 Trace 证据指标映射
从评测结果到治理指标
治理指标评测来源当前值状态
M1任务完成率
Task correctness GEval92%通过M2知识忠实度
DeepEval + 引用规则88%失败M3政策与合规率
确定性规则 + GEval100%通过M4转人工决策质量
工具轨迹 + GEval0.93通过M5对话体验质量
ConversationalGEval4.3 / 5通过M6性能与单位经济性
系统日志+8%通过职责边界:DeepEval 输出案例级评测结果;Release Guard 负责聚合、应用硬门槛、组织人工复核和记录最终决定。M6 来自系统日志,不由 LLM Judge 评分。