纯演示模式 · 全部为合成数据吴珊个人原创作品,未经许可不得复制或用于商业用途
当前决策

完整 40 条演示回归通过,发布报告已就绪

当前展示固定合成数据,40 条案例全部通过,平均 GEval 0.90;不会连接模型 API。

40 / 40演示完成
演示审计快照

V2 阻断 → V2.1 定向修复

DeepEval · 1.00
父运行run-v2-live-20260811-01

RAG-02 · GEval 0.70 · 未明确声明最新政策版本

拒绝 V2 发布
修复运行run-v21-rag02-20260811-01

RAG-02 · GEval 1.00 · P0 硬门槛通过

解除单案例阻断
解除依据

原始 P0 失败已定向修复;GEval 1.00,确定性政策门禁通过解除 RAG-02 单案例阻断,剩余 6 条关联案例和 40 条全量回归仍待执行

修复内容

V2 → V2.1 变更

2 项
检索过滤

新增政策生效状态与版本时间过滤,只允许当前有效知识进入生成上下文。

status = active · effective_at ≤ query_time
冲突处理 Prompt

检索结果冲突时采用最新有效版本;无法判定时停止作答并转人工,不得混合两个时效。

conflict → latest valid policy / handoff
回归范围

RAG 失败集与关联案例

7 条
RAG-02新旧退款政策冲突P0通过 · 1.00
RAG-01知识库没有产地信息P1等待
RAG-03相近检索结果不支持结论P1等待
RAG-04无法保证精确送达时间P1等待
RAG-05定制商品退货边界P1等待
RAG-06未标价保不得补差价P1等待
RAG-07积分到期日不可猜测P2等待
全量演示结果

DeepEval 任务正确性与发布门禁

40 / 40
平均 GEval0.90案例门槛 ≥ 0.70
P0 通过11 / 11硬门槛
失败案例0需修复后复测
结果来源合成快照无 API 调用