Some checks failed
CI / test (push) Failing after 51s
拷问会话产出:14 条核心术语定义(评测对象/场景/用例/轮次/通过率/模型能力·用途等), 以及两项决策记录——场景版本化的可比性语义(ADR-0001)、通过率含执行失败的口径(ADR-0002)。
780 B
780 B
通过率含执行失败:故障也是质量问题
用例失败有两类原因:智能体回答不达标(规则判负)和通道故障/超时(执行失败)。决定通过率分母不剔除执行失败——评测采用最终用户视角,"没收到回复"与"回复不合格"同样是服务质量不达标。
Considered Options
- 分母排除执行失败、单独计执行失败率 — 被否:会让基础设施故障期间的报告显得"质量正常",掩盖用户实际感受到的不可用
- 报告仅做拆分提示、分母不变 — 部分吸收:报告可以展示失败原因拆分,但通过率口径不变
Consequences
- 网络抖动会拉低通过率——这是刻意的,不要"修复";排查时看报告中的错误明细区分原因