Some checks failed
CI / test (push) Failing after 51s
拷问会话产出:14 条核心术语定义(评测对象/场景/用例/轮次/通过率/模型能力·用途等), 以及两项决策记录——场景版本化的可比性语义(ADR-0001)、通过率含执行失败的口径(ADR-0002)。
1.1 KiB
1.1 KiB
场景版本化:对比报告的可比性以场景版本为准
场景可编辑,导致同一 scenario_id 的两次运行可能基于不同"考纲"(用例集、规则、模型绑定),v0.4 的"同场景即可对比"约束不够严格。决定引入场景版本:仅考纲字段(cases / model_bindings / llm_config)变更时递增版本号,名称、描述、标签等元数据编辑不升版;对比报告要求同场景且同版本才严格可比。
Considered Options
- 任何编辑都升版 — 被否:改描述错字也会断开可比性,过于粗暴
- Run 快照考纲指纹比对(无版本号字段)— 被否:无显式版本号,用户无法在 UI 上直观选择"同一版"的运行
- 交集对齐 + 单边标注 — 被否:掩盖考纲漂移,对比结论可信度存疑
Consequences
- 数据模型需加 scenario version 字段,Run 需记录所用版本(v0.5 实施项,尚未实现)
- 动态用例每次运行题目不同不影响可比性——可比性单位是"同考纲"(同场景同版本),不是"同考卷"