AgentEvalTool/docs/adr/0001-scenario-versioning-for-comparability.md
sinohqb e33922c3fe
Some checks failed
CI / test (push) Failing after 51s
docs(domain): add domain glossary CONTEXT.md and first ADRs
拷问会话产出:14 条核心术语定义(评测对象/场景/用例/轮次/通过率/模型能力·用途等),
以及两项决策记录——场景版本化的可比性语义(ADR-0001)、通过率含执行失败的口径(ADR-0002)。
2026-07-28 21:46:56 +08:00

1.1 KiB
Raw Blame History

场景版本化:对比报告的可比性以场景版本为准

场景可编辑,导致同一 scenario_id 的两次运行可能基于不同"考纲"用例集、规则、模型绑定v0.4 的"同场景即可对比"约束不够严格。决定引入场景版本仅考纲字段cases / model_bindings / llm_config变更时递增版本号名称、描述、标签等元数据编辑不升版对比报告要求同场景且同版本才严格可比。

Considered Options

  • 任何编辑都升版 — 被否:改描述错字也会断开可比性,过于粗暴
  • Run 快照考纲指纹比对(无版本号字段)— 被否:无显式版本号,用户无法在 UI 上直观选择"同一版"的运行
  • 交集对齐 + 单边标注 — 被否:掩盖考纲漂移,对比结论可信度存疑

Consequences

  • 数据模型需加 scenario version 字段Run 需记录所用版本v0.5 实施项,尚未实现)
  • 动态用例每次运行题目不同不影响可比性——可比性单位是"同考纲"(同场景同版本),不是"同考卷"