AgentEvalTool/docs/adr/0001-scenario-versioning-for-comparability.md
sinohqb e33922c3fe
Some checks failed
CI / test (push) Failing after 51s
docs(domain): add domain glossary CONTEXT.md and first ADRs
拷问会话产出:14 条核心术语定义(评测对象/场景/用例/轮次/通过率/模型能力·用途等),
以及两项决策记录——场景版本化的可比性语义(ADR-0001)、通过率含执行失败的口径(ADR-0002)。
2026-07-28 21:46:56 +08:00

15 lines
1.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 场景版本化:对比报告的可比性以场景版本为准
场景可编辑,导致同一 scenario_id 的两次运行可能基于不同"考纲"用例集、规则、模型绑定v0.4 的"同场景即可对比"约束不够严格。决定引入场景版本仅考纲字段cases / model_bindings / llm_config变更时递增版本号名称、描述、标签等元数据编辑不升版对比报告要求同场景且同版本才严格可比。
## Considered Options
- 任何编辑都升版 — 被否:改描述错字也会断开可比性,过于粗暴
- Run 快照考纲指纹比对(无版本号字段)— 被否:无显式版本号,用户无法在 UI 上直观选择"同一版"的运行
- 交集对齐 + 单边标注 — 被否:掩盖考纲漂移,对比结论可信度存疑
## Consequences
- 数据模型需加 scenario version 字段Run 需记录所用版本v0.5 实施项,尚未实现)
- 动态用例每次运行题目不同不影响可比性——可比性单位是"同考纲"(同场景同版本),不是"同考卷"