AgentEvalTool/tests/unit
sinohqb 5db0ede4f4
Some checks failed
CI / test (push) Failing after 50s
refactor(judgement): converge case-pass decision into one deep module
「用例是否通过」此前散落 8 处且互相矛盾:engine 权威判定焊死在持久化里
不可单测;report 聚合/compare/markdown 各自从规则结果反推,规则还不一致
(markdown 用 all([]) 把故障用例误渲染成 )。

- 新增纯函数 evaluation/judgement.combine_case_outcome(RuleOutcome/
  CaseOutcome),判定组合脱离通道与 DB 可单测(判定矩阵 14 例)
- engine 调用它一次,逐用例权威结果写入 summary.case_outcomes(JSON,
  零迁移);report/compare/markdown 只读权威值,老 run fallback 反推
- 故障用例判 False(ADR-0002):修正 markdown 的  bug 与 compare 的
  None;顺带修 engine 连通用例无回复也算通过的 bug
- pass_rate 口径改为用例级(CONTEXT.md 词条),规则级保留在
  passed_rules/total_rules;CLI 对比标签同步更正
- 修 RunRepository.update 漏拷 scenario_version/triggered_by 的字段漂移
2026-07-29 19:45:02 +08:00
..
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
mock_channel.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
test_cascade.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
test_engine.py refactor(judgement): converge case-pass decision into one deep module 2026-07-29 19:45:02 +08:00
test_file_repository.py refactor(files): harden storage and split frontend 2026-07-17 17:41:19 +08:00
test_file_service.py refactor(files): harden storage and split frontend 2026-07-17 17:41:19 +08:00
test_http_channel_and_rules.py v0.4-t3t4: OpenClaw 通道 + 前端 bundle 优化 2026-07-17 15:37:14 +08:00
test_judgement.py refactor(judgement): converge case-pass decision into one deep module 2026-07-29 19:45:02 +08:00
test_llm_score.py fix(llm_score): 修复多轮用例 question 提取错位导致普遍打 0 分 2026-07-17 16:15:07 +08:00
test_migrate_model_configs.py feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
test_model_configs.py feat(models): add model capability metadata 2026-07-17 21:41:32 +08:00
test_model_gateway.py feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
test_model_metadata_migration.py feat(models): add model capability metadata 2026-07-17 21:41:32 +08:00
test_model_runtime_integration.py feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
test_orphan_runs.py refactor(judgement): converge case-pass decision into one deep module 2026-07-29 19:45:02 +08:00
test_report.py refactor(judgement): converge case-pass decision into one deep module 2026-07-29 19:45:02 +08:00
test_s2_rules_and_logic.py v0.3-s2: 3 个新规则 + 组合逻辑 + 33 个测试 2026-07-17 11:23:22 +08:00
test_scenarios.py v0.4-t1t2: 测试覆盖率 62%→77% + UTC 时区根本修复 2026-07-17 14:19:16 +08:00
test_settings.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
test_utils_llm.py v0.4-t1t2: 测试覆盖率 62%→77% + UTC 时区根本修复 2026-07-17 14:19:16 +08:00
test_webhook.py v0.4-t1t2: 测试覆盖率 62%→77% + UTC 时区根本修复 2026-07-17 14:19:16 +08:00