feat(report): 上线验收报告 go/no-go 结论 #28

Merged
solahqb merged 2 commits from feat/go-no-go-verdict into main 2026-08-25 06:31:43 +00:00
Owner

Summary

新增纯函数模块 evaluation/go_no_go.py,基于 RunSummary 指标自动生成 go/no-go/conditional 三级结论,集成到报告生成流程。

Changes

  • AcceptanceCriteria 模型:judged_pass_rate_min、pass_rate_min、avg_latency_max_ms
  • GoNoGoVerdict 模型:decision、summary、criteria_results
  • evaluate_go_no_go() 纯函数:接收 summary dict + criteria -> 返回 verdict
  • 集成到 generate_report(),报告 dict 自动附带 go_no_go 字段
  • 三级结论:go(全部达标)、no_go(核心未达标)、conditional(有风险)
  • 新增 9 项单元测试(642 tests passed)

API Response Example

{
  "run_id": "...",
  "summary": {
    "pass_rate": 0.96,
    "judged_pass_rate": 0.96,
    "avg_latency_ms": 2000
  },
  "go_no_go": {
    "decision": "go",
    "summary": "通过率 96%,达标,建议上线",
    "criteria_results": [
      {"criterion": "judged_pass_rate", "threshold": 0.95, "actual": 0.96, "passed": true}
    ],
    "generated_at": "2026-08-25T10:00:00Z"
  }
}

Test plan

  • 单元测试通过(642 tests)
  • go/no-go 核心逻辑测试(9 项)
  • 报告集成测试(现有 report 测试通过)
  • datetime 序列化测试

Closes #20

## Summary 新增纯函数模块 `evaluation/go_no_go.py`,基于 RunSummary 指标自动生成 go/no-go/conditional 三级结论,集成到报告生成流程。 ## Changes - **AcceptanceCriteria** 模型:judged_pass_rate_min、pass_rate_min、avg_latency_max_ms - **GoNoGoVerdict** 模型:decision、summary、criteria_results - **evaluate_go_no_go()** 纯函数:接收 summary dict + criteria -> 返回 verdict - 集成到 `generate_report()`,报告 dict 自动附带 `go_no_go` 字段 - 三级结论:go(全部达标)、no_go(核心未达标)、conditional(有风险) - 新增 9 项单元测试(642 tests passed) ## API Response Example ```json { "run_id": "...", "summary": { "pass_rate": 0.96, "judged_pass_rate": 0.96, "avg_latency_ms": 2000 }, "go_no_go": { "decision": "go", "summary": "通过率 96%,达标,建议上线", "criteria_results": [ {"criterion": "judged_pass_rate", "threshold": 0.95, "actual": 0.96, "passed": true} ], "generated_at": "2026-08-25T10:00:00Z" } } ``` ## Test plan - [x] 单元测试通过(642 tests) - [x] go/no-go 核心逻辑测试(9 项) - [x] 报告集成测试(现有 report 测试通过) - [x] datetime 序列化测试 Closes #20
solahqb added 2 commits 2026-08-25 06:29:49 +00:00
调研现有报告生成能力(Run/Campaign/IntelligentEval 三套管线),
分析 go/no-go 结论的实现路径:纯函数判定核心 + 三级阈值配置 +
渐进式交付。估算总工作量 8 人天,推荐分阶段实施。

Refs: #20
feat(report): 上线验收报告 go/no-go 结论
All checks were successful
CI / test (pull_request) Successful in 4m7s
2314ebe3bc
新增纯函数模块 evaluation/go_no_go.py,基于 RunSummary 指标自动生成
go/no-go/conditional 三级结论。

- AcceptanceCriteria 模型:judged_pass_rate_min、pass_rate_min、avg_latency_max_ms
- GoNoGoVerdict 模型:decision、summary、criteria_results
- evaluate_go_no_go() 纯函数:接收 summary dict + criteria -> 返回 verdict
- 集成到 generate_report(),报告 dict 自动附带 go_no_go 字段
- 三级结论:go(全部达标)、no_go(核心未达标)、conditional(有风险)
- 新增 9 项单元测试(642 tests passed)

Closes #20
solahqb merged commit 2f08e7bf06 into main 2026-08-25 06:31:43 +00:00
Sign in to join this conversation.
No reviewers
No Milestone
No project
No Assignees
1 Participants
Notifications
Due Date
The due date is invalid or out of range. Please use the format 'yyyy-mm-dd'.

No due date set.

Dependencies

No dependencies set.

Reference: solahqb/AgentEvalTool#28
No description provided.