AgentEvalTool/backend/agenteval
sinohqb 2314ebe3bc
All checks were successful
CI / test (pull_request) Successful in 4m7s
feat(report): 上线验收报告 go/no-go 结论
新增纯函数模块 evaluation/go_no_go.py,基于 RunSummary 指标自动生成
go/no-go/conditional 三级结论。

- AcceptanceCriteria 模型:judged_pass_rate_min、pass_rate_min、avg_latency_max_ms
- GoNoGoVerdict 模型:decision、summary、criteria_results
- evaluate_go_no_go() 纯函数:接收 summary dict + criteria -> 返回 verdict
- 集成到 generate_report(),报告 dict 自动附带 go_no_go 字段
- 三级结论:go(全部达标)、no_go(核心未达标)、conditional(有风险)
- 新增 9 项单元测试(642 tests passed)

Closes #20
2026-08-25 14:28:55 +08:00
..
agents v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
channels fix(review): address release correctness findings 2026-08-09 03:20:40 +08:00
config perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
evaluation feat(report): 上线验收报告 go/no-go 结论 2026-08-25 14:28:55 +08:00
exploration refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
intelligent_eval perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
model_protocols feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
scenarios feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
services perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
storage perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
utils v0.3-s3: Webhook + OpenClaw HTTP Skill + Markdown/对比报告 2026-07-17 11:44:54 +08:00
web test: 完整测试覆盖补全(+163 用例) 2026-08-24 15:56:09 +08:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
model_gateway.py feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
models.py refactor(architecture): deepen evaluation lifecycle and read model 2026-08-07 03:11:37 +08:00
task_registry.py refactor(tasks): unify run/campaign task registries into TaskRegistry 2026-07-31 03:39:03 +08:00
version.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00