AgentEvalTool/backend/agenteval
sinohqb 56d709c44f
All checks were successful
CI / test (push) Successful in 3m59s
fix(intelligent-eval): reject report until all sessions closed
t480 实测:评估 completed 但 completed_sessions=0(进度 0%)。根因
(diagnosing-bugs):submit_report 无条件 CAS executing→completed,不看会话
状态——worker 建会话未 close 时,analyst 仍可提交报告把评估标完成。

- lifecycle.submit_report 加校验:存在会话时须全部 close(completed),
  否则抛 IntelligentEvalTransitionError(409)——杜绝'评估完成但进度 0%'
- 无会话的评估仍可直接提交(analyst 正常路径不变)
回归测试(诊断闭环 Phase 1 反馈环先红后绿):
- +test_submit_report_rejects_when_sessions_not_closed(running 会话→409)
- +test_submit_report_allows_when_sessions_closed(全 close→200)
900 passed
2026-08-18 15:30:51 +08:00
..
agents v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
channels fix(review): address release correctness findings 2026-08-09 03:20:40 +08:00
config refactor(intelligent-eval): openclaw_client token from settings (S5) + ADR-0008 2026-08-13 14:20:49 +08:00
evaluation refactor(architecture): deepen campaign runtime modules 2026-08-11 13:18:48 +08:00
exploration refactor(architecture): deepen evaluation lifecycle and read model 2026-08-07 03:11:37 +08:00
intelligent_eval fix(intelligent-eval): reject report until all sessions closed 2026-08-18 15:30:51 +08:00
model_protocols feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
scenarios feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
services feat(models): add analysis-default flag for campaign intelligence 2026-08-03 01:46:51 +08:00
storage feat(intelligent-eval): add cron pool data model and task queue API 2026-08-12 02:13:21 +08:00
utils v0.3-s3: Webhook + OpenClaw HTTP Skill + Markdown/对比报告 2026-07-17 11:44:54 +08:00
web fix(intelligent-eval): respect time-window slot distribution + flat scores 2026-08-18 13:43:14 +08:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
model_gateway.py feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
models.py refactor(architecture): deepen evaluation lifecycle and read model 2026-08-07 03:11:37 +08:00
task_registry.py refactor(tasks): unify run/campaign task registries into TaskRegistry 2026-07-31 03:39:03 +08:00
version.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00