AgentEvalTool/backend/agenteval
sinohqb c956da7686
All checks were successful
CI / test (pull_request) Successful in 4m3s
feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效
- token 用量接入:ModelGateway 经 adapter.parse_usage 累计评测侧 LLM 调用的
  token 消耗,引擎写入 run.summary.eval_token_usage,报告透出
- 放弃率落地:CaseOutcome 新增 abandoned 标记(对话中途发送/接收失败),
  build_run_summary 统计 abandoned_cases / abandonment_rate
- Go/No-Go 可配置:Scenario 新增 acceptance_criteria 字段(DB 列 + 幂等迁移),
  报告按场景标准出 verdict,缺省回退全局默认;标准变更不触发考纲升版
2026-08-25 18:38:18 +08:00
..
agents v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
channels fix(review): address release correctness findings 2026-08-09 03:20:40 +08:00
config perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
evaluation feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
exploration refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
intelligent_eval perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
model_protocols feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
scenarios feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
services perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
storage feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
utils v0.3-s3: Webhook + OpenClaw HTTP Skill + Markdown/对比报告 2026-07-17 11:44:54 +08:00
web test: 完整测试覆盖补全(+163 用例) 2026-08-24 15:56:09 +08:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
model_gateway.py feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
models.py feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
task_registry.py refactor(tasks): unify run/campaign task registries into TaskRegistry 2026-07-31 03:39:03 +08:00
version.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00