AgentEvalTool/backend/agenteval/evaluation
sinohqb 56c56a7b4a
All checks were successful
CI / test (pull_request) Successful in 4m9s
feat: 成本效率跟踪基础设施
新增成本跟踪模块,为对话级和任务级成本计算提供基础。

- Turn 模型新增 prompt_tokens、completion_tokens、total_tokens 字段
- OpenAI 协议适配器新增 parse_usage() 提取 token 使用量
- 新增 evaluation/cost_tracking.py 模块:
  - ModelPricing:模型定价配置
  - TokenUsage:token 使用量聚合
  - CostBreakdown:成本明细
  - calculate_cost():根据 token 使用量和定价计算费用
  - calculate_turn_cost()、calculate_case_cost()、calculate_run_cost()
- 内置常见模型定价(GPT-4o、GPT-4o-mini、Claude 等)
- 新增 11 项单元测试(677 tests passed)

注:引擎集成(实际捕获 API 调用的 token 使用量)留待后续实现。

Closes #25
2026-08-25 16:07:08 +08:00
..
rules Merge pull request 'feat(safety): 扩展规则覆盖幻觉、越权和合规检查' (#30) from feat/safety-extended into main 2026-08-25 08:02:05 +00:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
analysis.py refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
campaign_lifecycle.py refactor(architecture): deepen campaign runtime modules 2026-08-11 13:18:48 +08:00
campaign_read_model.py refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
campaign_runner.py perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
campaign_scheduler.py refactor(campaign): move tick decisions into the pure scheduler seam 2026-07-31 02:20:14 +08:00
case_verdict.py refactor(case-verdict): extract build_case_evidence as single evidence-construction seam 2026-08-04 11:23:56 +08:00
comparison.py refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
cost_tracking.py feat: 成本效率跟踪基础设施 2026-08-25 16:07:08 +08:00
engine.py perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
go_no_go.py feat(report): 上线验收报告 go/no-go 结论 2026-08-25 14:28:55 +08:00
implicit_rules.py refactor(engine): thin _run_case and _save_rule_results 2026-07-31 14:59:50 +08:00
intelligence_jobs.py refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
judgement.py refactor(judgement): converge case-pass decision into one deep module 2026-07-29 19:45:02 +08:00
metrics.py refactor(metrics): extract dashboard aggregation to compute_dashboard 2026-08-04 11:36:55 +08:00
report_render.py feat(exploration): findings flow into report, analysis and export 2026-08-03 19:16:33 +08:00
report.py feat(report): 上线验收报告 go/no-go 结论 2026-08-25 14:28:55 +08:00
run_summary.py refactor(engine): extract build_run_summary pure seam 2026-07-31 14:20:51 +08:00