AgentEvalTool/backend/agenteval
sinohqb 2f09ee2bfc
All checks were successful
CI / test (pull_request) Successful in 3m58s
refactor(v1.3.1): Phase 3 报告横幅、评分逻辑收敛与成本闭环
- 报告渲染 Go/No-Go 上线评估横幅(HTML 彩色 banner + Markdown 引用块)
- 抽取 scored_llm 共享模块:llm_score / fluency 直连调用与评分解析收敛
- 网关新增 chat_with_usage / embed_with_usage,规则按次归集 llm_usage
- 引擎分岗位用量归集(judge/generator/embedding/moderation)写入
  RunSummary.eval_usage_by_purpose,并发下不做总量差值
- cost_tracking 重构:data/model_pricing.json 覆盖 + 默认计价表,
  删除从未有数据支撑的 Turn 维度成本函数(偏差说明见 PR)
- 报告 summary 增加 eval_cost 分岗位成本段并在 Markdown 渲染
2026-08-26 01:59:20 +08:00
..
agents v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
channels fix(review): address release correctness findings 2026-08-09 03:20:40 +08:00
config perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
evaluation refactor(v1.3.1): Phase 3 报告横幅、评分逻辑收敛与成本闭环 2026-08-26 01:59:20 +08:00
exploration refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
intelligent_eval perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
model_protocols feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
scenarios feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
services perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
storage feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效 2026-08-25 18:38:18 +08:00
utils v0.3-s3: Webhook + OpenClaw HTTP Skill + Markdown/对比报告 2026-07-17 11:44:54 +08:00
web test: 完整测试覆盖补全(+163 用例) 2026-08-24 15:56:09 +08:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
model_gateway.py refactor(v1.3.1): Phase 3 报告横幅、评分逻辑收敛与成本闭环 2026-08-26 01:59:20 +08:00
models.py refactor(v1.3.1): Phase 3 报告横幅、评分逻辑收敛与成本闭环 2026-08-26 01:59:20 +08:00
task_registry.py refactor(tasks): unify run/campaign task registries into TaskRegistry 2026-07-31 03:39:03 +08:00
version.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00