AgentEvalTool/backend/agenteval
sinohqb a29f78ff4b
All checks were successful
CI / test (pull_request) Successful in 4m9s
feat(llm_score): 支持多维度独立评分
扩展 llm_score 规则,支持通过 dimensions 参数配置多个评分维度,
每个维度独立评分 0-10 分。

- RuleResult 新增 details 字段存储结构化多维度分数
- 向后兼容:原有 criteria 单维度模式继续有效
- 多维度模式下各维度并行调用 LLM,返回平均分和明细
- 新增 4 项单元测试

Closes #19
2026-08-25 14:17:49 +08:00
..
agents v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
channels fix(review): address release correctness findings 2026-08-09 03:20:40 +08:00
config perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
evaluation feat(llm_score): 支持多维度独立评分 2026-08-25 14:17:49 +08:00
exploration refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
intelligent_eval perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
model_protocols feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
scenarios feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
services perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
storage perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
utils v0.3-s3: Webhook + OpenClaw HTTP Skill + Markdown/对比报告 2026-07-17 11:44:54 +08:00
web test: 完整测试覆盖补全(+163 用例) 2026-08-24 15:56:09 +08:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
model_gateway.py feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
models.py refactor(architecture): deepen evaluation lifecycle and read model 2026-08-07 03:11:37 +08:00
task_registry.py refactor(tasks): unify run/campaign task registries into TaskRegistry 2026-07-31 03:39:03 +08:00
version.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00