AgentEvalTool/backend/agenteval
sinohqb c1a3cdbaa9
All checks were successful
CI / test (pull_request) Successful in 4m5s
fix(rules): 修复代码审查发现的三处规则层缺陷
- response_time: 仅配置 max_ms 时恢复 v0.3 评分语义(最后一轮评分 + 超限线性惩罚),扩展指标共存时才用均值评分
- safety: 移除 moderation API 的黑名单命中跳过守卫,两层安全检查独立执行、发现均上报
- llm_score: 多维度评分添加 Semaphore 并发上限(5),防止维度数多时无限扇出模型请求
2026-08-25 18:13:11 +08:00
..
agents v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
channels fix(review): address release correctness findings 2026-08-09 03:20:40 +08:00
config perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
evaluation fix(rules): 修复代码审查发现的三处规则层缺陷 2026-08-25 18:13:11 +08:00
exploration refactor(evaluation/storage): 结算统一与 repository 拆分(Phase 2 + 3) 2026-08-24 05:50:27 +08:00
intelligent_eval perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
model_protocols feat: 成本效率跟踪基础设施 2026-08-25 16:07:08 +08:00
scenarios feat(models): add centralized model configuration 2026-07-17 20:02:43 +08:00
services perf(eval): case/rule/campaign 并发执行 2026-08-24 23:18:11 +08:00
storage perf(db): WAL 模式 + 性能索引 + N+1 查询消除 2026-08-24 23:17:51 +08:00
utils v0.3-s3: Webhook + OpenClaw HTTP Skill + Markdown/对比报告 2026-07-17 11:44:54 +08:00
web test: 完整测试覆盖补全(+163 用例) 2026-08-24 15:56:09 +08:00
__init__.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00
model_gateway.py feat(models): support mainstream model protocols 2026-07-17 20:58:27 +08:00
models.py Merge pull request 'feat: 用户体验指标(放弃率+流畅度评估)' (#32) from feat/user-experience-metrics into main 2026-08-25 08:40:45 +00:00
task_registry.py refactor(tasks): unify run/campaign task registries into TaskRegistry 2026-07-31 03:39:03 +08:00
version.py v0.2.0-dev: 文件管理 + 页面布局统一 + 6 个 bug 修复 2026-07-16 15:25:22 +08:00