2.9 KiB
2.9 KiB
AgentEvalTool v1.0.0 发布说明
版本:v1.0.0 发布日期:2026-08-11 状态:已发布 作者:AgentEval Team
一、版本定位
v1.0.0 标志 AgentEvalTool 从单次规则评测工具升级为具备两套互补评测体系的质量运营平台:静态评估用固定考纲回答“通过了多少”,智能评估由 OpenClaw 模拟真实用户回答“实际体验中有什么问题”。此前已经完成的 v0.9 探索式评测和智能评估 v1.0 功能里程碑在本次发布中正式统一到项目 SemVer。
二、核心能力
- 静态评估:对象、场景、规则、Run、实时 WebSocket、报告与同版本对比。
- 周期 Campaign:耐久调度、child Run 身份、重启恢复、探索会话、智能分析和周期对比。
- 智能评估:OpenClaw 规划、人工审批、虚拟用户会话、体验判定、结构化发现报告和 Markdown 导出。
- 模型配置中心:统一管理调用协议、用途能力、模态和分析/judge 默认岗位。
- 管理后台:keep-alive 标签页、统一 Drawer/页壳/反馈规范、状态感知轮询和完整快照读取。
- 双线部署:t480 开发线与 volcengine-102 正式线;正式发布包含数据备份、Alembic 迁移、不可变镜像和鉴权 API 冒烟。
三、架构基线
- 数据库是 Campaign、child Run 和耐久智能作业的状态权威;TaskRegistry 只保存进程内句柄。
CampaignRuntime对外只暴露start、cancel、recover、shutdown。CampaignReadModel统一列表、详情、报告、时间线、分析、对比和导出 projection。- 智能分析与周期对比共享耐久作业 owner;queued 条件认领并有限恢复,遗留 generating 不自动重放。
- Campaign 与 Intelligent Evaluation 保持独立状态机;拒绝仅因 SQL 形状相似建立跨领域条件写入模块。
四、质量基线
- 后端:744 项测试通过。
- 前端:15 项测试通过,TypeScript 检查与生产构建通过。
- 数据库:Alembic upgrade/downgrade 往返通过,head 为
d4e7f9a1b2c3。 - 发布检查:版本一致性、相关 Ruff、迁移演练、健康检查与关键 API 冒烟通过。
五、兼容性与配置
- 项目版本单一数据源从
0.8.0修正为1.0.0,由scripts/sync_version.py同步前端包文件。 - 不改变现有 HTTP 路径、响应字段、SQLite 数据卷、API Key 或 OpenClaw 配置格式。
- 升级时容器入口自动执行 Alembic;正式发布前仍必须备份数据 volume。
- 当前部署假设为单进程 FastAPI + SQLite;切换多 worker 前需复审条件认领和并发写入边界。
六、版本说明
仓库早期存在一个名为 V1.1 的文档,它创建时实际代码版本是 0.2.0-dev,属于原型阶段编号。自本发布起,项目版本以 pyproject.toml、Git 标签和健康接口报告的 SemVer 为准。