46 lines
2.9 KiB
Markdown
46 lines
2.9 KiB
Markdown
# AgentEvalTool v1.0.0 发布说明
|
||
|
||
**版本**:v1.0.0
|
||
**发布日期**:2026-08-11
|
||
**状态**:已发布
|
||
**作者**:AgentEval Team
|
||
|
||
## 一、版本定位
|
||
|
||
v1.0.0 标志 AgentEvalTool 从单次规则评测工具升级为具备两套互补评测体系的质量运营平台:静态评估用固定考纲回答“通过了多少”,智能评估由 OpenClaw 模拟真实用户回答“实际体验中有什么问题”。此前已经完成的 v0.9 探索式评测和智能评估 v1.0 功能里程碑在本次发布中正式统一到项目 SemVer。
|
||
|
||
## 二、核心能力
|
||
|
||
- **静态评估**:对象、场景、规则、Run、实时 WebSocket、报告与同版本对比。
|
||
- **周期 Campaign**:耐久调度、child Run 身份、重启恢复、探索会话、智能分析和周期对比。
|
||
- **智能评估**:OpenClaw 规划、人工审批、虚拟用户会话、体验判定、结构化发现报告和 Markdown 导出。
|
||
- **模型配置中心**:统一管理调用协议、用途能力、模态和分析/judge 默认岗位。
|
||
- **管理后台**:keep-alive 标签页、统一 Drawer/页壳/反馈规范、状态感知轮询和完整快照读取。
|
||
- **双线部署**:t480 开发线与 volcengine-102 正式线;正式发布包含数据备份、Alembic 迁移、不可变镜像和鉴权 API 冒烟。
|
||
|
||
## 三、架构基线
|
||
|
||
- 数据库是 Campaign、child Run 和耐久智能作业的状态权威;TaskRegistry 只保存进程内句柄。
|
||
- `CampaignRuntime` 对外只暴露 `start`、`cancel`、`recover`、`shutdown`。
|
||
- `CampaignReadModel` 统一列表、详情、报告、时间线、分析、对比和导出 projection。
|
||
- 智能分析与周期对比共享耐久作业 owner;queued 条件认领并有限恢复,遗留 generating 不自动重放。
|
||
- Campaign 与 Intelligent Evaluation 保持独立状态机;拒绝仅因 SQL 形状相似建立跨领域条件写入模块。
|
||
|
||
## 四、质量基线
|
||
|
||
- 后端:744 项测试通过。
|
||
- 前端:15 项测试通过,TypeScript 检查与生产构建通过。
|
||
- 数据库:Alembic upgrade/downgrade 往返通过,head 为 `d4e7f9a1b2c3`。
|
||
- 发布检查:版本一致性、相关 Ruff、迁移演练、健康检查与关键 API 冒烟通过。
|
||
|
||
## 五、兼容性与配置
|
||
|
||
- 项目版本单一数据源从 `0.8.0` 修正为 `1.0.0`,由 `scripts/sync_version.py` 同步前端包文件。
|
||
- 不改变现有 HTTP 路径、响应字段、SQLite 数据卷、API Key 或 OpenClaw 配置格式。
|
||
- 升级时容器入口自动执行 Alembic;正式发布前仍必须备份数据 volume。
|
||
- 当前部署假设为单进程 FastAPI + SQLite;切换多 worker 前需复审条件认领和并发写入边界。
|
||
|
||
## 六、版本说明
|
||
|
||
仓库早期存在一个名为 `V1.1` 的文档,它创建时实际代码版本是 `0.2.0-dev`,属于原型阶段编号。自本发布起,项目版本以 `pyproject.toml`、Git 标签和健康接口报告的 SemVer 为准。
|