AgentEvalTool/docs/release-notes-v1.0.md

46 lines
2.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# AgentEvalTool v1.0.0 发布说明
**版本**v1.0.0
**发布日期**2026-08-11
**状态**:已发布
**作者**AgentEval Team
## 一、版本定位
v1.0.0 标志 AgentEvalTool 从单次规则评测工具升级为具备两套互补评测体系的质量运营平台:静态评估用固定考纲回答“通过了多少”,智能评估由 OpenClaw 模拟真实用户回答“实际体验中有什么问题”。此前已经完成的 v0.9 探索式评测和智能评估 v1.0 功能里程碑在本次发布中正式统一到项目 SemVer。
## 二、核心能力
- **静态评估**对象、场景、规则、Run、实时 WebSocket、报告与同版本对比。
- **周期 Campaign**耐久调度、child Run 身份、重启恢复、探索会话、智能分析和周期对比。
- **智能评估**OpenClaw 规划、人工审批、虚拟用户会话、体验判定、结构化发现报告和 Markdown 导出。
- **模型配置中心**:统一管理调用协议、用途能力、模态和分析/judge 默认岗位。
- **管理后台**keep-alive 标签页、统一 Drawer/页壳/反馈规范、状态感知轮询和完整快照读取。
- **双线部署**t480 开发线与 volcengine-102 正式线正式发布包含数据备份、Alembic 迁移、不可变镜像和鉴权 API 冒烟。
## 三、架构基线
- 数据库是 Campaign、child Run 和耐久智能作业的状态权威TaskRegistry 只保存进程内句柄。
- `CampaignRuntime` 对外只暴露 `start`、`cancel`、`recover`、`shutdown`。
- `CampaignReadModel` 统一列表、详情、报告、时间线、分析、对比和导出 projection。
- 智能分析与周期对比共享耐久作业 ownerqueued 条件认领并有限恢复,遗留 generating 不自动重放。
- Campaign 与 Intelligent Evaluation 保持独立状态机;拒绝仅因 SQL 形状相似建立跨领域条件写入模块。
## 四、质量基线
- 后端744 项测试通过。
- 前端15 项测试通过TypeScript 检查与生产构建通过。
- 数据库Alembic upgrade/downgrade 往返通过head 为 `d4e7f9a1b2c3`
- 发布检查:版本一致性、相关 Ruff、迁移演练、健康检查与关键 API 冒烟通过。
## 五、兼容性与配置
- 项目版本单一数据源从 `0.8.0` 修正为 `1.0.0`,由 `scripts/sync_version.py` 同步前端包文件。
- 不改变现有 HTTP 路径、响应字段、SQLite 数据卷、API Key 或 OpenClaw 配置格式。
- 升级时容器入口自动执行 Alembic正式发布前仍必须备份数据 volume。
- 当前部署假设为单进程 FastAPI + SQLite切换多 worker 前需复审条件认领和并发写入边界。
## 六、版本说明
仓库早期存在一个名为 `V1.1` 的文档,它创建时实际代码版本是 `0.2.0-dev`,属于原型阶段编号。自本发布起,项目版本以 `pyproject.toml`、Git 标签和健康接口报告的 SemVer 为准。