AgentEvalTool/docs/release-notes-v1.0.md

2.9 KiB
Raw Blame History

AgentEvalTool v1.0.0 发布说明

版本v1.0.0 发布日期2026-08-11 状态:已发布 作者AgentEval Team

一、版本定位

v1.0.0 标志 AgentEvalTool 从单次规则评测工具升级为具备两套互补评测体系的质量运营平台:静态评估用固定考纲回答“通过了多少”,智能评估由 OpenClaw 模拟真实用户回答“实际体验中有什么问题”。此前已经完成的 v0.9 探索式评测和智能评估 v1.0 功能里程碑在本次发布中正式统一到项目 SemVer。

二、核心能力

  • 静态评估对象、场景、规则、Run、实时 WebSocket、报告与同版本对比。
  • 周期 Campaign耐久调度、child Run 身份、重启恢复、探索会话、智能分析和周期对比。
  • 智能评估OpenClaw 规划、人工审批、虚拟用户会话、体验判定、结构化发现报告和 Markdown 导出。
  • 模型配置中心:统一管理调用协议、用途能力、模态和分析/judge 默认岗位。
  • 管理后台keep-alive 标签页、统一 Drawer/页壳/反馈规范、状态感知轮询和完整快照读取。
  • 双线部署t480 开发线与 volcengine-102 正式线正式发布包含数据备份、Alembic 迁移、不可变镜像和鉴权 API 冒烟。

三、架构基线

  • 数据库是 Campaign、child Run 和耐久智能作业的状态权威TaskRegistry 只保存进程内句柄。
  • CampaignRuntime 对外只暴露 startcancelrecovershutdown
  • CampaignReadModel 统一列表、详情、报告、时间线、分析、对比和导出 projection。
  • 智能分析与周期对比共享耐久作业 ownerqueued 条件认领并有限恢复,遗留 generating 不自动重放。
  • Campaign 与 Intelligent Evaluation 保持独立状态机;拒绝仅因 SQL 形状相似建立跨领域条件写入模块。

四、质量基线

  • 后端744 项测试通过。
  • 前端15 项测试通过TypeScript 检查与生产构建通过。
  • 数据库Alembic upgrade/downgrade 往返通过head 为 d4e7f9a1b2c3
  • 发布检查:版本一致性、相关 Ruff、迁移演练、健康检查与关键 API 冒烟通过。

五、兼容性与配置

  • 项目版本单一数据源从 0.8.0 修正为 1.0.0,由 scripts/sync_version.py 同步前端包文件。
  • 不改变现有 HTTP 路径、响应字段、SQLite 数据卷、API Key 或 OpenClaw 配置格式。
  • 升级时容器入口自动执行 Alembic正式发布前仍必须备份数据 volume。
  • 当前部署假设为单进程 FastAPI + SQLite切换多 worker 前需复审条件认领和并发写入边界。

六、版本说明

仓库早期存在一个名为 V1.1 的文档,它创建时实际代码版本是 0.2.0-dev,属于原型阶段编号。自本发布起,项目版本以 pyproject.toml、Git 标签和健康接口报告的 SemVer 为准。