release: normalize project version to v1.0.0
This commit is contained in:
parent
1782b245bf
commit
941df4c8c7
@ -4,7 +4,7 @@ This file provides guidance to Codex (Codex.ai/code) when working with code in t
|
||||
|
||||
## 项目概述
|
||||
|
||||
**AgentEvalTool** 是智能体质量评估工具集平台(v0.5.0-dev),用于评估 AI 数字员工(tutu-api 通道)和 AI 助手(OpenClaw)的服务质量。Python 3.11 后端 + TypeScript/React 前端,SQLite 持久化。领域术语词汇表见 `CONTEXT.md`,关键决策见 `docs/adr/`。
|
||||
**AgentEvalTool** 是智能体质量评估工具集平台(v1.0.0),用于评估 AI 数字员工(tutu-api 通道)和 AI 助手(OpenClaw)的服务质量。Python 3.11 后端 + TypeScript/React 前端,SQLite 持久化。领域术语词汇表见 `CONTEXT.md`,关键决策见 `docs/adr/`。
|
||||
|
||||
## 常用命令
|
||||
|
||||
|
||||
19
README.md
19
README.md
@ -1,6 +1,6 @@
|
||||
# AgentEvalTool
|
||||
|
||||
> **当前开发版本**: v0.4.0-dev 「联」 · 已发布至 t480 · 发布说明见 [docs/release-notes-v0.4.md](docs/release-notes-v0.4.md)
|
||||
> **当前版本**:v1.0.0 · 已部署至 t480 开发线与 volcengine-102 正式线 · [发布说明](docs/release-notes-v1.0.md)
|
||||
|
||||
智能体质量评估工具集平台。
|
||||
|
||||
@ -18,16 +18,18 @@
|
||||
- 运营仪表盘(指标卡 / 趋势 / 场景表现 / 触发来源分布)
|
||||
- 文件管理(分类树 + 上传下载)
|
||||
- OpenClaw 免登录 iframe 集成 + 标准 agenteval-run 技能
|
||||
- 周期评估活动(耐久调度、探索式评测、智能分析、周期对比)
|
||||
- OpenClaw 驱动的独立智能评估(规划、审批、会话执行、结构化报告)
|
||||
- Web 管理后台(FastAPI + React)
|
||||
|
||||
## v0.4 亮点
|
||||
## v1.0 亮点
|
||||
|
||||
- **AI 助手标准化**:`triggered_by` 全链路标记 + 标准 SKILL.md 版本管理与自动同步 + API Key 自动注入
|
||||
- **简单登录**:`AGENTEVAL_ADMIN_PASSWORD` 一键启用访问控制,机器调用(X-API-Key)不受影响
|
||||
- **仪表盘重构**:6 指标卡 + 趋势 + 场景表现排行 + 触发来源分布
|
||||
- **报告页重做**:场景筛选、富选项下拉、一键重置、对比报告限同场景
|
||||
- **keep-alive 刷新修复**:标签页激活自动刷新,根治"评测记录消失"问题
|
||||
- **测试基线**:232 个测试
|
||||
- **双评测体系**:静态评估以考纲和规则为权威;智能评估由 OpenClaw 规划并模拟真实用户行为。
|
||||
- **周期质量运营**:Campaign 支持耐久调度、探索发现、智能分析和跨周期对比。
|
||||
- **耐久架构**:数据库保存运行与智能作业权威状态,进程重启后可按明确边界恢复。
|
||||
- **统一管理后台**:详情与报告采用 Drawer/页内视图,列表、轮询、反馈和危险操作遵循一致交互基线。
|
||||
- **双线部署**:t480 用于开发验证,volcengine-102 通过不可变镜像、数据备份和迁移发布正式服务。
|
||||
- **测试基线**:后端 744 项、前端 15 项自动化测试通过。
|
||||
|
||||
## 快速开始
|
||||
|
||||
@ -76,6 +78,7 @@ npm run dev
|
||||
完整的文档集位于 `docs/` 目录:
|
||||
|
||||
- **[文档索引](docs/README.md)** - 文档导航和快速查找
|
||||
- **[v1.0 发布说明](docs/release-notes-v1.0.md)** - 当前发布能力与验收基线
|
||||
- **[需求分析](docs/requirements-v1.0.md)** - 项目背景、功能需求、验证标准
|
||||
- **[架构设计](docs/architecture-v1.0.md)** - 系统架构、核心抽象、项目结构
|
||||
- **[数据模型](docs/data-models-v1.0.md)** - 数据库表结构、模型关系
|
||||
|
||||
@ -1,8 +1,9 @@
|
||||
# AgentEvalTool 文档索引
|
||||
|
||||
**版本**: v1.0
|
||||
**日期**: 2026-07-09
|
||||
**状态**: 已发布
|
||||
**文档版本**: v1.1
|
||||
**项目版本**: v1.0.0
|
||||
**日期**: 2026-08-11
|
||||
**状态**: 已发布
|
||||
**作者**: AgentEval Team
|
||||
|
||||
---
|
||||
@ -36,6 +37,7 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
|
||||
|------|------|------|
|
||||
| **部署概览** | 部署方式、环境要求、运维指南 | [deployment/README.md](deployment/README.md) |
|
||||
| **t480 部署指南** | t480 测试服务器具体部署步骤 | [deployment/t480-v1.0.md](deployment/t480-v1.0.md) |
|
||||
| **volcengine-102 部署指南** | 正式线发布、验证与回滚 | [deployment/volcengine-102-v1.0.md](deployment/volcengine-102-v1.0.md) |
|
||||
|
||||
### 2.4 使用指南
|
||||
|
||||
@ -48,8 +50,10 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
|
||||
|
||||
| 文档 | 说明 | 链接 |
|
||||
|------|------|------|
|
||||
| **V1.1 发布说明** | 前端重构、后端增强、关键 Bug 修复 | [release-notes-v1.1.md](release-notes-v1.1.md) |
|
||||
| **V1.0.0 发布说明** | 双评测体系、耐久 Campaign、架构深化与双线部署 | [release-notes-v1.0.md](release-notes-v1.0.md) |
|
||||
| **V0.8 发布说明** | Campaign 周期对比与正式线演进基线 | [release-notes-v0.8.md](release-notes-v0.8.md) |
|
||||
| **V0.2 发布说明** | async 引擎、安全基线、测试基线、部署规范化 | [release-notes-v0.2.md](release-notes-v0.2.md) |
|
||||
| **历史 V1.1 编号文档** | 早期原型阶段编号,不代表当前 SemVer | [release-notes-v1.1.md](release-notes-v1.1.md) |
|
||||
|
||||
### 2.6 开发日志
|
||||
|
||||
@ -58,7 +62,14 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
|
||||
| **v0.3.0 开发计划** | 模型配置中心、统一模型调用与旧配置迁移 | [plan-v0.3.md](plan-v0.3.md) |
|
||||
| **2026-07-15 评测执行页改版** | 布局修复、Tab 滚动、时区 Bug、时间过滤、UI 全面改版 | [dev-log-20260715.md](dev-log-20260715.md) |
|
||||
|
||||
### 2.6 外部参考
|
||||
### 2.6 阶段归档
|
||||
|
||||
| 文档 | 说明 | 链接 |
|
||||
|------|------|------|
|
||||
| **归档索引** | 已验收阶段的目标、决策、证据与后续约束 | [archive/README.md](archive/README.md) |
|
||||
| **Campaign 架构深化** | 耐久作业、读模型、运行时和正式线交付总结 | [archive/campaign-architecture-deepening-20260811-v1.0.md](archive/campaign-architecture-deepening-20260811-v1.0.md) |
|
||||
|
||||
### 2.7 外部参考
|
||||
|
||||
| 文档 | 说明 | 位置 |
|
||||
|------|------|------|
|
||||
@ -94,11 +105,11 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
|
||||
|
||||
## 四、版本说明
|
||||
|
||||
- **当前版本**: v0.3.0-dev
|
||||
- **版本基线日期**: 2026-07-17
|
||||
- **状态**: 开发中(t480 开发线运行)
|
||||
- **当前版本**: v1.0.0
|
||||
- **版本基线日期**: 2026-08-11
|
||||
- **状态**: 已部署(t480 开发线、volcengine-102 正式线)
|
||||
|
||||
所有文档均标注版本号,便于追踪和管理。版本发布说明见 [release-notes-v1.1.md](release-notes-v1.1.md)。
|
||||
所有文档均标注版本号,便于追踪和管理。当前发布说明见 [release-notes-v1.0.md](release-notes-v1.0.md)。
|
||||
|
||||
## 五、文档规范
|
||||
|
||||
@ -131,4 +142,4 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
|
||||
|
||||
---
|
||||
|
||||
**最后更新**: 2026-07-17
|
||||
**最后更新**: 2026-08-11
|
||||
|
||||
7
docs/archive/README.md
Normal file
7
docs/archive/README.md
Normal file
@ -0,0 +1,7 @@
|
||||
# 阶段归档索引
|
||||
|
||||
本目录保存已经完成并通过验收的阶段性工作记录。归档文档用于说明阶段目标、实施结果、关键决策、验证证据和后续约束;正在讨论的方案仍保留在 Issue 或工作草稿中。
|
||||
|
||||
| 日期 | 阶段 | 结果 | 文档 |
|
||||
|---|---|---|---|
|
||||
| 2026-08-11 | Campaign 架构深化与正式线交付 | 已完成并部署 | [campaign-architecture-deepening-20260811-v1.0.md](campaign-architecture-deepening-20260811-v1.0.md) |
|
||||
@ -0,0 +1,43 @@
|
||||
# Campaign 架构深化阶段总结
|
||||
|
||||
**版本**:v1.0
|
||||
**归档日期**:2026-08-11
|
||||
**阶段状态**:已完成并纳入项目 v1.0.0
|
||||
**代码基线**:`10a089e` → `1782b24`
|
||||
**需求来源**:Gitea Issue #2、`.scratch/refactor-plan-architecture-deepening-v2.md`
|
||||
|
||||
## 一、阶段目标
|
||||
|
||||
本阶段在不改变 HTTP 契约、业务口径、管理后台信息架构和部署拓扑的前提下,继续深化 Campaign 相关模块:统一智能分析与周期对比的耐久作业编排,建立稳定读模型,收窄 Campaign 运行时接口,并验证是否值得抽取跨领域条件写入模块。
|
||||
|
||||
## 二、交付结果
|
||||
|
||||
1. **耐久智能作业**:新增统一 owner,集中管理 queued 持久化、条件认领、任务句柄、成功/失败结算、启动恢复和关闭。重复入队不再把 `generating` 回退为 `queued`;恢复最多 3 次,避免无限模型调用。
|
||||
2. **Campaign 读模型**:列表、详情、报告、时间线、智能分析、周期对比和 Markdown 导出统一消费稳定 projection;列表 child Run 改为批量读取。
|
||||
3. **CampaignRuntime**:生产调用面收敛为 `start`、`cancel`、`recover`、`shutdown`,时钟、child Run 执行器、tick、reconcile 与 TaskRegistry 留在实现内部。
|
||||
4. **前端请求编排**:`useCampaignReport` 统一列表、报告快照、展开行时间线、状态感知轮询、silent refresh、生成操作和迟到响应过滤;页面回归渲染与交互职责。
|
||||
5. **删除测试**:拒绝通用条件写入模块。Campaign 与 Intelligent Evaluation 只有 SQL 外形相似,状态、时间、事务副作用和冲突语义不同;结论记录于 ADR-0006。
|
||||
|
||||
## 三、质量与发布验收
|
||||
|
||||
- 后端:`744 passed`。
|
||||
- 前端:`15 passed`;`tsc --noEmit` 与生产构建通过。
|
||||
- 迁移:Alembic upgrade/downgrade 往返通过,生产数据库位于 `d4e7f9a1b2c3 (head)`。
|
||||
- 代码质量:本阶段相关 Ruff 检查及 `git diff --check` 通过。
|
||||
- 阶段验收镜像:`agenteval:0.8.0-1782b24`;版本漂移随后在项目 `v1.0.0` 发布中统一修正。
|
||||
- 正式地址:<https://agenteval.solahqb22.cn/>;前端、健康接口和 OpenClaw 均验证成功。
|
||||
- 发布前备份:`/var/backups/agenteval/agenteval-0.8.0-1782b24-20260811T051927Z.tgz`。
|
||||
|
||||
## 四、关键决策
|
||||
|
||||
- 数据库是 Campaign 与智能作业的耐久权威;TaskRegistry 只保存当前进程句柄。
|
||||
- `queued` 可以有限恢复;遗留 `generating` 失败结算,不自动重放可能已产生外部副作用或费用的工作。
|
||||
- Campaign 读模型是跨 Repository 组合的唯一稳定 seam,Router 不拼装领域快照。
|
||||
- 保持单进程 FastAPI + SQLite 假设;引入多 worker 前必须重新评审认领、恢复和 SQLite 并发边界。
|
||||
|
||||
## 五、后续事项
|
||||
|
||||
- 阶段结束提交为 `1782b24`;后续发布提交统一项目版本并重新部署双线环境。
|
||||
- `.scratch/` 中原始计划和辅助脚本继续保留,未纳入版本控制。
|
||||
- 全仓库 Ruff 仍有 6 个历史迁移格式问题;与本阶段逻辑无关,后续可单独清理。
|
||||
- 下一轮架构工作应以真实第三个 adapter 或新部署约束为触发条件,避免仅因代码形状相似继续抽象。
|
||||
@ -53,8 +53,8 @@ export AGENTEVAL_PROD_BACKUP_DIR=/var/backups/agenteval
|
||||
发布必须基于已提交的 Git 版本;脚本会拒绝存在 tracked 未提交修改的工作区。推荐使用版本号加 commit 作为不可变镜像标签:
|
||||
|
||||
```bash
|
||||
scripts/deploy-volcengine-102.sh --dry-run --tag 0.8.0-6248568
|
||||
scripts/deploy-volcengine-102.sh --tag 0.8.0-6248568
|
||||
scripts/deploy-volcengine-102.sh --dry-run --tag 1.0.0-abcdef0
|
||||
scripts/deploy-volcengine-102.sh --tag 1.0.0-abcdef0
|
||||
```
|
||||
|
||||
脚本依次执行:SSH 检查 → 版本读取 → 远端 `.env` 检查 → 通过 `git archive HEAD` 生成并同步已提交源代码 → 备份数据 volume → 远端构建带版本元数据的镜像 → 启动双容器 → 等待健康接口 → 校验版本/commit → 鉴权 API 冒烟。
|
||||
@ -70,7 +70,7 @@ scripts/deploy-volcengine-102.sh --tag 0.8.0-6248568
|
||||
回滚只切换应用镜像,不自动降级数据库:
|
||||
|
||||
```bash
|
||||
scripts/deploy-volcengine-102.sh --rollback 0.8.0-previous
|
||||
scripts/deploy-volcengine-102.sh --rollback 1.0.0-previous
|
||||
```
|
||||
|
||||
每次发布和回滚前都会在远端备份 named volume 到 `AGENTEVAL_PROD_BACKUP_DIR`。如果某个版本包含不可逆数据迁移,应先停止服务、恢复匹配的数据备份,再启动旧镜像;不得只回滚代码而忽略数据库版本。
|
||||
|
||||
45
docs/release-notes-v1.0.md
Normal file
45
docs/release-notes-v1.0.md
Normal file
@ -0,0 +1,45 @@
|
||||
# AgentEvalTool v1.0.0 发布说明
|
||||
|
||||
**版本**:v1.0.0
|
||||
**发布日期**:2026-08-11
|
||||
**状态**:已发布
|
||||
**作者**:AgentEval Team
|
||||
|
||||
## 一、版本定位
|
||||
|
||||
v1.0.0 标志 AgentEvalTool 从单次规则评测工具升级为具备两套互补评测体系的质量运营平台:静态评估用固定考纲回答“通过了多少”,智能评估由 OpenClaw 模拟真实用户回答“实际体验中有什么问题”。此前已经完成的 v0.9 探索式评测和智能评估 v1.0 功能里程碑在本次发布中正式统一到项目 SemVer。
|
||||
|
||||
## 二、核心能力
|
||||
|
||||
- **静态评估**:对象、场景、规则、Run、实时 WebSocket、报告与同版本对比。
|
||||
- **周期 Campaign**:耐久调度、child Run 身份、重启恢复、探索会话、智能分析和周期对比。
|
||||
- **智能评估**:OpenClaw 规划、人工审批、虚拟用户会话、体验判定、结构化发现报告和 Markdown 导出。
|
||||
- **模型配置中心**:统一管理调用协议、用途能力、模态和分析/judge 默认岗位。
|
||||
- **管理后台**:keep-alive 标签页、统一 Drawer/页壳/反馈规范、状态感知轮询和完整快照读取。
|
||||
- **双线部署**:t480 开发线与 volcengine-102 正式线;正式发布包含数据备份、Alembic 迁移、不可变镜像和鉴权 API 冒烟。
|
||||
|
||||
## 三、架构基线
|
||||
|
||||
- 数据库是 Campaign、child Run 和耐久智能作业的状态权威;TaskRegistry 只保存进程内句柄。
|
||||
- `CampaignRuntime` 对外只暴露 `start`、`cancel`、`recover`、`shutdown`。
|
||||
- `CampaignReadModel` 统一列表、详情、报告、时间线、分析、对比和导出 projection。
|
||||
- 智能分析与周期对比共享耐久作业 owner;queued 条件认领并有限恢复,遗留 generating 不自动重放。
|
||||
- Campaign 与 Intelligent Evaluation 保持独立状态机;拒绝仅因 SQL 形状相似建立跨领域条件写入模块。
|
||||
|
||||
## 四、质量基线
|
||||
|
||||
- 后端:744 项测试通过。
|
||||
- 前端:15 项测试通过,TypeScript 检查与生产构建通过。
|
||||
- 数据库:Alembic upgrade/downgrade 往返通过,head 为 `d4e7f9a1b2c3`。
|
||||
- 发布检查:版本一致性、相关 Ruff、迁移演练、健康检查与关键 API 冒烟通过。
|
||||
|
||||
## 五、兼容性与配置
|
||||
|
||||
- 项目版本单一数据源从 `0.8.0` 修正为 `1.0.0`,由 `scripts/sync_version.py` 同步前端包文件。
|
||||
- 不改变现有 HTTP 路径、响应字段、SQLite 数据卷、API Key 或 OpenClaw 配置格式。
|
||||
- 升级时容器入口自动执行 Alembic;正式发布前仍必须备份数据 volume。
|
||||
- 当前部署假设为单进程 FastAPI + SQLite;切换多 worker 前需复审条件认领和并发写入边界。
|
||||
|
||||
## 六、版本说明
|
||||
|
||||
仓库早期存在一个名为 `V1.1` 的文档,它创建时实际代码版本是 `0.2.0-dev`,属于原型阶段编号。自本发布起,项目版本以 `pyproject.toml`、Git 标签和健康接口报告的 SemVer 为准。
|
||||
@ -1,8 +1,10 @@
|
||||
# AgentEvalTool V1.1 版本发布说明
|
||||
# 历史归档:AgentEvalTool V1.1 版本说明
|
||||
|
||||
**版本**: v1.1
|
||||
**日期**: 2026-07-10
|
||||
**状态**: 已发布
|
||||
> **编号说明**:本文创建于 2026-07-16,当时代码包版本实际为 `0.2.0-dev`。这里的“V1.1”属于早期原型文档编号,不是当前项目 SemVer,也不晚于 2026-08-11 发布的 `v1.0.0`。当前发布说明见 [release-notes-v1.0.md](release-notes-v1.0.md)。
|
||||
|
||||
**版本**: v1.1
|
||||
**日期**: 2026-07-10
|
||||
**状态**: 历史编号归档
|
||||
**作者**: AgentEval Team
|
||||
|
||||
---
|
||||
|
||||
4
frontend/web/package-lock.json
generated
4
frontend/web/package-lock.json
generated
@ -1,12 +1,12 @@
|
||||
{
|
||||
"name": "agenteval-web",
|
||||
"version": "0.8.0",
|
||||
"version": "1.0.0",
|
||||
"lockfileVersion": 3,
|
||||
"requires": true,
|
||||
"packages": {
|
||||
"": {
|
||||
"name": "agenteval-web",
|
||||
"version": "0.8.0",
|
||||
"version": "1.0.0",
|
||||
"dependencies": {
|
||||
"@ant-design/charts": "^2.6.7",
|
||||
"@ant-design/icons": "^6.3.2",
|
||||
|
||||
@ -1,6 +1,6 @@
|
||||
{
|
||||
"name": "agenteval-web",
|
||||
"version": "0.8.0",
|
||||
"version": "1.0.0",
|
||||
"private": true,
|
||||
"type": "module",
|
||||
"scripts": {
|
||||
|
||||
@ -4,7 +4,7 @@ build-backend = "hatchling.build"
|
||||
|
||||
[project]
|
||||
name = "agenteval"
|
||||
version = "0.8.0"
|
||||
version = "1.0.0"
|
||||
description = "智能体质量评估工具集平台"
|
||||
readme = "README.md"
|
||||
requires-python = ">=3.10"
|
||||
|
||||
@ -10,9 +10,9 @@
|
||||
# AGENTEVAL_PROD_BACKUP_DIR=/var/backups/agenteval
|
||||
#
|
||||
# Usage:
|
||||
# scripts/deploy-volcengine-102.sh --tag 0.8.0-6248568
|
||||
# scripts/deploy-volcengine-102.sh --dry-run --tag 0.8.0-6248568
|
||||
# scripts/deploy-volcengine-102.sh --rollback 0.8.0-6248568
|
||||
# scripts/deploy-volcengine-102.sh --tag 1.0.0-abcdef0
|
||||
# scripts/deploy-volcengine-102.sh --dry-run --tag 1.0.0-abcdef0
|
||||
# scripts/deploy-volcengine-102.sh --rollback 1.0.0-abcdef0
|
||||
|
||||
set -euo pipefail
|
||||
|
||||
|
||||
Loading…
Reference in New Issue
Block a user