release: normalize project version to v1.0.0

This commit is contained in:
sinohqb 2026-08-11 14:07:05 +08:00
parent 1782b245bf
commit 941df4c8c7
12 changed files with 144 additions and 33 deletions

View File

@ -4,7 +4,7 @@ This file provides guidance to Codex (Codex.ai/code) when working with code in t
## 项目概述
**AgentEvalTool** 是智能体质量评估工具集平台v0.5.0-dev),用于评估 AI 数字员工tutu-api 通道)和 AI 助手OpenClaw的服务质量。Python 3.11 后端 + TypeScript/React 前端SQLite 持久化。领域术语词汇表见 `CONTEXT.md`,关键决策见 `docs/adr/`
**AgentEvalTool** 是智能体质量评估工具集平台v1.0.0),用于评估 AI 数字员工tutu-api 通道)和 AI 助手OpenClaw的服务质量。Python 3.11 后端 + TypeScript/React 前端SQLite 持久化。领域术语词汇表见 `CONTEXT.md`,关键决策见 `docs/adr/`
## 常用命令

View File

@ -1,6 +1,6 @@
# AgentEvalTool
> **当前开发版本**: v0.4.0-dev 「联」 · 已发布至 t480 · 发布说明见 [docs/release-notes-v0.4.md](docs/release-notes-v0.4.md)
> **当前版本**v1.0.0 · 已部署至 t480 开发线与 volcengine-102 正式线 · [发布说明](docs/release-notes-v1.0.md)
智能体质量评估工具集平台。
@ -18,16 +18,18 @@
- 运营仪表盘(指标卡 / 趋势 / 场景表现 / 触发来源分布)
- 文件管理(分类树 + 上传下载)
- OpenClaw 免登录 iframe 集成 + 标准 agenteval-run 技能
- 周期评估活动(耐久调度、探索式评测、智能分析、周期对比)
- OpenClaw 驱动的独立智能评估(规划、审批、会话执行、结构化报告)
- Web 管理后台FastAPI + React
## v0.4 亮点
## v1.0 亮点
- **AI 助手标准化**`triggered_by` 全链路标记 + 标准 SKILL.md 版本管理与自动同步 + API Key 自动注入
- **简单登录**`AGENTEVAL_ADMIN_PASSWORD` 一键启用访问控制机器调用X-API-Key不受影响
- **仪表盘重构**6 指标卡 + 趋势 + 场景表现排行 + 触发来源分布
- **报告页重做**:场景筛选、富选项下拉、一键重置、对比报告限同场景
- **keep-alive 刷新修复**:标签页激活自动刷新,根治"评测记录消失"问题
- **测试基线**232 个测试
- **双评测体系**:静态评估以考纲和规则为权威;智能评估由 OpenClaw 规划并模拟真实用户行为。
- **周期质量运营**Campaign 支持耐久调度、探索发现、智能分析和跨周期对比。
- **耐久架构**:数据库保存运行与智能作业权威状态,进程重启后可按明确边界恢复。
- **统一管理后台**:详情与报告采用 Drawer/页内视图,列表、轮询、反馈和危险操作遵循一致交互基线。
- **双线部署**t480 用于开发验证volcengine-102 通过不可变镜像、数据备份和迁移发布正式服务。
- **测试基线**后端 744 项、前端 15 项自动化测试通过。
## 快速开始
@ -76,6 +78,7 @@ npm run dev
完整的文档集位于 `docs/` 目录:
- **[文档索引](docs/README.md)** - 文档导航和快速查找
- **[v1.0 发布说明](docs/release-notes-v1.0.md)** - 当前发布能力与验收基线
- **[需求分析](docs/requirements-v1.0.md)** - 项目背景、功能需求、验证标准
- **[架构设计](docs/architecture-v1.0.md)** - 系统架构、核心抽象、项目结构
- **[数据模型](docs/data-models-v1.0.md)** - 数据库表结构、模型关系

View File

@ -1,7 +1,8 @@
# AgentEvalTool 文档索引
**版本**: v1.0
**日期**: 2026-07-09
**文档版本**: v1.1
**项目版本**: v1.0.0
**日期**: 2026-08-11
**状态**: 已发布
**作者**: AgentEval Team
@ -36,6 +37,7 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
|------|------|------|
| **部署概览** | 部署方式、环境要求、运维指南 | [deployment/README.md](deployment/README.md) |
| **t480 部署指南** | t480 测试服务器具体部署步骤 | [deployment/t480-v1.0.md](deployment/t480-v1.0.md) |
| **volcengine-102 部署指南** | 正式线发布、验证与回滚 | [deployment/volcengine-102-v1.0.md](deployment/volcengine-102-v1.0.md) |
### 2.4 使用指南
@ -48,8 +50,10 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
| 文档 | 说明 | 链接 |
|------|------|------|
| **V1.1 发布说明** | 前端重构、后端增强、关键 Bug 修复 | [release-notes-v1.1.md](release-notes-v1.1.md) |
| **V1.0.0 发布说明** | 双评测体系、耐久 Campaign、架构深化与双线部署 | [release-notes-v1.0.md](release-notes-v1.0.md) |
| **V0.8 发布说明** | Campaign 周期对比与正式线演进基线 | [release-notes-v0.8.md](release-notes-v0.8.md) |
| **V0.2 发布说明** | async 引擎、安全基线、测试基线、部署规范化 | [release-notes-v0.2.md](release-notes-v0.2.md) |
| **历史 V1.1 编号文档** | 早期原型阶段编号,不代表当前 SemVer | [release-notes-v1.1.md](release-notes-v1.1.md) |
### 2.6 开发日志
@ -58,7 +62,14 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
| **v0.3.0 开发计划** | 模型配置中心、统一模型调用与旧配置迁移 | [plan-v0.3.md](plan-v0.3.md) |
| **2026-07-15 评测执行页改版** | 布局修复、Tab 滚动、时区 Bug、时间过滤、UI 全面改版 | [dev-log-20260715.md](dev-log-20260715.md) |
### 2.6 外部参考
### 2.6 阶段归档
| 文档 | 说明 | 链接 |
|------|------|------|
| **归档索引** | 已验收阶段的目标、决策、证据与后续约束 | [archive/README.md](archive/README.md) |
| **Campaign 架构深化** | 耐久作业、读模型、运行时和正式线交付总结 | [archive/campaign-architecture-deepening-20260811-v1.0.md](archive/campaign-architecture-deepening-20260811-v1.0.md) |
### 2.7 外部参考
| 文档 | 说明 | 位置 |
|------|------|------|
@ -94,11 +105,11 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
## 四、版本说明
- **当前版本**: v0.3.0-dev
- **版本基线日期**: 2026-07-17
- **状态**: 开发中t480 开发线运行
- **当前版本**: v1.0.0
- **版本基线日期**: 2026-08-11
- **状态**: 已部署t480 开发线、volcengine-102 正式线
所有文档均标注版本号,便于追踪和管理。版本发布说明见 [release-notes-v1.1.md](release-notes-v1.1.md)。
所有文档均标注版本号,便于追踪和管理。当前发布说明见 [release-notes-v1.0.md](release-notes-v1.0.md)。
## 五、文档规范
@ -131,4 +142,4 @@ AgentEvalTool 是一个智能体质量评估工具集平台,用于评估 AI
---
**最后更新**: 2026-07-17
**最后更新**: 2026-08-11

7
docs/archive/README.md Normal file
View File

@ -0,0 +1,7 @@
# 阶段归档索引
本目录保存已经完成并通过验收的阶段性工作记录。归档文档用于说明阶段目标、实施结果、关键决策、验证证据和后续约束;正在讨论的方案仍保留在 Issue 或工作草稿中。
| 日期 | 阶段 | 结果 | 文档 |
|---|---|---|---|
| 2026-08-11 | Campaign 架构深化与正式线交付 | 已完成并部署 | [campaign-architecture-deepening-20260811-v1.0.md](campaign-architecture-deepening-20260811-v1.0.md) |

View File

@ -0,0 +1,43 @@
# Campaign 架构深化阶段总结
**版本**v1.0
**归档日期**2026-08-11
**阶段状态**:已完成并纳入项目 v1.0.0
**代码基线**`10a089e` → `1782b24`
**需求来源**Gitea Issue #2、`.scratch/refactor-plan-architecture-deepening-v2.md`
## 一、阶段目标
本阶段在不改变 HTTP 契约、业务口径、管理后台信息架构和部署拓扑的前提下,继续深化 Campaign 相关模块:统一智能分析与周期对比的耐久作业编排,建立稳定读模型,收窄 Campaign 运行时接口,并验证是否值得抽取跨领域条件写入模块。
## 二、交付结果
1. **耐久智能作业**:新增统一 owner集中管理 queued 持久化、条件认领、任务句柄、成功/失败结算、启动恢复和关闭。重复入队不再把 `generating` 回退为 `queued`;恢复最多 3 次,避免无限模型调用。
2. **Campaign 读模型**:列表、详情、报告、时间线、智能分析、周期对比和 Markdown 导出统一消费稳定 projection列表 child Run 改为批量读取。
3. **CampaignRuntime**:生产调用面收敛为 `start`、`cancel`、`recover`、`shutdown`时钟、child Run 执行器、tick、reconcile 与 TaskRegistry 留在实现内部。
4. **前端请求编排**`useCampaignReport` 统一列表、报告快照、展开行时间线、状态感知轮询、silent refresh、生成操作和迟到响应过滤页面回归渲染与交互职责。
5. **删除测试**拒绝通用条件写入模块。Campaign 与 Intelligent Evaluation 只有 SQL 外形相似,状态、时间、事务副作用和冲突语义不同;结论记录于 ADR-0006。
## 三、质量与发布验收
- 后端:`744 passed`。
- 前端:`15 passed``tsc --noEmit` 与生产构建通过。
- 迁移Alembic upgrade/downgrade 往返通过,生产数据库位于 `d4e7f9a1b2c3 (head)`
- 代码质量:本阶段相关 Ruff 检查及 `git diff --check` 通过。
- 阶段验收镜像:`agenteval:0.8.0-1782b24`;版本漂移随后在项目 `v1.0.0` 发布中统一修正。
- 正式地址:<https://agenteval.solahqb22.cn/>;前端、健康接口和 OpenClaw 均验证成功。
- 发布前备份:`/var/backups/agenteval/agenteval-0.8.0-1782b24-20260811T051927Z.tgz`。
## 四、关键决策
- 数据库是 Campaign 与智能作业的耐久权威TaskRegistry 只保存当前进程句柄。
- `queued` 可以有限恢复;遗留 `generating` 失败结算,不自动重放可能已产生外部副作用或费用的工作。
- Campaign 读模型是跨 Repository 组合的唯一稳定 seamRouter 不拼装领域快照。
- 保持单进程 FastAPI + SQLite 假设;引入多 worker 前必须重新评审认领、恢复和 SQLite 并发边界。
## 五、后续事项
- 阶段结束提交为 `1782b24`;后续发布提交统一项目版本并重新部署双线环境。
- `.scratch/` 中原始计划和辅助脚本继续保留,未纳入版本控制。
- 全仓库 Ruff 仍有 6 个历史迁移格式问题;与本阶段逻辑无关,后续可单独清理。
- 下一轮架构工作应以真实第三个 adapter 或新部署约束为触发条件,避免仅因代码形状相似继续抽象。

View File

@ -53,8 +53,8 @@ export AGENTEVAL_PROD_BACKUP_DIR=/var/backups/agenteval
发布必须基于已提交的 Git 版本;脚本会拒绝存在 tracked 未提交修改的工作区。推荐使用版本号加 commit 作为不可变镜像标签:
```bash
scripts/deploy-volcengine-102.sh --dry-run --tag 0.8.0-6248568
scripts/deploy-volcengine-102.sh --tag 0.8.0-6248568
scripts/deploy-volcengine-102.sh --dry-run --tag 1.0.0-abcdef0
scripts/deploy-volcengine-102.sh --tag 1.0.0-abcdef0
```
脚本依次执行SSH 检查 → 版本读取 → 远端 `.env` 检查 → 通过 `git archive HEAD` 生成并同步已提交源代码 → 备份数据 volume → 远端构建带版本元数据的镜像 → 启动双容器 → 等待健康接口 → 校验版本/commit → 鉴权 API 冒烟。
@ -70,7 +70,7 @@ scripts/deploy-volcengine-102.sh --tag 0.8.0-6248568
回滚只切换应用镜像,不自动降级数据库:
```bash
scripts/deploy-volcengine-102.sh --rollback 0.8.0-previous
scripts/deploy-volcengine-102.sh --rollback 1.0.0-previous
```
每次发布和回滚前都会在远端备份 named volume 到 `AGENTEVAL_PROD_BACKUP_DIR`。如果某个版本包含不可逆数据迁移,应先停止服务、恢复匹配的数据备份,再启动旧镜像;不得只回滚代码而忽略数据库版本。

View File

@ -0,0 +1,45 @@
# AgentEvalTool v1.0.0 发布说明
**版本**v1.0.0
**发布日期**2026-08-11
**状态**:已发布
**作者**AgentEval Team
## 一、版本定位
v1.0.0 标志 AgentEvalTool 从单次规则评测工具升级为具备两套互补评测体系的质量运营平台:静态评估用固定考纲回答“通过了多少”,智能评估由 OpenClaw 模拟真实用户回答“实际体验中有什么问题”。此前已经完成的 v0.9 探索式评测和智能评估 v1.0 功能里程碑在本次发布中正式统一到项目 SemVer。
## 二、核心能力
- **静态评估**对象、场景、规则、Run、实时 WebSocket、报告与同版本对比。
- **周期 Campaign**耐久调度、child Run 身份、重启恢复、探索会话、智能分析和周期对比。
- **智能评估**OpenClaw 规划、人工审批、虚拟用户会话、体验判定、结构化发现报告和 Markdown 导出。
- **模型配置中心**:统一管理调用协议、用途能力、模态和分析/judge 默认岗位。
- **管理后台**keep-alive 标签页、统一 Drawer/页壳/反馈规范、状态感知轮询和完整快照读取。
- **双线部署**t480 开发线与 volcengine-102 正式线正式发布包含数据备份、Alembic 迁移、不可变镜像和鉴权 API 冒烟。
## 三、架构基线
- 数据库是 Campaign、child Run 和耐久智能作业的状态权威TaskRegistry 只保存进程内句柄。
- `CampaignRuntime` 对外只暴露 `start`、`cancel`、`recover`、`shutdown`。
- `CampaignReadModel` 统一列表、详情、报告、时间线、分析、对比和导出 projection。
- 智能分析与周期对比共享耐久作业 ownerqueued 条件认领并有限恢复,遗留 generating 不自动重放。
- Campaign 与 Intelligent Evaluation 保持独立状态机;拒绝仅因 SQL 形状相似建立跨领域条件写入模块。
## 四、质量基线
- 后端744 项测试通过。
- 前端15 项测试通过TypeScript 检查与生产构建通过。
- 数据库Alembic upgrade/downgrade 往返通过head 为 `d4e7f9a1b2c3`
- 发布检查:版本一致性、相关 Ruff、迁移演练、健康检查与关键 API 冒烟通过。
## 五、兼容性与配置
- 项目版本单一数据源从 `0.8.0` 修正为 `1.0.0`,由 `scripts/sync_version.py` 同步前端包文件。
- 不改变现有 HTTP 路径、响应字段、SQLite 数据卷、API Key 或 OpenClaw 配置格式。
- 升级时容器入口自动执行 Alembic正式发布前仍必须备份数据 volume。
- 当前部署假设为单进程 FastAPI + SQLite切换多 worker 前需复审条件认领和并发写入边界。
## 六、版本说明
仓库早期存在一个名为 `V1.1` 的文档,它创建时实际代码版本是 `0.2.0-dev`,属于原型阶段编号。自本发布起,项目版本以 `pyproject.toml`、Git 标签和健康接口报告的 SemVer 为准。

View File

@ -1,8 +1,10 @@
# AgentEvalTool V1.1 版本发布说明
# 历史归档AgentEvalTool V1.1 版本说明
> **编号说明**:本文创建于 2026-07-16当时代码包版本实际为 `0.2.0-dev`。这里的“V1.1”属于早期原型文档编号,不是当前项目 SemVer也不晚于 2026-08-11 发布的 `v1.0.0`。当前发布说明见 [release-notes-v1.0.md](release-notes-v1.0.md)。
**版本**: v1.1
**日期**: 2026-07-10
**状态**: 已发布
**状态**: 历史编号归档
**作者**: AgentEval Team
---

View File

@ -1,12 +1,12 @@
{
"name": "agenteval-web",
"version": "0.8.0",
"version": "1.0.0",
"lockfileVersion": 3,
"requires": true,
"packages": {
"": {
"name": "agenteval-web",
"version": "0.8.0",
"version": "1.0.0",
"dependencies": {
"@ant-design/charts": "^2.6.7",
"@ant-design/icons": "^6.3.2",

View File

@ -1,6 +1,6 @@
{
"name": "agenteval-web",
"version": "0.8.0",
"version": "1.0.0",
"private": true,
"type": "module",
"scripts": {

View File

@ -4,7 +4,7 @@ build-backend = "hatchling.build"
[project]
name = "agenteval"
version = "0.8.0"
version = "1.0.0"
description = "智能体质量评估工具集平台"
readme = "README.md"
requires-python = ">=3.10"

View File

@ -10,9 +10,9 @@
# AGENTEVAL_PROD_BACKUP_DIR=/var/backups/agenteval
#
# Usage:
# scripts/deploy-volcengine-102.sh --tag 0.8.0-6248568
# scripts/deploy-volcengine-102.sh --dry-run --tag 0.8.0-6248568
# scripts/deploy-volcengine-102.sh --rollback 0.8.0-6248568
# scripts/deploy-volcengine-102.sh --tag 1.0.0-abcdef0
# scripts/deploy-volcengine-102.sh --dry-run --tag 1.0.0-abcdef0
# scripts/deploy-volcengine-102.sh --rollback 1.0.0-abcdef0
set -euo pipefail