All checks were successful
CI / test (push) Successful in 3m58s
更新本次智能评估全链路修复与 UI/UX 优化的必要文档: - ADR-0010 新增:方案③触发采用独立 OpenClaw session(main 持久 session 上下文 缓存污染导致 worker 幻觉不执行)+ 时段分布约束 - CONTEXT.md:触发式执行词条补充时段约束与独立会话语义 - release-notes-v1.1.1.md 新增:智能评估全链路稳定化、任务队列监控、UI/UX 一致性 - docs/README.md:补 v1.1.0/v1.1.1 发布说明索引,版本升 v1.2 - CLAUDE.md:补智能评估执行机制(方案③)章节(scan loop 职责 + 独立 session/ 时段分布/状态一致性关键约束)
63 lines
3.8 KiB
Markdown
63 lines
3.8 KiB
Markdown
# AgentEvalTool v1.1.1 发布说明
|
||
|
||
**版本**:v1.1.1
|
||
**发布日期**:2026-08-18
|
||
**状态**:已发布
|
||
**作者**:AgentEval Team
|
||
|
||
---
|
||
|
||
## 一、版本概述
|
||
|
||
v1.1.1 是 v1.1.0 的**收尾与稳定化版本**:将方案③(触发式执行,取代 Cron 池)在 t480 上完整跑通并修复全链路暴露的流程缺口,同时完成 UI/UX 全面盘点与一致性修复。核心成果:**智能评估从规划到报告的 1 小时窗口全自动闭环在 t480 上稳定可用**。
|
||
|
||
## 二、智能评估全链路稳定化
|
||
|
||
v1.1.0 引入 Cron 池后,实际部署暴露了执行机制的多个缺口,v1.1.1 逐一修复(t480 实测驱动):
|
||
|
||
### 2.1 规划阶段自动化(planner 触发)
|
||
- **缺口**:方案③只自动化 executing(worker)与 completed(analyst),planning 阶段无机制唤醒 planner → 评估永远停 planning
|
||
- **修复**:scan loop 每 60s 检测 planning 评估,触发 `agenteval-intelligent-planner` skill 产出粗计划并提交审批
|
||
|
||
### 2.2 分钟级时段解析
|
||
- **缺口**:planner 对短窗口(1h)产出分钟级时段(`0-20min`),`parse_time_slot` 只支持小时级(`8-10h`)→ 审批后永不入队
|
||
- **修复**:时段解析支持 `h`/`min` 后缀统一换算小时
|
||
|
||
### 2.3 时间窗口时段分布
|
||
- **缺口**:触发指令"立即完成"让 worker 一次性创建所有会话 → 1h 窗口几分钟跑完,时段分布失效
|
||
- **修复**:触发指令 + worker skill 明确"仅执行当前到期时段内欠账的会话",平台每 60s 持续触发推进后续时段 → 1h 窗口严格按时段(0-20/20-40/40-60min)分批
|
||
|
||
### 2.4 独立 OpenClaw session(ADR-0010)
|
||
- **缺口**:`--agent main` 复用 main 持久 session,多次触发累积上下文缓存后 worker 幻觉输出(报 pending_approval)不执行 API → 评估卡"等待创建会话"
|
||
- **修复**:worker/planner 触发加 `--session-id`(每次唯一),独立 session 执行
|
||
|
||
### 2.5 状态一致性
|
||
- **会话关闭校验**:`submit_report` 在会话未全部 close 时拒绝(409),杜绝"评估 completed 但进度 0%"
|
||
- **任务回收**:评估离开 executing 后,其 pending/assigned 任务回收为 completed,杜绝队列残留
|
||
|
||
## 三、任务队列监控与评估列表
|
||
|
||
- **任务队列独立页**(`/intelligent-evals/tasks`):状态统计条(点击筛选)+ 单行表格,5s 轮询,展示方案③的定时触发
|
||
- **评估列表增强**:状态统计条(含 cancelled)、服务端分页(默认 10 条/页)、会话进度进度条、单行表格、"查看"按钮 + 整行点击
|
||
- **详情抽屉回归**:详情/报告合一单层抽屉(Tabs:概览/决策过程/配置历史/报告),审批动作在抽屉头部
|
||
|
||
## 四、UI/UX 盘点与一致性
|
||
|
||
全面盘点(`.scratch/ui-ux-audit.md`)并修复:
|
||
|
||
- **P0 功能缺陷**:决策过程/配置历史一次性加载 → useEffect + 刷新按钮;useRunSession 轮询统一 usePolling(后台暂停);useFiles 接 tabPath(跳回自动刷新)
|
||
- **P1 一致性**:收敛 3 处重复状态映射(统一走 `intelligent_eval/status.ts`);硬编码颜色走 token(passRateColor/statusColors/colors)
|
||
- **P2 + 清理**:抽 SectionHeader 组件消重复;删除废弃的 CronPoolMonitor 页面
|
||
- **综合评分**:EvalReport 兼容扁平/嵌套两种 scores 结构(analyst 输出不可控)
|
||
|
||
## 五、质量
|
||
|
||
- **测试**:901 passed(含触发/时段/会话校验/任务回收等回归)
|
||
- **前端**:tsc 0 错误、vitest 16 passed
|
||
- **文档**:ADR-0009(触发式执行)、ADR-0010(独立 session)新增;CONTEXT.md 领域词汇更新
|
||
|
||
## 六、已知事项
|
||
|
||
- 智能评估**暂无 delete API**:completed 的历史测试评估无法通过平台删除(需后续开发 delete + 级联清理)
|
||
- t480 上的 completed 验证评估(融侨城 1h* 系列)保留,不影响运行
|