AgentEvalTool/docs/release-notes-v1.1.1.md
sinohqb 0096c22e27
All checks were successful
CI / test (push) Successful in 3m58s
docs: v1.1.1 release notes + ADR-0010 + context/CLAUDE updates
更新本次智能评估全链路修复与 UI/UX 优化的必要文档:
- ADR-0010 新增:方案③触发采用独立 OpenClaw session(main 持久 session 上下文
  缓存污染导致 worker 幻觉不执行)+ 时段分布约束
- CONTEXT.md:触发式执行词条补充时段约束与独立会话语义
- release-notes-v1.1.1.md 新增:智能评估全链路稳定化、任务队列监控、UI/UX 一致性
- docs/README.md:补 v1.1.0/v1.1.1 发布说明索引,版本升 v1.2
- CLAUDE.md:补智能评估执行机制(方案③)章节(scan loop 职责 + 独立 session/
  时段分布/状态一致性关键约束)
2026-08-18 19:01:14 +08:00

63 lines
3.8 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# AgentEvalTool v1.1.1 发布说明
**版本**v1.1.1
**发布日期**2026-08-18
**状态**:已发布
**作者**AgentEval Team
---
## 一、版本概述
v1.1.1 是 v1.1.0 的**收尾与稳定化版本**:将方案③(触发式执行,取代 Cron 池)在 t480 上完整跑通并修复全链路暴露的流程缺口,同时完成 UI/UX 全面盘点与一致性修复。核心成果:**智能评估从规划到报告的 1 小时窗口全自动闭环在 t480 上稳定可用**。
## 二、智能评估全链路稳定化
v1.1.0 引入 Cron 池后实际部署暴露了执行机制的多个缺口v1.1.1 逐一修复t480 实测驱动):
### 2.1 规划阶段自动化planner 触发)
- **缺口**:方案③只自动化 executingworker与 completedanalystplanning 阶段无机制唤醒 planner → 评估永远停 planning
- **修复**scan loop 每 60s 检测 planning 评估,触发 `agenteval-intelligent-planner` skill 产出粗计划并提交审批
### 2.2 分钟级时段解析
- **缺口**planner 对短窗口1h产出分钟级时段`0-20min``parse_time_slot` 只支持小时级(`8-10h`)→ 审批后永不入队
- **修复**:时段解析支持 `h`/`min` 后缀统一换算小时
### 2.3 时间窗口时段分布
- **缺口**:触发指令"立即完成"让 worker 一次性创建所有会话 → 1h 窗口几分钟跑完,时段分布失效
- **修复**:触发指令 + worker skill 明确"仅执行当前到期时段内欠账的会话",平台每 60s 持续触发推进后续时段 → 1h 窗口严格按时段0-20/20-40/40-60min分批
### 2.4 独立 OpenClaw sessionADR-0010
- **缺口**`--agent main` 复用 main 持久 session多次触发累积上下文缓存后 worker 幻觉输出(报 pending_approval不执行 API → 评估卡"等待创建会话"
- **修复**worker/planner 触发加 `--session-id`(每次唯一),独立 session 执行
### 2.5 状态一致性
- **会话关闭校验**`submit_report` 在会话未全部 close 时拒绝409杜绝"评估 completed 但进度 0%"
- **任务回收**:评估离开 executing 后,其 pending/assigned 任务回收为 completed杜绝队列残留
## 三、任务队列监控与评估列表
- **任务队列独立页**`/intelligent-evals/tasks`):状态统计条(点击筛选)+ 单行表格5s 轮询,展示方案③的定时触发
- **评估列表增强**:状态统计条(含 cancelled、服务端分页默认 10 条/页)、会话进度进度条、单行表格、"查看"按钮 + 整行点击
- **详情抽屉回归**:详情/报告合一单层抽屉Tabs概览/决策过程/配置历史/报告),审批动作在抽屉头部
## 四、UI/UX 盘点与一致性
全面盘点(`.scratch/ui-ux-audit.md`)并修复:
- **P0 功能缺陷**:决策过程/配置历史一次性加载 → useEffect + 刷新按钮useRunSession 轮询统一 usePolling后台暂停useFiles 接 tabPath跳回自动刷新
- **P1 一致性**:收敛 3 处重复状态映射(统一走 `intelligent_eval/status.ts`);硬编码颜色走 tokenpassRateColor/statusColors/colors
- **P2 + 清理**:抽 SectionHeader 组件消重复;删除废弃的 CronPoolMonitor 页面
- **综合评分**EvalReport 兼容扁平/嵌套两种 scores 结构analyst 输出不可控)
## 五、质量
- **测试**901 passed含触发/时段/会话校验/任务回收等回归)
- **前端**tsc 0 错误、vitest 16 passed
- **文档**ADR-0009触发式执行、ADR-0010独立 session新增CONTEXT.md 领域词汇更新
## 六、已知事项
- 智能评估**暂无 delete API**completed 的历史测试评估无法通过平台删除(需后续开发 delete + 级联清理)
- t480 上的 completed 验证评估(融侨城 1h* 系列)保留,不影响运行