All checks were successful
CI / test (push) Successful in 3m58s
更新本次智能评估全链路修复与 UI/UX 优化的必要文档: - ADR-0010 新增:方案③触发采用独立 OpenClaw session(main 持久 session 上下文 缓存污染导致 worker 幻觉不执行)+ 时段分布约束 - CONTEXT.md:触发式执行词条补充时段约束与独立会话语义 - release-notes-v1.1.1.md 新增:智能评估全链路稳定化、任务队列监控、UI/UX 一致性 - docs/README.md:补 v1.1.0/v1.1.1 发布说明索引,版本升 v1.2 - CLAUDE.md:补智能评估执行机制(方案③)章节(scan loop 职责 + 独立 session/ 时段分布/状态一致性关键约束)
3.8 KiB
3.8 KiB
AgentEvalTool v1.1.1 发布说明
版本:v1.1.1 发布日期:2026-08-18 状态:已发布 作者:AgentEval Team
一、版本概述
v1.1.1 是 v1.1.0 的收尾与稳定化版本:将方案③(触发式执行,取代 Cron 池)在 t480 上完整跑通并修复全链路暴露的流程缺口,同时完成 UI/UX 全面盘点与一致性修复。核心成果:智能评估从规划到报告的 1 小时窗口全自动闭环在 t480 上稳定可用。
二、智能评估全链路稳定化
v1.1.0 引入 Cron 池后,实际部署暴露了执行机制的多个缺口,v1.1.1 逐一修复(t480 实测驱动):
2.1 规划阶段自动化(planner 触发)
- 缺口:方案③只自动化 executing(worker)与 completed(analyst),planning 阶段无机制唤醒 planner → 评估永远停 planning
- 修复:scan loop 每 60s 检测 planning 评估,触发
agenteval-intelligent-plannerskill 产出粗计划并提交审批
2.2 分钟级时段解析
- 缺口:planner 对短窗口(1h)产出分钟级时段(
0-20min),parse_time_slot只支持小时级(8-10h)→ 审批后永不入队 - 修复:时段解析支持
h/min后缀统一换算小时
2.3 时间窗口时段分布
- 缺口:触发指令"立即完成"让 worker 一次性创建所有会话 → 1h 窗口几分钟跑完,时段分布失效
- 修复:触发指令 + worker skill 明确"仅执行当前到期时段内欠账的会话",平台每 60s 持续触发推进后续时段 → 1h 窗口严格按时段(0-20/20-40/40-60min)分批
2.4 独立 OpenClaw session(ADR-0010)
- 缺口:
--agent main复用 main 持久 session,多次触发累积上下文缓存后 worker 幻觉输出(报 pending_approval)不执行 API → 评估卡"等待创建会话" - 修复:worker/planner 触发加
--session-id(每次唯一),独立 session 执行
2.5 状态一致性
- 会话关闭校验:
submit_report在会话未全部 close 时拒绝(409),杜绝"评估 completed 但进度 0%" - 任务回收:评估离开 executing 后,其 pending/assigned 任务回收为 completed,杜绝队列残留
三、任务队列监控与评估列表
- 任务队列独立页(
/intelligent-evals/tasks):状态统计条(点击筛选)+ 单行表格,5s 轮询,展示方案③的定时触发 - 评估列表增强:状态统计条(含 cancelled)、服务端分页(默认 10 条/页)、会话进度进度条、单行表格、"查看"按钮 + 整行点击
- 详情抽屉回归:详情/报告合一单层抽屉(Tabs:概览/决策过程/配置历史/报告),审批动作在抽屉头部
四、UI/UX 盘点与一致性
全面盘点(.scratch/ui-ux-audit.md)并修复:
- P0 功能缺陷:决策过程/配置历史一次性加载 → useEffect + 刷新按钮;useRunSession 轮询统一 usePolling(后台暂停);useFiles 接 tabPath(跳回自动刷新)
- P1 一致性:收敛 3 处重复状态映射(统一走
intelligent_eval/status.ts);硬编码颜色走 token(passRateColor/statusColors/colors) - P2 + 清理:抽 SectionHeader 组件消重复;删除废弃的 CronPoolMonitor 页面
- 综合评分:EvalReport 兼容扁平/嵌套两种 scores 结构(analyst 输出不可控)
五、质量
- 测试:901 passed(含触发/时段/会话校验/任务回收等回归)
- 前端:tsc 0 错误、vitest 16 passed
- 文档:ADR-0009(触发式执行)、ADR-0010(独立 session)新增;CONTEXT.md 领域词汇更新
六、已知事项
- 智能评估暂无 delete API:completed 的历史测试评估无法通过平台删除(需后续开发 delete + 级联清理)
- t480 上的 completed 验证评估(融侨城 1h* 系列)保留,不影响运行