AgentEvalTool/docs/release-notes-v0.8.md
sinohqb 2d7679a6bb
Some checks failed
CI / test (push) Failing after 49s
docs(release): freeze v0.8「比」period comparison milestone as 0.8.0
周期对比发布说明:计划指纹自动基线、机械 diff + LLM 演进叙述、
抽屉对比区块、正式线自动链,及发布后评审修复、导出纳入与 ruff 清理。
2026-08-03 15:24:07 +08:00

6.0 KiB
Raw Permalink Blame History

AgentEvalTool v0.8 版本发布说明

版本: v0.8.0 日期: 2026-08-03 状态: 已发布(t480 开发线) 代号: 「比」(Period comparison milestone) 作者: AgentEval Team


一、版本定位

v0.8 的主题是让周期评估"可比"。v0.6/v0.7 回答了"这一期表现如何、问题在哪",但读报告的人还要自己记住上期数字才能判断好坏。本版本在活动之上加周期对比:自动找到同活动串的上期活动作为基线,产出机械指标 diff 与 LLM 演进叙述,直接回答"这一期比上一期好了还是坏了"。

v0.1 (2026-07-09)  MVP 闭环
v0.2 (2026-07-14)  「稳」async 引擎 + 安全基线 + 部署规范化
v0.3 (2026-07-17)  「拓」多通道 + 规则扩展 + 模型配置中心
v0.4 (2026-07-28)  「联」AI 助手标准化 + 登录 + 仪表盘重构
v0.5 (2026-07-29)  「准」判定语义 + 场景版本化
v0.6 (2026-08-02)  「巡」评估活动 + 周期报告
v0.7 (2026-08-03)  「析」活动智能分析
v0.8 (2026-08-03)  ← 你在这里:「比」周期对比

二、关键设计决策

  • 可比性单位:同评测对象 + 同计划指纹(场景集合、偏移、次数、窗口完全一致)的活动串;指纹不一致即无自动基线
  • 自动基线:取活动串中按完成时间最近一个已有 completed 分析的上一期活动仅正式线time_scale == 1参与自动配对加速调试线不自动配对
  • 手动基线:可跨指纹手选任意有 completed 分析的历史活动(基线缺分析则 400 引导)
  • 双主轴产出LLM 演进叙述(趋势判定 improving/stable/regressing + 问题演变 new/persisting/resolved + 建议落实跟踪 addressed/partial/unaddressed/new+ 机械指标 diff通过率/可用性/平均时延)
  • diff 口径:机械 diff 按「生效基线」(已有对比行则为其存储基线,否则为自动基线)现算、不存储,避免基线变更后数据失真
  • 存储campaign_period_comparisons 每活动一行 upsertbaseline_campaign_id + generating/completed/failed + result JSON + 模型快照 + 触发来源)
  • 模型:复用智能分析的模型解析链(活动覆盖 ?? 全局分析默认),无独立岗位
  • 自动链:正式线活动分析完成后自动 enqueue 周期对比triggered_by=auto失败不阻塞

三、主要功能4 张 tracer-bullet 票)

3.1 计划指纹自动基线 + 机械指标 diffticket 01

  • 计划指纹由场景集合、偏移、次数、窗口归一化生成;resolve_auto_baseline 按完成时间倒序找同指纹且已有 completed 分析的前任活动
  • compute_metric_diff 产出整窗 + 分场景的三指标 diffbaseline/current/delta比率以百分点、时延以毫秒表达

3.2 对比叙述 Agent + 存储 + APIticket 02

  • 输入:本期与基线的智能分析结果 + 双侧活动报告聚合;输出结构化趋势、问题演变、建议落实跟踪
  • GET /api/campaigns/{id}/comparison(含叙述行状态 + 自动基线 + 生效基线的机械 diffPOST 触发/重跑(支持手动指定基线)
  • 前置校验:活动须终态、本期须有 completed 分析、分析模型可解析;重跑 upsert 不新增行

3.3 报告抽屉「周期对比」区块ticket 03

  • 独立组件 PeriodComparisonSection:状态行(生成中轮询/失败重试/未生成引导)
  • 已生成:趋势徽标(改善/平稳/退化)+ 指标变化表(行 = 整窗 + 各场景,列 = 三指标,单元格 基线 → 本期±delta+ 问题演变与建议落实标签
  • 支持手动切换基线活动(下拉仅列已完成活动)与重新生成

3.4 正式线自动链ticket 04

  • 分析完成回调处自动 enqueue 周期对比;加速线/无基线/无模型静默跳过,不阻塞

3.5 发布后改进(非票据)

  • 双轴评审修复dd3b9a5共享 gateway_chat_client 工厂、指标元表抽取、对比区块组件化
  • Markdown 导出纳入周期对比14b09e1completed 对比行渲染 ## 周期对比 附录(基线元信息 + 趋势 + 指标变化表 + 问题演变 + 建议落实),紧跟智能分析之后,缺则无痕;活动导出排版重优化(状态中文化、窗口/时段人类可读、友好时间戳、头部补评测对象名、「正式线」/「加速调试线 ×N」措辞Run 级导出不动
  • ruff 全量清理5ecb30849 项修复backend/ 与 tests/ 全绿

四、测试与质量

指标 v0.7 v0.8
测试数量 443 492
新增 对比单元×约 30、对比 API×约 15、自动触发×约 8、迁移×1、导出区块×6

流程沿用 /grill-with-docs → /to-spec → /to-tickets → /implement(×4, TDD + 内联双轴评审)spec 与票据在 .scratch/v0.8/;发布后另做了一次全量双轴代码评审并修复。

五、部署与配置变更

  • 一个新迁移:f2a9b7c34d18campaign_period_comparisons 表),容器启动自动应用
  • 无新增环境变量
  • 使用前提:本期与基线活动均须有 completed 智能分析(分析岗位模型配置同 v0.7 要求)
  • t480 验证:健康检查 version=0.8.0 一致;最后一次为 --skip-build 热加载部署,健康端点 commit 标签(镜像 build-arg滞后于实际代码属预期
  • CONTEXT.md 新增术语周期对比Period Comparison、正式线 / 加速调试线Production-line / Accelerated-line

六、已知问题

  1. volcengine-102 生产线停留在 v0.4 之前
  2. 前端仍无自动化测试(仅 tsc
  3. 对比叙述质量依赖分析模型能力;基线活动数据缺失时 diff 单元格显示
  4. --skip-build 部署下健康端点 commit 标签滞后(仅元数据,代码经 volume 热加载为最新)
  5. 本地 main 领先 origin 若干提交,尚未推送

七、下一版候选方向

  • 跨活动对比(多对象并行活动的横切对照)
  • ADR-0003 v2OpenClaw 自适应重规划进入调度热回路
  • volcengine-102 同步
  • 前端测试基线vitest