AgentEvalTool/CHANGELOG.md
sinohqb bd6efc3709 chore: bump version to 1.3.0
架构深化(两轮审查候选落地)+ 性能优化(WAL/索引/N+1 消除/并发执行)
发布。CHANGELOG 登记 1.3.0 变更。
2026-08-24 23:36:08 +08:00

3.6 KiB
Raw Blame History

Changelog

本文档记录 AgentEvalTool 的所有重要变更。

格式基于 Keep a Changelog 版本号遵循 语义化版本 规范。

[1.3.0] - 2026-08-24

架构深化(两轮审查候选全部落地)

  • 智能评估可见性接缝收敛:「已删即 404」语义收进 repository 单一权威 require_live_eval),任务监控隐藏已删评估任务(唯一刻意行为变化)
  • 耐久智能作业结算统一:分析/周期对比 executor 收敛为 execute(job_kind, work_fn) 深接缝,幂等入队、认领、失败截断、结算顺序单一实现
  • 存储层拆分storage/repository.py / storage/db.py 按域拆为包; intelligent_eval/lifecycle.py 按状态机阶段拆为包
  • 前端Campaigns.tsx 拆分为 campaigns/ 子组件ReadSlot 泛化为通用资源接缝; api.ts 拆为 10 个域模块重复工具函数收敛fmtPct/personaLabel 等)
  • 编排下沉runs router 回归 HTTP 翻译,编排逻辑移入 services

性能优化

  • 数据库SQLite 启用 WAL新增 6 个性能索引(幂等迁移); 消除 4 处 N+1 查询task_queue 扫描、scenario bindings、orphan campaigns、计数聚合
  • 并发执行EvalEngine case 并行(默认 3、规则评估并行默认 5、 Campaign occurrence 派生并行(默认 2新增对应 AGENTEVAL_ 环境变量配置

测试

  • 后端 963 用例、前端 232 用例全绿;新覆盖调度器错误路径、状态机迁移、 五个零覆盖前端组件等

1.2.0 - 2026-08-20

新增

  • 智能评估终态收敛纪律ADR-0011
    • 新增 watchdog 机制监控评估生命周期,确保异常状态自动收敛
    • 实现时间窗口槽位尊重逻辑,避免在窗口未结束时催促 analyst

优化

  • 智能评估抽屉 UI 全面升级
    • 概览 Tab

      • 重构为单列布局,信息层次更清晰
      • 会话进度列添加 tooltip 显示详细信息
      • 种子集区域扩大显示空间,支持完整展示
      • 添加底部收尾标识,明确内容结束位置
    • 执行过程 Tab

      • 生命周期时间线添加时间戳显示
      • 当前阶段标识优化为节点上的徽章
      • 时段分布从卡片式改为表格视图,更直观
      • 移除活动流 50 条限制,显示全部内容
    • 评估报告 Tab

      • 维度得分从柱状图改为进度条卡片布局
      • 添加等级标签(优秀/良好/待改进)和图标
      • 修正 5 分制显示逻辑,正确展示实际分数
    • 配置历史 Tab

      • 详情页布局与概览 Tab 保持一致
      • 统一字体规范和视觉风格
    • 抽屉整体

      • 宽度从 1000px 增加到 1200px
      • 统一所有 Tab 的字体规范13px 正文 / 12px 标签)
      • 统一底部留白24px

技术细节

  • 移除 @ant-design/charts 依赖中的 Column 和 Bar 组件使用
  • 自定义 LifecycleTimeline 和 TimeDistributionTable 组件
  • 自定义 DimensionScoresCards 组件替代图表库
  • 统一使用 colors token 和 statusColors token

修复

  • 修正维度得分显示为 5 分制实际值(如 4.8)而非百分比(如 480
  • 修正进度条计算逻辑,基于 5 分制正确显示百分比
  • 修正 analyst 催促逻辑,尊重时间窗口槽位分布

1.1.1 - 2026-08-20

之前的版本变更请参考 git 历史记录。