Wayfinder: AgentEvalTool 价值评估与决策 #13

Open
opened 2026-08-24 17:46:48 +00:00 by solahqb · 0 comments
Owner

Destination

是否继续投入 AgentEvalTool 用于全方位智能体评估(质量监控、上线验收、能力对比),还是转向或停办——基于平台能否满足"清晰的评估维度、标准及报告"需求。

Notes

  • 领域:智能体服务质量评估
  • 评估对象:tutu-api 通道 AI 数字员工
  • 评估目的:质量监控(持续跟踪)+ 上线前验收(一次性评估)+ 能力对比(选型决策)
  • 评估规模:验证阶段,规模不大
  • 关键痛点:评估的维度、标准及报告不够清晰
  • 技能:每个 ticket 按需使用 /grilling/domain-modeling/research

Decisions so far

  • 当前平台能力盘点 — 平台能力覆盖全面:6 种评估规则、3 种报告格式、4 种评估模式、完整集成能力。短板在前端测试和文档,不影响评估能力本身。
  • 定义评估维度清单 — 6 个维度:功能完整性(分层:意图→完成度→成功率)、响应质量(LLM-as-judge 0-10)、响应效率(延迟+吞吐量)、安全性(PII+幻觉+越权+合规)、成本效率(对话+任务级)、用户体验(轮数+放弃率+流畅度)。
  • 定义报告消费者与决策场景 — 消费者:产品/运营团队(非技术背景);三种报告:质量监控仪表盘(实时/每日,驱动质量修复)、上线验收报告(每次上线前,驱动 go/no-go)、能力对比报告(按需,驱动选型采购)。
  • 平台能力与需求差距分析 — 9 项差距按优先级排序:P0(功能完整性调研+响应质量扩展+验收报告调研)、P1(响应效率扩展+安全性扩展+监控仪表盘调研+对比报告调研)、P2(成本效率全新实现+用户体验实现)。
  • 功能完整性评估方案调研 — 推荐方案 A:组合现有规则(llm_score 意图识别 + keyword_match 任务完成度),无需代码改动,2 人天完成。
  • 扩展 llm_score 支持多维度评分 — 已实现(PR #27):支持 dimensions 参数配置多个评分维度,向后兼容单维度模式,637 tests passed。
  • 上线验收报告 go/no-go 结论调研 — 推荐方案:新增纯函数 go_no_go.py,三级阈值配置(全局→场景→运行),三级结论(go/no_go/conditional),工作量 8 人天(MVP 5 人天)。
  • 扩展 response_time 支持首字延迟和吞吐量 — 已实现(PR #29):新增 avg_latency_max_ms 和 throughput_min 参数,保持 max_ms 向后兼容,656 tests passed。
  • 扩展 safety 规则覆盖幻觉、越权和合规 — 已实现(PR #30):新增 check_hallucination、unauthorized_actions、required_disclaimers 参数,656 tests passed。
  • 质量监控仪表盘历史趋势调研 — 现有仪表盘已有基础趋势支持,aggregate_runs() 已计算四个指标但只返回两个。推荐 Phase 1:扩展 /stats/trend 停止丢弃指标,添加时间范围选择器,~3 人天。
  • 能力对比报告雷达图和排名调研 — 现有对比报告不支持雷达图,仅支持两两对比。推荐新增 POST /api/reports/compare/multi 端点支持 N 目标横向对比,6 维雷达图,使用 @ant-design/charts Radar 组件,4.25 人天。

Not yet specified

  • 评估标准的量化方式(阈值、评分、对比基线…?)
  • 补齐差距的投资估算
  • 替代方案调研(自建 vs 采购 vs 借用)
  • 机会成本分析(继续投入 vs 转向其他工具)

Out of scope

(暂无)

## Destination 是否继续投入 AgentEvalTool 用于全方位智能体评估(质量监控、上线验收、能力对比),还是转向或停办——基于平台能否满足"清晰的评估维度、标准及报告"需求。 ## Notes - **领域**:智能体服务质量评估 - **评估对象**:tutu-api 通道 AI 数字员工 - **评估目的**:质量监控(持续跟踪)+ 上线前验收(一次性评估)+ 能力对比(选型决策) - **评估规模**:验证阶段,规模不大 - **关键痛点**:评估的维度、标准及报告不够清晰 - **技能**:每个 ticket 按需使用 `/grilling`、`/domain-modeling`、`/research` ## Decisions so far - [当前平台能力盘点](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/16) — 平台能力覆盖全面:6 种评估规则、3 种报告格式、4 种评估模式、完整集成能力。短板在前端测试和文档,不影响评估能力本身。 - [定义评估维度清单](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/14) — 6 个维度:功能完整性(分层:意图→完成度→成功率)、响应质量(LLM-as-judge 0-10)、响应效率(延迟+吞吐量)、安全性(PII+幻觉+越权+合规)、成本效率(对话+任务级)、用户体验(轮数+放弃率+流畅度)。 - [定义报告消费者与决策场景](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/15) — 消费者:产品/运营团队(非技术背景);三种报告:质量监控仪表盘(实时/每日,驱动质量修复)、上线验收报告(每次上线前,驱动 go/no-go)、能力对比报告(按需,驱动选型采购)。 - [平台能力与需求差距分析](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/17) — 9 项差距按优先级排序:P0(功能完整性调研+响应质量扩展+验收报告调研)、P1(响应效率扩展+安全性扩展+监控仪表盘调研+对比报告调研)、P2(成本效率全新实现+用户体验实现)。 - [功能完整性评估方案调研](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/18) — 推荐方案 A:组合现有规则(llm_score 意图识别 + keyword_match 任务完成度),无需代码改动,2 人天完成。 - [扩展 llm_score 支持多维度评分](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/19) — 已实现(PR #27):支持 dimensions 参数配置多个评分维度,向后兼容单维度模式,637 tests passed。 - [上线验收报告 go/no-go 结论调研](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/20) — 推荐方案:新增纯函数 go_no_go.py,三级阈值配置(全局→场景→运行),三级结论(go/no_go/conditional),工作量 8 人天(MVP 5 人天)。 - [扩展 response_time 支持首字延迟和吞吐量](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/21) — 已实现(PR #29):新增 avg_latency_max_ms 和 throughput_min 参数,保持 max_ms 向后兼容,656 tests passed。 - [扩展 safety 规则覆盖幻觉、越权和合规](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/22) — 已实现(PR #30):新增 check_hallucination、unauthorized_actions、required_disclaimers 参数,656 tests passed。 - [质量监控仪表盘历史趋势调研](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/23) — 现有仪表盘已有基础趋势支持,aggregate_runs() 已计算四个指标但只返回两个。推荐 Phase 1:扩展 /stats/trend 停止丢弃指标,添加时间范围选择器,~3 人天。 - [能力对比报告雷达图和排名调研](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/24) — 现有对比报告不支持雷达图,仅支持两两对比。推荐新增 POST /api/reports/compare/multi 端点支持 N 目标横向对比,6 维雷达图,使用 @ant-design/charts Radar 组件,4.25 人天。 ## Not yet specified - 评估标准的量化方式(阈值、评分、对比基线…?) - 补齐差距的投资估算 - 替代方案调研(自建 vs 采购 vs 借用) - 机会成本分析(继续投入 vs 转向其他工具) ## Out of scope (暂无)
solahqb added the
wayfinder:map
label 2026-08-24 17:46:48 +00:00
Sign in to join this conversation.
No Milestone
No project
No Assignees
1 Participants
Notifications
Due Date
The due date is invalid or out of range. Please use the format 'yyyy-mm-dd'.

No due date set.

Dependencies

No dependencies set.

Reference: solahqb/AgentEvalTool#13
No description provided.