定义评估维度清单 #14

Closed
opened 2026-08-24 17:47:24 +00:00 by solahqb · 1 comment
Owner

Question

智能体服务评估应该测量哪些维度?

背景

  • 评估对象:tutu-api 通道 AI 数字员工
  • 评估目的:质量监控 + 上线验收 + 能力对比
  • 当前痛点:评估维度不够清晰

需要澄清

  • 功能完整性(能否完成指定任务?)
  • 响应质量(回答准确性、相关性、完整性?)
  • 响应效率(延迟、吞吐量?)
  • 安全性(是否泄露敏感信息?是否遵循安全策略?)
  • 成本效率(token 消耗、API 调用成本?)
  • 用户体验(对话流畅度、用户满意度?)
  • 其他维度?

输出:一份优先级排序的评估维度清单,每个维度附带简要定义。

## Question 智能体服务评估应该测量哪些维度? **背景**: - 评估对象:tutu-api 通道 AI 数字员工 - 评估目的:质量监控 + 上线验收 + 能力对比 - 当前痛点:评估维度不够清晰 **需要澄清**: - 功能完整性(能否完成指定任务?) - 响应质量(回答准确性、相关性、完整性?) - 响应效率(延迟、吞吐量?) - 安全性(是否泄露敏感信息?是否遵循安全策略?) - 成本效率(token 消耗、API 调用成本?) - 用户体验(对话流畅度、用户满意度?) - 其他维度? **输出**:一份优先级排序的评估维度清单,每个维度附带简要定义。
solahqb added the
wayfinder:grilling
label 2026-08-24 17:47:24 +00:00
Author
Owner

Resolution

6 个评估维度及量化方式

维度 量化方式
功能完整性 分层:意图识别准确率 → 任务完成度 → 任务成功率
响应质量 LLM-as-judge(准确性、相关性、完整性各 0-10)
响应效率 首字延迟 + 完整响应延迟 + 每轮延迟 + 吞吐量
安全性 敏感信息泄露 + 幻觉检测 + 越权操作 + 合规性
成本效率 单次对话成本 + 单任务成本
用户体验 对话轮数 + 用户放弃率 + LLM 评估流畅度

决策依据:全方位评估需要覆盖所有 6 个维度;每个维度的量化方式选择了可自动化、客观的指标(优先 AI 评分,减少人工依赖)。

## Resolution **6 个评估维度及量化方式**: | 维度 | 量化方式 | |------|----------| | **功能完整性** | 分层:意图识别准确率 → 任务完成度 → 任务成功率 | | **响应质量** | LLM-as-judge(准确性、相关性、完整性各 0-10) | | **响应效率** | 首字延迟 + 完整响应延迟 + 每轮延迟 + 吞吐量 | | **安全性** | 敏感信息泄露 + 幻觉检测 + 越权操作 + 合规性 | | **成本效率** | 单次对话成本 + 单任务成本 | | **用户体验** | 对话轮数 + 用户放弃率 + LLM 评估流畅度 | **决策依据**:全方位评估需要覆盖所有 6 个维度;每个维度的量化方式选择了可自动化、客观的指标(优先 AI 评分,减少人工依赖)。
Sign in to join this conversation.
No Milestone
No project
No Assignees
1 Participants
Notifications
Due Date
The due date is invalid or out of range. Please use the format 'yyyy-mm-dd'.

No due date set.

Dependencies

No dependencies set.

Reference: solahqb/AgentEvalTool#14
No description provided.