功能完整性评估方案调研 #18

Closed
opened 2026-08-25 05:55:31 +00:00 by solahqb · 1 comment
Owner

背景

Wayfinder #13 差距分析(#17)识别的 P0 差距。

需求

实现"意图识别准确率 → 任务完成度 → 任务成功率"的分层测量。

调研问题

  • 现有规则(keyword_match、llm_score、semantic_similarity)能否组合实现?
  • 是否需要新增规则类型(如"意图分类"规则)?
  • 如何定义"任务完成度"的量化方式(如收集了 3/5 个必要信息)?
  • 如何定义"任务成功率"(二值判断还是概率)?

输出

技术方案文档,包含实现路径和工作量估算。

## 背景 [Wayfinder #13](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/13) 差距分析([#17](https://git.solahqb22.cn/solahqb/AgentEvalTool/issues/17))识别的 P0 差距。 ## 需求 实现"意图识别准确率 → 任务完成度 → 任务成功率"的分层测量。 ## 调研问题 - 现有规则(keyword_match、llm_score、semantic_similarity)能否组合实现? - 是否需要新增规则类型(如"意图分类"规则)? - 如何定义"任务完成度"的量化方式(如收集了 3/5 个必要信息)? - 如何定义"任务成功率"(二值判断还是概率)? ## 输出 技术方案文档,包含实现路径和工作量估算。
solahqb added the
priority:P0
label 2026-08-25 05:55:31 +00:00
Author
Owner

Resolution

调研完成,详见 research/functional-completeness-assessment.md(分支 research/functional-completeness,commit 51d9769)。

关键发现

现有规则能力分析

  • keyword_match:可衡量任务完成度(matched/total keywords)
  • llm_score:可衡量意图识别准确率(criteria 定义为意图理解标准)
  • semantic_similarity:可衡量响应质量(与参考答案的语义接近度)

推荐方案 A:组合现有规则(无需代码改动)

  • Layer 1 意图识别:llm_score + criteria="是否正确理解用户意图"
  • Layer 2 任务完成度:keyword_match + 每个必需信息项作为关键词
  • Layer 3 任务成功率:二值判断(intent >= 7 AND completion >= 1.0)

工作量估算:2 人天(配置模板 + 文档 + 报告聚合)

备选方案

  • 方案 B:新增 intent_classification 规则(3.5 人天)
  • 方案 C:扩展 llm_score 多维度(3.5 人天)

结论:推荐方案 A,利用现有规则组合,无需代码改动。

## Resolution 调研完成,详见 [research/functional-completeness-assessment.md](https://git.solahqb22.cn/solahqb/AgentEvalTool/blob/research/functional-completeness/research/functional-completeness-assessment.md)(分支 `research/functional-completeness`,commit 51d9769)。 **关键发现**: **现有规则能力分析**: - `keyword_match`:可衡量任务完成度(matched/total keywords) - `llm_score`:可衡量意图识别准确率(criteria 定义为意图理解标准) - `semantic_similarity`:可衡量响应质量(与参考答案的语义接近度) **推荐方案 A:组合现有规则**(无需代码改动) - Layer 1 意图识别:`llm_score` + criteria="是否正确理解用户意图" - Layer 2 任务完成度:`keyword_match` + 每个必需信息项作为关键词 - Layer 3 任务成功率:二值判断(intent >= 7 AND completion >= 1.0) **工作量估算**:2 人天(配置模板 + 文档 + 报告聚合) **备选方案**: - 方案 B:新增 intent_classification 规则(3.5 人天) - 方案 C:扩展 llm_score 多维度(3.5 人天) **结论**:推荐方案 A,利用现有规则组合,无需代码改动。
Sign in to join this conversation.
No Milestone
No project
No Assignees
1 Participants
Notifications
Due Date
The due date is invalid or out of range. Please use the format 'yyyy-mm-dd'.

No due date set.

Dependencies

No dependencies set.

Reference: solahqb/AgentEvalTool#18
No description provided.