--- name: agenteval-run description: 触发 AgentEvalTool 评测任务并获取报告 --- 当用户要求执行评测时,使用 exec 工具运行以下命令。 所有评测必须走 AgentEvalTool 标准 HTTP API(禁止直接调 CLI 或操作数据库)。 平台可能启用了 API Key 鉴权。每次执行命令前先读取密钥(文件不存在则为空,不影响未启用鉴权的环境): ```bash KEY=$(cat ~/.openclaw/agenteval-api-key 2>/dev/null) ``` 以下所有 curl 命令都必须带 `-H "X-API-Key: $KEY"`。 ## 查看评测对象列表 ```bash curl -s -H "X-API-Key: $KEY" http://agenteval:8000/api/targets | python3 -m json.tool ``` ## 查看评测场景列表 ```bash curl -s -H "X-API-Key: $KEY" http://agenteval:8000/api/scenarios | python3 -m json.tool ``` ## 启动评测 必须携带 `"triggered_by": "ai_assistant"`,平台以此区分手动触发与 AI 助手触发: ```bash curl -s -X POST http://agenteval:8000/api/runs \ -H "X-API-Key: $KEY" \ -H "Content-Type: application/json" \ -d '{"target_id": "", "scenario_id": "", "triggered_by": "ai_assistant"}' ``` 响应中的 `id` 字段即 run_id,请务必回报给用户。 ## 查看运行状态 轮询直到 `status` 变为 `completed` 或 `failed`(建议每 5 秒一次): ```bash curl -s -H "X-API-Key: $KEY" http://agenteval:8000/api/runs/ | python3 -m json.tool ``` ## 获取报告 ```bash curl -s -H "X-API-Key: $KEY" http://agenteval:8000/api/reports/ | python3 -m json.tool ``` 请将 替换为实际值。 完成后向用户汇报:run_id、状态、通过率(summary.pass_rate)以及失败用例摘要。