智能体质量评估工具集平台
v0.9 ticket 02. Campaigns now carry an exploration seed set (seed personas × seed goals — the comparability unit for exploratory evaluation) and an optional budget override, stored as JSON columns isomorphic to plan. Empty seeds normalize to null, marking the campaign as opted out of exploration. resolve_budget merges per-field overrides into platform defaults; enforcement stays server-side. The create form gains seed lists and budget inputs (minutes → seconds), submitting null when left empty. |
||
|---|---|---|
| .gitea/workflows | ||
| .qoder | ||
| .scratch | ||
| backend | ||
| config | ||
| data/scenarios | ||
| deploy | ||
| docs | ||
| frontend/web | ||
| migrations | ||
| mockup | ||
| scripts | ||
| tests | ||
| vibe_images | ||
| .dockerignore | ||
| .env.example | ||
| .gitignore | ||
| AGENT.md | ||
| AGENTS.md | ||
| alembic.ini | ||
| CLAUDE.md | ||
| CONTEXT.md | ||
| pyproject.toml | ||
| README.md | ||
AgentEvalTool
当前开发版本: v0.4.0-dev 「联」 · 已发布至 t480 · 发布说明见 docs/release-notes-v0.4.md
智能体质量评估工具集平台。
功能
- 评测对象管理(AI 数字员工 / AI 助手)
- 评测场景管理(YAML/JSON 配置 + 模板库 + 动态用例生成)
- 异步评测执行引擎(真并发 / 真取消 / 可配置超时 / WS 实时进度)
- 评测通道:tutu-api / HTTP / OpenClaw
- 评估规则:关键词、响应时间、LLM 评分、语义相似度、JSON Schema、安全检测 + all/any/weighted 组合
- 模型配置中心(统一凭据管理 + Fernet 加密 + OpenAI/Anthropic/DashScope/Gemini 协议)
- 报告生成(JSON / HTML / Markdown / 同场景对比报告)+ Webhook 通知
- 触发来源标记(手动 / AI 助手 / CLI)+ AI 助手标准化评测链路
- 简单登录(访问密码 + 会话 token,未配置零打扰)
- 运营仪表盘(指标卡 / 趋势 / 场景表现 / 触发来源分布)
- 文件管理(分类树 + 上传下载)
- OpenClaw 免登录 iframe 集成 + 标准 agenteval-run 技能
- Web 管理后台(FastAPI + React)
v0.4 亮点
- AI 助手标准化:
triggered_by全链路标记 + 标准 SKILL.md 版本管理与自动同步 + API Key 自动注入 - 简单登录:
AGENTEVAL_ADMIN_PASSWORD一键启用访问控制,机器调用(X-API-Key)不受影响 - 仪表盘重构:6 指标卡 + 趋势 + 场景表现排行 + 触发来源分布
- 报告页重做:场景筛选、富选项下拉、一键重置、对比报告限同场景
- keep-alive 刷新修复:标签页激活自动刷新,根治"评测记录消失"问题
- 测试基线:232 个测试
快速开始
安装
pip install -e ".[dev]"
CLI 使用
# 查看帮助
agenteval --help
# 添加评测对象
agenteval target add --name "社区医院AI客服" --config config/config.json
# 导入评测场景
agenteval scenario import data/scenarios/health_basic.yaml
# 执行评测
agenteval run start --target <target-id> --scenario <scenario-id>
# 查看报告
agenteval report show <run-id> --format json
agenteval report generate <run-id> --format html
启动 Web 后台
agenteval server start --host 0.0.0.0 --port 8000
启动 Web 前端
cd frontend/web
npm install
npm run dev
文档
完整的文档集位于 docs/ 目录:
- 文档索引 - 文档导航和快速查找
- 需求分析 - 项目背景、功能需求、验证标准
- 架构设计 - 系统架构、核心抽象、项目结构
- 数据模型 - 数据库表结构、模型关系
- API 参考 - CLI 命令和 Web API 文档
- 部署文档 - 部署指南和运维说明
- 使用指南 - 快速开始和详细使用指南
- 外部参考 - tutu-api 等外部文档
项目结构
AgentEvalTool/
├── backend/ # Python 后端代码
│ ├── agenteval/ # 核心 Python 库
│ │ ├── channels/ # 消息通道适配器
│ │ ├── agents/ # 评测智能体适配器
│ │ ├── scenarios/ # 评测场景模型和加载
│ │ ├── evaluation/ # 评估引擎和规则
│ │ ├── storage/ # 数据持久化(SQLite)
│ │ └── web/ # FastAPI Web 后台
│ ├── cli/ # CLI 命令入口
│ └── plugins/ # 外部平台插件
│ └── openclaw/ # OpenClaw 插件示例
├── frontend/ # React 前端
│ └── web/ # Web 管理界面
├── config/ # 配置文件
│ └── config.json # tutu-api 配置
├── scripts/ # 工具脚本
│ └── mock_call.py # API 测试脚本
├── docs/ # 完整文档集
│ ├── requirements-v1.0.md
│ ├── architecture-v1.0.md
│ ├── data-models-v1.0.md
│ ├── api-reference/
│ ├── deployment/
│ ├── guides/
│ └── external-references/
├── deploy/ # 部署配置
│ └── t480/ # t480 服务器部署
├── data/ # 本地数据和报告
│ ├── scenarios/ # 场景 YAML 文件
│ ├── reports/ # 生成的 HTML/JSON 报告
│ └── agenteval.db # SQLite 数据库
└── tests/ # 测试
├── unit/
└── integration/
架构说明
AgentEvalTool 采用"CLI 工具集 + Web 后台"的交付方式:
- CLI 是核心能力入口,OpenClaw 可通过插件调用 CLI 完成评测自闭环。
- Web 后台提供可视化的对象、场景、执行、报告管理。
- 消息通道、评测智能体、评估规则均通过抽象接口定义,便于后续扩展。
许可证
MIT