docs(readme): 添加 v1.3.0 性能基准实测数据 #12
18
README.md
18
README.md
@ -1,6 +1,6 @@
|
||||
# AgentEvalTool
|
||||
|
||||
> **当前版本**:v1.0.0 · 已部署至 t480 开发线与 volcengine-102 正式线 · [发布说明](docs/release-notes-v1.0.md)
|
||||
> **当前版本**:v1.3.0 · 已部署至 t480 开发线与 volcengine-102 正式线 · [发布说明](CHANGELOG.md)
|
||||
|
||||
智能体质量评估工具集平台。
|
||||
|
||||
@ -29,7 +29,21 @@
|
||||
- **耐久架构**:数据库保存运行与智能作业权威状态,进程重启后可按明确边界恢复。
|
||||
- **统一管理后台**:详情与报告采用 Drawer/页内视图,列表、轮询、反馈和危险操作遵循一致交互基线。
|
||||
- **双线部署**:t480 用于开发验证,volcengine-102 通过不可变镜像、数据备份和迁移发布正式服务。
|
||||
- **测试基线**:后端 744 项、前端 15 项自动化测试通过。
|
||||
- **测试基线**:后端 963 项、前端 178 项自动化测试通过。
|
||||
|
||||
## 性能基准(v1.3.0,t480 实测)
|
||||
|
||||
评测引擎在 v1.3.0 引入 case 级并行执行(`max_concurrent_cases=3`)、rule 级并行(`max_concurrent_rules=5`)、SQLite WAL 模式与 6 项查询索引。以下为 t480 线上环境对「科室导航与挂号咨询」场景(3 cases / 4 turns)的实测对比:
|
||||
|
||||
| 指标 | 数值 |
|
||||
|------|------|
|
||||
| 并行实测(v1.3.0) | **88.5s** |
|
||||
| 串行平均(v1.2.0 历史 5 次) | 104.6s |
|
||||
| 提速 | **15.4%** |
|
||||
| 理论串行耗时(case 级累加) | 140.3s |
|
||||
| 并行加速比 | **1.59x** |
|
||||
|
||||
时间线验证:3 个 case 同时启动(间隔 0.0s),case-01(23s)和 case-02(29s)先行完成,case-03(2 个顺序 turn,88.5s)决定总耗时。瓶颈在通道 I/O 延迟而非引擎本身。
|
||||
|
||||
## 快速开始
|
||||
|
||||
|
||||
Loading…
Reference in New Issue
Block a user