sinohqb
|
2e3c00bc69
|
feat(v1.3.1): Phase 4 场景扩充、网关延迟优化与报告 go/no-go 展示
CI / test (pull_request) Successful in 3m55s
4.1 新增三个评估场景(急诊分诊、慢病管理、健康咨询),各 3 个用例,
全部使用无模型绑定依赖的规则;急诊场景编码 <20s 延迟验收标准
4.2 ModelGateway 由每次请求新建 httpx.AsyncClient 改为单实例共享客户端
(复用 TCP/TLS 连接),引擎与模型连通性测试端点负责关闭;
tutu 通道已具备同等优化,无需改动
4.3 Reports.tsx 单次报告顶部新增上线评估横幅:go/no-go/conditional
三态 banner + 各验收标准达标情况标签
版本号升至 1.3.1(v1.3.1-final)。
门禁:pytest tests/unit 709 passed;ruff 全绿;
前端 tsc --noEmit + vitest 232 passed。
附带修复 RunList 测试时区缺陷:started_at 用 UTC 日期构造,
本地 00:00-08:00 之间会被默认"今天"过滤器排除导致误报失败。
|
2026-08-26 02:15:18 +08:00 |
|
sinohqb
|
2f09ee2bfc
|
refactor(v1.3.1): Phase 3 报告横幅、评分逻辑收敛与成本闭环
CI / test (pull_request) Successful in 3m58s
- 报告渲染 Go/No-Go 上线评估横幅(HTML 彩色 banner + Markdown 引用块)
- 抽取 scored_llm 共享模块:llm_score / fluency 直连调用与评分解析收敛
- 网关新增 chat_with_usage / embed_with_usage,规则按次归集 llm_usage
- 引擎分岗位用量归集(judge/generator/embedding/moderation)写入
RunSummary.eval_usage_by_purpose,并发下不做总量差值
- cost_tracking 重构:data/model_pricing.json 覆盖 + 默认计价表,
删除从未有数据支撑的 Turn 维度成本函数(偏差说明见 PR)
- 报告 summary 增加 eval_cost 分岗位成本段并在 Markdown 渲染
|
2026-08-26 01:59:20 +08:00 |
|
sinohqb
|
c956da7686
|
feat(v1.3.1): Phase 2 让成本/放弃率/Go-No-Go 基础设施真正生效
CI / test (pull_request) Successful in 4m3s
- token 用量接入:ModelGateway 经 adapter.parse_usage 累计评测侧 LLM 调用的
token 消耗,引擎写入 run.summary.eval_token_usage,报告透出
- 放弃率落地:CaseOutcome 新增 abandoned 标记(对话中途发送/接收失败),
build_run_summary 统计 abandoned_cases / abandonment_rate
- Go/No-Go 可配置:Scenario 新增 acceptance_criteria 字段(DB 列 + 幂等迁移),
报告按场景标准出 verdict,缺省回退全局默认;标准变更不触发考纲升版
|
2026-08-25 18:38:18 +08:00 |
|
sinohqb
|
cc79d3a625
|
feat(models): support mainstream model protocols
|
2026-07-17 20:58:27 +08:00 |
|
sinohqb
|
470ff5875f
|
feat(models): add centralized model configuration
|
2026-07-17 20:02:43 +08:00 |
|