架构重构(候选 1-6): - storage/repository.py 按域拆分为包(target/scenario/run/campaign/result) - storage/db.py 按域拆分为包(eval/campaign/file/model_config/intelligent_eval) - intelligent_eval/lifecycle.py 按状态机阶段拆分为包 - services/runs.py 编排逻辑下沉 - Campaigns.tsx 拆分为 campaigns/ 子组件 测试补全(候选 7): 前端(+125 用例,107→232): - utils/ 纯函数:date/campaignTime/ruleLabels/fileTree/fileFormat/colors - stores/tabStore 状态管理 - 核心组件:FormDrawer/PageWrapper/ChatBubble/GeneratedMessages/SectionHeader/StatCard/TurnList - 业务组件:CaseBlock/CaseDetail/RuleOverview/WindowTimeline/RunList/TabBar/CampaignRunTimeline - 文件管理:FileCategoryTree/FileTable - hooks:sessionReducer/useFiles/useRunSession 后端(+38 用例,916→954): - targets API CRUD + 404 路径 - WebSocket 连接管理器 - proxy 头部重写(CSP/X-Frame-Options) - target 仓储 update 方法 - app 健康检查 + SPA 404 - scenarios 模板端点 + 404 - files API 边缘分支(404 场景 + 500 兜底) - files service update_category - 智能评估状态机迁移测试 门禁状态: - 前端:tsc 干净 + 232 passed - 后端:954 passed + ruff 全绿
96 lines
2.7 KiB
Python
96 lines
2.7 KiB
Python
"""Repository for evaluation results and turns."""
|
|
|
|
from datetime import datetime
|
|
from typing import Optional
|
|
|
|
from sqlmodel import Session
|
|
|
|
from agenteval.models import EvalResult
|
|
from agenteval.storage.db import EvalResultDB, TurnDB, get_session
|
|
|
|
|
|
def result_to_db(result: EvalResult) -> EvalResultDB:
|
|
return EvalResultDB(
|
|
id=result.id,
|
|
run_id=result.run_id,
|
|
case_id=result.case_id,
|
|
turn_id=result.turn_id,
|
|
rule_type=result.rule_type,
|
|
passed=result.passed,
|
|
score=result.score,
|
|
reason=result.reason,
|
|
)
|
|
|
|
|
|
def result_from_db(db: EvalResultDB) -> EvalResult:
|
|
return EvalResult(
|
|
id=db.id,
|
|
run_id=db.run_id,
|
|
case_id=db.case_id,
|
|
turn_id=db.turn_id,
|
|
rule_type=db.rule_type,
|
|
passed=db.passed,
|
|
score=db.score,
|
|
reason=db.reason,
|
|
)
|
|
|
|
|
|
class ResultRepository:
|
|
"""Repository for evaluation results."""
|
|
|
|
def __init__(self, session: Optional[Session] = None):
|
|
self.session = session or get_session()
|
|
|
|
def save_turn(self, turn) -> TurnDB:
|
|
db = TurnDB(
|
|
id=turn.id,
|
|
run_id=turn.run_id,
|
|
case_id=turn.case_id,
|
|
round_index=turn.round_index,
|
|
question_msg_id=turn.question_msg_id,
|
|
sent_at=turn.sent_at,
|
|
received_at=turn.received_at,
|
|
latency_ms=turn.latency_ms,
|
|
)
|
|
db.set_sent_message(turn.sent_message)
|
|
db.set_reply(turn.reply)
|
|
self.session.add(db)
|
|
self.session.commit()
|
|
self.session.refresh(db)
|
|
return db
|
|
|
|
def update_turn_exchange(
|
|
self,
|
|
turn_id: str,
|
|
*,
|
|
question_msg_id: Optional[str],
|
|
reply: Optional[dict],
|
|
received_at: Optional[datetime],
|
|
latency_ms: Optional[int],
|
|
) -> Optional[TurnDB]:
|
|
"""Attach exchange facts to an already-persisted Turn.
|
|
|
|
This is deliberately narrower than updating a whole Turn: the sent
|
|
message, case identity, ordering and send timestamp remain untouched.
|
|
A caller can therefore commit the sent fact before polling and safely
|
|
complete the same ledger row after a reply, timeout or poll failure.
|
|
"""
|
|
db = self.session.get(TurnDB, turn_id)
|
|
if db is None:
|
|
return None
|
|
db.question_msg_id = question_msg_id
|
|
db.set_reply(reply)
|
|
db.received_at = received_at
|
|
db.latency_ms = latency_ms
|
|
self.session.add(db)
|
|
self.session.commit()
|
|
self.session.refresh(db)
|
|
return db
|
|
|
|
def save_result(self, result: EvalResult) -> EvalResult:
|
|
db = result_to_db(result)
|
|
self.session.add(db)
|
|
self.session.commit()
|
|
self.session.refresh(db)
|
|
return result_from_db(db)
|