From c35159ffcb0ccf1908549b7b0953bade3928ed2f Mon Sep 17 00:00:00 2001 From: sinohqb Date: Mon, 3 Aug 2026 16:40:28 +0800 Subject: [PATCH] docs(v2): record exploratory-evaluation consensus in CONTEXT.md and ADR-0003 MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Grilling 沉淀:OpenClaw 定位从"重规划"转为"虚拟用户"双轨结构 (周期活动内嵌探索先行 + 探索活动后续里程碑),新增六个领域词条。 --- CONTEXT.md | 26 +++++++++++++++++++ ...03-campaign-phased-static-then-adaptive.md | 24 +++++++++++++++++ 2 files changed, 50 insertions(+) diff --git a/CONTEXT.md b/CONTEXT.md index ff80875..f5ccbc1 100644 --- a/CONTEXT.md +++ b/CONTEXT.md @@ -82,6 +82,32 @@ _Avoid_: 环比(暗示固定自然周期,活动窗口可任意长) 活动的两种运行档位,由时间倍速区分:`time_scale == 1` 为正式线(窗口按真实时长走完,代表真实服务周期,享受自动分析、自动周期对比等全链自动化);`time_scale > 1` 为加速调试线(压缩窗口用于快速验证流程,自动化能力默认关闭,仅手动按需触发)。 _Avoid_: 真实线、快速模式 +## 探索式评测 + +**虚拟用户(Virtual User)**: +OpenClaw 在探索式评测中扮演的角色:按人设与探索目标模拟拟真用户行为、与被评对象自主对话的智能体。是"行动者"而非"台词生成器"——对话节奏、追问、放弃均由其自主决定。 +_Avoid_: 测试员、脚本机器人、模拟器 + +**探索式评测(Exploratory Evaluation)**: +与固定场景并行的第二种评测模式:不预设考纲,由虚拟用户按种子自由行动,产出"发现的问题"而非"通过率"。固定场景保留为回归基线(可比性、周期对比建在其上),两模式共用活动/窗口/报告外壳,可在同一活动内混编。(决策见 ADR-0003 v2 修订) +_Avoid_: 自由测试、压力测试、探索测试 + +**探索会话(Exploration Session)**: +虚拟用户以"人设 × 目标"组合执行的一段完整对话过程,独立实体存储(`exploration_sessions`,不并入评测运行——Run 绑定场景与规则判定,探索会话两者皆无)。平台提供会话对象、护栏与留痕,对话由 OpenClaw 驱动。 +_Avoid_: 运行、用例、测试会话 + +**种子集(Seed Set)**: +活动级配置的种子人设(背景、性格、耐心度)与种子目标(如"完成退货")集合,是探索式评测的可比性单位(对应固定场景的"考纲",与 `plan` 同构)。虚拟用户可在预算约束内从种子衍生有限变体(换表达、换追问策略),全部留痕。 +_Avoid_: 题库、人设库、剧本 + +**体验记录(Experience Record)**: +探索会话结束时虚拟用户产出的结构化自报:目标是否达成、卡点、被误导处、情绪变化。探索式评测的第一手证据——意图-结果闭环只有行动者自己能给;judge 岗位对抽样对话独立复核补充质量维度,两条证据链在分析层汇合。 +_Avoid_: 评测结果、断言、日志 + +**巡检(Patrol)**: +常驻代理的周期性自主行动:经 OpenClaw heartbeat/cron 唤醒,调平台巡检 API 查看进行中活动的新结果与预算余量,自主决定"继续观察 / 派探索会话"。全局一个常驻巡检作业,无状态地巡检所有活动;OpenClaw 停摆只暂停探索,固定计划照常。 +_Avoid_: 轮询、心跳(heartbeat 是 OpenClaw 机制名,巡检是平台侧行为) + ## 模型配置 **模型能力(Capability)**: diff --git a/docs/adr/0003-campaign-phased-static-then-adaptive.md b/docs/adr/0003-campaign-phased-static-then-adaptive.md index 3c9c3d0..b47b1f2 100644 --- a/docs/adr/0003-campaign-phased-static-then-adaptive.md +++ b/docs/adr/0003-campaign-phased-static-then-adaptive.md @@ -17,3 +17,27 @@ - v1 的活动计划是静态的:OpenClaw 至多在启动时生成一次,执行期不参与;因此 v1 报告反映的是"预设编排下的周期表现",尚不含 AI 依结果调整的闭环。 - v2 把 OpenClaw 放进调度热回路,其可靠性边界是"决策点可用"(非全程存活);决策点不可用时该时段应可跳过/重试而不拖垮整个活动。 - 活动是**单对象**聚合;多对象对比通过并行活动 + 跨活动对比实现,不在活动内部横向编排(与 ADR-0001「同场景同版本才可比」一致)。 + +--- + +## v2 修订(2026-08-03):从"重规划"到"虚拟用户",双轨结构 + +原 v2 设想是 OpenClaw 在决策点重排计划条目。经 grilling 重新定位:OpenClaw 的价值不是给固定场景排课表,而是**当虚拟用户本身**——模拟复杂拟真用户行为去打被评对象,产出问题与建议。据此修订为双轨结构: + +1. **周期活动内嵌探索(先行)**:现有活动骨架不变(静态计划照常执行),OpenClaw 常驻代理按巡检结果在窗口内派发探索会话;OpenClaw 停摆只暂停探索,固定计划照常完成。 +2. **探索活动(后续里程碑)**:独立活动类型,无预设计划,OpenClaw 全权接管评测任务。 + +两轨共用底座:探索会话对象、种子配置、体验记录、judge 复核、平台护栏。 + +**关键决策**(完整清单见 grilling 记录): + +- **平台耐久底座 + OpenClaw 常驻代理循环**(原"OpenClaw 全程自主驱动"仍被否,但修正为:常驻的是代理进程/循环而非会话;耐久性归平台,自主性归代理)。可靠性边界沿用原文:"决策点可用",不可用时跳过不拖垮活动。 +- **探索会话是独立实体**,不并入 Run——Run 绑定场景与规则判定,探索会话两者皆无,合并会污染 ADR-0001/0002 的可比性与通过率口径。 +- **判定 = 体验判定为主 + judge 抽样复核**:意图-结果闭环只有行动者自己能给;judge 补客观质量维度,两条证据链在分析层汇合。 +- **种子集(种子人设 × 种子目标)是探索式评测的可比性单位**,活动级配置、与 `plan` 同构;代理可在预算内有限衍生。 +- **巡检载体**:全局一个 OpenClaw heartbeat/cron 常驻作业 + 平台巡检 API(OpenClaw 调度持久化在 SQLite、重启不丢、连续失败自动禁用)。 +- **护栏平台硬执行**:超预算 API 直接拒绝(默认 ≤8 会话/窗口、≤12 轮/会话、≥30min 间隔)。 +- **档位**:正式线(time_scale == 1)自动,加速线仅手动——时间压缩与拟真本质冲突。 +- **产出接入**:报告新增"探索发现"维度 + 喂 v0.7 分析 + Markdown 导出;周期对比暂不扩展,待口径稳定。 + +词汇表更新见 `CONTEXT.md`「探索式评测」章节。