docs(v2): record exploratory-evaluation consensus in CONTEXT.md and ADR-0003

Grilling 沉淀:OpenClaw 定位从"重规划"转为"虚拟用户"双轨结构
(周期活动内嵌探索先行 + 探索活动后续里程碑),新增六个领域词条。
This commit is contained in:
sinohqb 2026-08-03 16:40:28 +08:00
parent 2d7679a6bb
commit c35159ffcb
2 changed files with 50 additions and 0 deletions

View File

@ -82,6 +82,32 @@ _Avoid_: 环比(暗示固定自然周期,活动窗口可任意长)
活动的两种运行档位,由时间倍速区分:`time_scale == 1` 为正式线(窗口按真实时长走完,代表真实服务周期,享受自动分析、自动周期对比等全链自动化);`time_scale > 1` 为加速调试线(压缩窗口用于快速验证流程,自动化能力默认关闭,仅手动按需触发)。 活动的两种运行档位,由时间倍速区分:`time_scale == 1` 为正式线(窗口按真实时长走完,代表真实服务周期,享受自动分析、自动周期对比等全链自动化);`time_scale > 1` 为加速调试线(压缩窗口用于快速验证流程,自动化能力默认关闭,仅手动按需触发)。
_Avoid_: 真实线、快速模式 _Avoid_: 真实线、快速模式
## 探索式评测
**虚拟用户Virtual User**:
OpenClaw 在探索式评测中扮演的角色:按人设与探索目标模拟拟真用户行为、与被评对象自主对话的智能体。是"行动者"而非"台词生成器"——对话节奏、追问、放弃均由其自主决定。
_Avoid_: 测试员、脚本机器人、模拟器
**探索式评测Exploratory Evaluation**:
与固定场景并行的第二种评测模式:不预设考纲,由虚拟用户按种子自由行动,产出"发现的问题"而非"通过率"。固定场景保留为回归基线(可比性、周期对比建在其上),两模式共用活动/窗口/报告外壳,可在同一活动内混编。(决策见 ADR-0003 v2 修订)
_Avoid_: 自由测试、压力测试、探索测试
**探索会话Exploration Session**:
虚拟用户以"人设 × 目标"组合执行的一段完整对话过程,独立实体存储(`exploration_sessions`不并入评测运行——Run 绑定场景与规则判定,探索会话两者皆无)。平台提供会话对象、护栏与留痕,对话由 OpenClaw 驱动。
_Avoid_: 运行、用例、测试会话
**种子集Seed Set**:
活动级配置的种子人设(背景、性格、耐心度)与种子目标(如"完成退货")集合,是探索式评测的可比性单位(对应固定场景的"考纲",与 `plan` 同构)。虚拟用户可在预算约束内从种子衍生有限变体(换表达、换追问策略),全部留痕。
_Avoid_: 题库、人设库、剧本
**体验记录Experience Record**:
探索会话结束时虚拟用户产出的结构化自报:目标是否达成、卡点、被误导处、情绪变化。探索式评测的第一手证据——意图-结果闭环只有行动者自己能给judge 岗位对抽样对话独立复核补充质量维度,两条证据链在分析层汇合。
_Avoid_: 评测结果、断言、日志
**巡检Patrol**:
常驻代理的周期性自主行动:经 OpenClaw heartbeat/cron 唤醒,调平台巡检 API 查看进行中活动的新结果与预算余量,自主决定"继续观察 / 派探索会话"。全局一个常驻巡检作业无状态地巡检所有活动OpenClaw 停摆只暂停探索,固定计划照常。
_Avoid_: 轮询、心跳heartbeat 是 OpenClaw 机制名,巡检是平台侧行为)
## 模型配置 ## 模型配置
**模型能力Capability**: **模型能力Capability**:

View File

@ -17,3 +17,27 @@
- v1 的活动计划是静态的OpenClaw 至多在启动时生成一次,执行期不参与;因此 v1 报告反映的是"预设编排下的周期表现",尚不含 AI 依结果调整的闭环。 - v1 的活动计划是静态的OpenClaw 至多在启动时生成一次,执行期不参与;因此 v1 报告反映的是"预设编排下的周期表现",尚不含 AI 依结果调整的闭环。
- v2 把 OpenClaw 放进调度热回路,其可靠性边界是"决策点可用"(非全程存活);决策点不可用时该时段应可跳过/重试而不拖垮整个活动。 - v2 把 OpenClaw 放进调度热回路,其可靠性边界是"决策点可用"(非全程存活);决策点不可用时该时段应可跳过/重试而不拖垮整个活动。
- 活动是**单对象**聚合;多对象对比通过并行活动 + 跨活动对比实现,不在活动内部横向编排(与 ADR-0001「同场景同版本才可比」一致 - 活动是**单对象**聚合;多对象对比通过并行活动 + 跨活动对比实现,不在活动内部横向编排(与 ADR-0001「同场景同版本才可比」一致
---
## v2 修订2026-08-03从"重规划"到"虚拟用户",双轨结构
原 v2 设想是 OpenClaw 在决策点重排计划条目。经 grilling 重新定位OpenClaw 的价值不是给固定场景排课表,而是**当虚拟用户本身**——模拟复杂拟真用户行为去打被评对象,产出问题与建议。据此修订为双轨结构:
1. **周期活动内嵌探索(先行)**现有活动骨架不变静态计划照常执行OpenClaw 常驻代理按巡检结果在窗口内派发探索会话OpenClaw 停摆只暂停探索,固定计划照常完成。
2. **探索活动(后续里程碑)**独立活动类型无预设计划OpenClaw 全权接管评测任务。
两轨共用底座探索会话对象、种子配置、体验记录、judge 复核、平台护栏。
**关键决策**(完整清单见 grilling 记录):
- **平台耐久底座 + OpenClaw 常驻代理循环**(原"OpenClaw 全程自主驱动"仍被否,但修正为:常驻的是代理进程/循环而非会话;耐久性归平台,自主性归代理)。可靠性边界沿用原文:"决策点可用",不可用时跳过不拖垮活动。
- **探索会话是独立实体**,不并入 Run——Run 绑定场景与规则判定,探索会话两者皆无,合并会污染 ADR-0001/0002 的可比性与通过率口径。
- **判定 = 体验判定为主 + judge 抽样复核**:意图-结果闭环只有行动者自己能给judge 补客观质量维度,两条证据链在分析层汇合。
- **种子集(种子人设 × 种子目标)是探索式评测的可比性单位**,活动级配置、与 `plan` 同构;代理可在预算内有限衍生。
- **巡检载体**:全局一个 OpenClaw heartbeat/cron 常驻作业 + 平台巡检 APIOpenClaw 调度持久化在 SQLite、重启不丢、连续失败自动禁用
- **护栏平台硬执行**:超预算 API 直接拒绝(默认 ≤8 会话/窗口、≤12 轮/会话、≥30min 间隔)。
- **档位**正式线time_scale == 1自动加速线仅手动——时间压缩与拟真本质冲突。
- **产出接入**:报告新增"探索发现"维度 + 喂 v0.7 分析 + Markdown 导出;周期对比暂不扩展,待口径稳定。
词汇表更新见 `CONTEXT.md`「探索式评测」章节。