docs(v2): record exploratory-evaluation consensus in CONTEXT.md and ADR-0003
Grilling 沉淀:OpenClaw 定位从"重规划"转为"虚拟用户"双轨结构 (周期活动内嵌探索先行 + 探索活动后续里程碑),新增六个领域词条。
This commit is contained in:
parent
2d7679a6bb
commit
c35159ffcb
26
CONTEXT.md
26
CONTEXT.md
@ -82,6 +82,32 @@ _Avoid_: 环比(暗示固定自然周期,活动窗口可任意长)
|
|||||||
活动的两种运行档位,由时间倍速区分:`time_scale == 1` 为正式线(窗口按真实时长走完,代表真实服务周期,享受自动分析、自动周期对比等全链自动化);`time_scale > 1` 为加速调试线(压缩窗口用于快速验证流程,自动化能力默认关闭,仅手动按需触发)。
|
活动的两种运行档位,由时间倍速区分:`time_scale == 1` 为正式线(窗口按真实时长走完,代表真实服务周期,享受自动分析、自动周期对比等全链自动化);`time_scale > 1` 为加速调试线(压缩窗口用于快速验证流程,自动化能力默认关闭,仅手动按需触发)。
|
||||||
_Avoid_: 真实线、快速模式
|
_Avoid_: 真实线、快速模式
|
||||||
|
|
||||||
|
## 探索式评测
|
||||||
|
|
||||||
|
**虚拟用户(Virtual User)**:
|
||||||
|
OpenClaw 在探索式评测中扮演的角色:按人设与探索目标模拟拟真用户行为、与被评对象自主对话的智能体。是"行动者"而非"台词生成器"——对话节奏、追问、放弃均由其自主决定。
|
||||||
|
_Avoid_: 测试员、脚本机器人、模拟器
|
||||||
|
|
||||||
|
**探索式评测(Exploratory Evaluation)**:
|
||||||
|
与固定场景并行的第二种评测模式:不预设考纲,由虚拟用户按种子自由行动,产出"发现的问题"而非"通过率"。固定场景保留为回归基线(可比性、周期对比建在其上),两模式共用活动/窗口/报告外壳,可在同一活动内混编。(决策见 ADR-0003 v2 修订)
|
||||||
|
_Avoid_: 自由测试、压力测试、探索测试
|
||||||
|
|
||||||
|
**探索会话(Exploration Session)**:
|
||||||
|
虚拟用户以"人设 × 目标"组合执行的一段完整对话过程,独立实体存储(`exploration_sessions`,不并入评测运行——Run 绑定场景与规则判定,探索会话两者皆无)。平台提供会话对象、护栏与留痕,对话由 OpenClaw 驱动。
|
||||||
|
_Avoid_: 运行、用例、测试会话
|
||||||
|
|
||||||
|
**种子集(Seed Set)**:
|
||||||
|
活动级配置的种子人设(背景、性格、耐心度)与种子目标(如"完成退货")集合,是探索式评测的可比性单位(对应固定场景的"考纲",与 `plan` 同构)。虚拟用户可在预算约束内从种子衍生有限变体(换表达、换追问策略),全部留痕。
|
||||||
|
_Avoid_: 题库、人设库、剧本
|
||||||
|
|
||||||
|
**体验记录(Experience Record)**:
|
||||||
|
探索会话结束时虚拟用户产出的结构化自报:目标是否达成、卡点、被误导处、情绪变化。探索式评测的第一手证据——意图-结果闭环只有行动者自己能给;judge 岗位对抽样对话独立复核补充质量维度,两条证据链在分析层汇合。
|
||||||
|
_Avoid_: 评测结果、断言、日志
|
||||||
|
|
||||||
|
**巡检(Patrol)**:
|
||||||
|
常驻代理的周期性自主行动:经 OpenClaw heartbeat/cron 唤醒,调平台巡检 API 查看进行中活动的新结果与预算余量,自主决定"继续观察 / 派探索会话"。全局一个常驻巡检作业,无状态地巡检所有活动;OpenClaw 停摆只暂停探索,固定计划照常。
|
||||||
|
_Avoid_: 轮询、心跳(heartbeat 是 OpenClaw 机制名,巡检是平台侧行为)
|
||||||
|
|
||||||
## 模型配置
|
## 模型配置
|
||||||
|
|
||||||
**模型能力(Capability)**:
|
**模型能力(Capability)**:
|
||||||
|
|||||||
@ -17,3 +17,27 @@
|
|||||||
- v1 的活动计划是静态的:OpenClaw 至多在启动时生成一次,执行期不参与;因此 v1 报告反映的是"预设编排下的周期表现",尚不含 AI 依结果调整的闭环。
|
- v1 的活动计划是静态的:OpenClaw 至多在启动时生成一次,执行期不参与;因此 v1 报告反映的是"预设编排下的周期表现",尚不含 AI 依结果调整的闭环。
|
||||||
- v2 把 OpenClaw 放进调度热回路,其可靠性边界是"决策点可用"(非全程存活);决策点不可用时该时段应可跳过/重试而不拖垮整个活动。
|
- v2 把 OpenClaw 放进调度热回路,其可靠性边界是"决策点可用"(非全程存活);决策点不可用时该时段应可跳过/重试而不拖垮整个活动。
|
||||||
- 活动是**单对象**聚合;多对象对比通过并行活动 + 跨活动对比实现,不在活动内部横向编排(与 ADR-0001「同场景同版本才可比」一致)。
|
- 活动是**单对象**聚合;多对象对比通过并行活动 + 跨活动对比实现,不在活动内部横向编排(与 ADR-0001「同场景同版本才可比」一致)。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## v2 修订(2026-08-03):从"重规划"到"虚拟用户",双轨结构
|
||||||
|
|
||||||
|
原 v2 设想是 OpenClaw 在决策点重排计划条目。经 grilling 重新定位:OpenClaw 的价值不是给固定场景排课表,而是**当虚拟用户本身**——模拟复杂拟真用户行为去打被评对象,产出问题与建议。据此修订为双轨结构:
|
||||||
|
|
||||||
|
1. **周期活动内嵌探索(先行)**:现有活动骨架不变(静态计划照常执行),OpenClaw 常驻代理按巡检结果在窗口内派发探索会话;OpenClaw 停摆只暂停探索,固定计划照常完成。
|
||||||
|
2. **探索活动(后续里程碑)**:独立活动类型,无预设计划,OpenClaw 全权接管评测任务。
|
||||||
|
|
||||||
|
两轨共用底座:探索会话对象、种子配置、体验记录、judge 复核、平台护栏。
|
||||||
|
|
||||||
|
**关键决策**(完整清单见 grilling 记录):
|
||||||
|
|
||||||
|
- **平台耐久底座 + OpenClaw 常驻代理循环**(原"OpenClaw 全程自主驱动"仍被否,但修正为:常驻的是代理进程/循环而非会话;耐久性归平台,自主性归代理)。可靠性边界沿用原文:"决策点可用",不可用时跳过不拖垮活动。
|
||||||
|
- **探索会话是独立实体**,不并入 Run——Run 绑定场景与规则判定,探索会话两者皆无,合并会污染 ADR-0001/0002 的可比性与通过率口径。
|
||||||
|
- **判定 = 体验判定为主 + judge 抽样复核**:意图-结果闭环只有行动者自己能给;judge 补客观质量维度,两条证据链在分析层汇合。
|
||||||
|
- **种子集(种子人设 × 种子目标)是探索式评测的可比性单位**,活动级配置、与 `plan` 同构;代理可在预算内有限衍生。
|
||||||
|
- **巡检载体**:全局一个 OpenClaw heartbeat/cron 常驻作业 + 平台巡检 API(OpenClaw 调度持久化在 SQLite、重启不丢、连续失败自动禁用)。
|
||||||
|
- **护栏平台硬执行**:超预算 API 直接拒绝(默认 ≤8 会话/窗口、≤12 轮/会话、≥30min 间隔)。
|
||||||
|
- **档位**:正式线(time_scale == 1)自动,加速线仅手动——时间压缩与拟真本质冲突。
|
||||||
|
- **产出接入**:报告新增"探索发现"维度 + 喂 v0.7 分析 + Markdown 导出;周期对比暂不扩展,待口径稳定。
|
||||||
|
|
||||||
|
词汇表更新见 `CONTEXT.md`「探索式评测」章节。
|
||||||
|
|||||||
Loading…
Reference in New Issue
Block a user