05 / 验证与治理
Demo 成功,不等于业务验收。
一个能力只有在代表性案例、真实用户、明确权限和失败路径下形成可接受证据,才有资格接触更真实的工作。自治程度应该由证据和人工权限决定,而不是由演示效果决定。
查看渐进式验证 ↓渐进式暴露
只有证据和人工权限支持时,才增加能力接触真实工作的程度。
这些阶段描述的是能力接触真实工作的程度逐步增加,不是自动走向最高自治的路线。能力可以长期保持在任何有界阶段,也可以退回更安全的阶段、修正、停止或暂缓。
暴露程度阶梯 · 不是成熟度模型、价值排名、强制流程、发布计划,也不承诺最终走向自治。
E1分析与建议暴露程度 1 / 6
- 暴露边界
- 形成有边界的分析或建议,供人工判断,不改变业务工作。
- 人工控制
- 每项重要结论均由人决定是否以及如何使用。
- 所需证据
- 哪些正常、异常和失败案例可以支持判断。
- 回退 / 停止
- 当证据、系统、用户或输出失败时会发生什么;以及哪些证据或事件会阻止继续或扩展。
E2离线评测暴露程度 2 / 6
- 暴露边界
- 在真实流程之外,使用获批历史案例或安全合成案例进行测试。
- 人工控制
- 案例、标准、阈值和验收权限由人批准。
- 所需证据
- 哪些正常、异常和失败案例可以支持判断。
- 回退 / 停止
- 当证据、系统、用户或输出失败时会发生什么;以及哪些证据或事件会阻止继续或扩展。
E3Shadow Mode暴露程度 3 / 6
- 暴露边界
- 观察或生成并行结果,但不改变真实业务流程。
- 人工控制
- 输出不直接生效;比较、日志、隐私和停止规则必须明确。
- 所需证据
- 哪些正常、异常和失败案例可以支持判断。
- 回退 / 停止
- 当证据、系统、用户或输出失败时会发生什么;以及哪些证据或事件会阻止继续或扩展。
E4Copilot Mode暴露程度 4 / 6
- 暴露边界
- 支持明确用户,并由用户审核每项重要建议或动作。
- 人工控制
- 明确用户保留批准、纠正、覆盖和放弃权限。
- 所需证据
- 哪些正常、异常和失败案例可以支持判断。
- 回退 / 停止
- 当证据、系统、用户或输出失败时会发生什么;以及哪些证据或事件会阻止继续或扩展。
E5有边界的自动化暴露程度 5 / 6
- 暴露边界
- 只在狭窄范围、权限、阈值和恢复条件内执行明确获批动作。
- 人工控制
- 人工负责人定义异常、升级、回退、监控和停止权限。
- 所需证据
- 哪些正常、异常和失败案例可以支持判断。
- 回退 / 停止
- 当证据、系统、用户或输出失败时会发生什么;以及哪些证据或事件会阻止继续或扩展。
E6证据支持后的有限扩展暴露程度 6 / 6
- 暴露边界
- 只有经过新的证据与权限决策,才考虑增加用户、案例或动作。
- 人工控制
- 扩展是一项新决策,既有证据不会自动迁移。
- 所需证据
- 哪些正常、异常和失败案例可以支持判断。
- 回退 / 停止
- 当证据、系统、用户或输出失败时会发生什么;以及哪些证据或事件会阻止继续或扩展。
跨阶段控制轨
- 01人工权限
谁可以批准、覆盖、暂停、停止和验收。
- 02代表性案例
哪些正常、异常和失败案例可以支持判断。
- 03失败与回退
当证据、系统、用户或输出失败时会发生什么。
- 04日志与版本
哪些内容可以追溯、复现并归因到具体版本。
- 05停止条件
哪些证据或事件会阻止继续或扩展。
增加暴露程度需要新的证据和新的人工决策,不能自动继承。
可见语义等价文本
- E1分析与建议
形成有边界的分析或建议,供人工判断,不改变业务工作。
每项重要结论均由人决定是否以及如何使用。 - E2离线评测
在真实流程之外,使用获批历史案例或安全合成案例进行测试。
案例、标准、阈值和验收权限由人批准。 - E3Shadow Mode
观察或生成并行结果,但不改变真实业务流程。
输出不直接生效;比较、日志、隐私和停止规则必须明确。 - E4Copilot Mode
支持明确用户,并由用户审核每项重要建议或动作。
明确用户保留批准、纠正、覆盖和放弃权限。 - E5有边界的自动化
只在狭窄范围、权限、阈值和恢复条件内执行明确获批动作。
人工负责人定义异常、升级、回退、监控和停止权限。 - E6证据支持后的有限扩展
只有经过新的证据与权限决策,才考虑增加用户、案例或动作。
扩展是一项新决策,既有证据不会自动迁移。
三层证据面
分别衡量业务、系统和采用证据。
技术上能够运行的系统,仍可能缺乏业务价值或采用准备度。三层可以共享可追溯证据,但必须保留各自的指标、基线、负责人和 Verdict。
共享可追溯性 · 各自保留指标、基线、负责人和 VERDICT
业务证据
判断能力相对于获批基线或替代方案,是否改善了预期工作与业务结果。
- 周期时间
- 成本或投入
- 质量、服务、可得性
- 损耗、返工、错误
- 仅在因果归因可靠时衡量收入或转化
系统证据
判断预期行为在获批案例和版本中是否可靠、有界、可恢复且稳定。
- 任务完成
- 评分标准或准确性结果
- 失败与升级
- 延迟与运行成本
- 恢复成功
- 回归稳定性
采用证据
判断预期用户能否理解、使用、纠正、适度信任并持续使用该能力。
- 符合条件与活跃用户
- 重复使用
- 纠正与覆盖
- 放弃使用
- 信心与有用性
- 达到熟练所需时间
不设综合就绪分
本网站不展示虚构目标、阈值、分数或结果。具体基线和目标必须由真实项目证据与客户决策共同确定。
分别形成 VERDICT
一个维度通过,不代表整个能力已经就绪。
每个 Verdict 回答不同问题,并由相应的人工权限负责人拥有。不能把它们平均、合并成一个就绪分,也不能让技术表现默默覆盖其他判断。
- 01业务有用性
相对于获批基线或替代方案,它是否改善了预期工作或决策?
人工 VERDICT - 02证据充分性
代表性的正常、异常与失败案例,是否足以支持当前决策?
人工 VERDICT - 03技术功能
实现是否在获批条件内稳定完成有界任务?
人工 VERDICT - 04安全与权限
数据、访问、权限、日志和人工批准边界是否可接受?
人工 VERDICT - 05运营可恢复性
负责人能否发现失败、Fallback、恢复、回退和停止?
人工 VERDICT - 06采用准备度
预期用户能否在真实工作中理解、使用、纠正并支持该能力?
人工 VERDICT - 07经济吸引力
相对于成本、投入、替代方案和剩余风险,预期价值是否站得住?
人工 VERDICT
七个 Verdict · 不预填任何状态 · 不自动授权发布。
GATE 05 / 验证处置决定
验证的目的,是支持决策,而不是证明 AI 必须上线。
决策输入
- 01获批的业务、系统与采用证据
- 02七个独立人工 Verdict
- 03已知限制与剩余风险
- 04权限、Fallback、恢复与停止条件
- 05明确的决策权限与获批范围
验证处置决定?
- 继续
只在明确获批的下一边界内继续。
- 修正
修改能力、证据计划、控制或范围,并重新评估。
- 保持有界
保持当前获批暴露程度,不扩大范围。
- 停止
停止拟议用途或运行,并执行获批停止与 Fallback 路径。
- 暂缓
等待明确证据、权限、准备度或条件形成后再决定。
获批证据 + 独立 Verdict + 已知限制 + 人工权限
可形成 VALIDATION DISPOSITION验证处置决定是一项人工决策记录,本身不授权生产发布、更广访问、更高自治、集成或扩展。
本公开页面定义的是验证方法,不会评测真实客户、运行测试、接受风险、设定目标、作出发布决定或形成运营授权。
证据类别与主张类型是两个独立维度。
证据记录类型
- 测试证据
- 来自获批案例、标准、版本和条件的可追溯结果。
- 业务证据
- 获批基线、对照、工作流结果和业务负责人观察。
- 用户证据
- 来自预期用户的纠正、覆盖、放弃、信心、有用性和熟练程度。
- 控制证据
- 权限、日志、批准、Fallback、恢复、回退和停止条件证据。
这些是通用证据类别,不代表任何证据当前已经存在。
主张 / 证据类型
- 事实 / FACT
- 已接受的通用方法定义,或拥有来源的已观察实现状态。
- 假设 / HYPOTHESIS
- 需要验证的客户具体有用性、可靠性、安全、采用、经济性、暴露或扩展假设。
- 未知 / UNKNOWN
- 尚缺失的基线、案例、数据、权限、用户、失败、恢复、目标、负责人、验收、成本或价值证据。
- 建议 / RECOMMENDATION
- 有边界的下一项验证或处置决策,绝不是虚构结果、Verdict、批准、发布或承诺。
证据类别说明哪类记录支持审查;主张类型说明正在提出哪类陈述。两者都不是 Verdict 或发布状态。
可能的方法产出
验证让证据与决策记录可以被检查。
可能产出取决于获批范围和已接受证据。本页面不声称任何产出已经存在或获得验收。
- 01评测与验证报告
- 02业务、系统与采用 Scorecard
- 03失败模式登记册
- 04业务验收记录
- 05已知限制与剩余风险
- 06继续、修正、保持有界、停止或暂缓建议
开启对话
构建值得验证的事物。
关于 AI 原生产品、全球 GTM 或独立项目,可以通过以下方式联系我。