boss 不是"问 AI 要个答案"。它把一次判断拆成 五层:怎么进来、拿什么当原料、 按什么流程走、产出什么、以及事后怎么验证自己错没错。 这一页把整套机制画成一张图,再逐层拆开讲。
自上而下是一次判断的生命周期;最下面那条回路是关键——它让系统能从自己的错误里学, 而不是每次从零开始。
设计不是为了复杂,每一层都对应一个"如果没有它会怎样"。
| 层 | 解决什么问题 | 如果没有它 | 关键机制 |
|---|---|---|---|
| L1 入口 | 判断要在人本来就在的地方发生,而不是逼人换工具 | 再好的方法论也没人用 | 同一引擎多入口;场景化配置(每个场景自己的评委组与评分口径) |
| L2 知识 | 判断要有可追溯的事实底座,不能靠模型脑补 | 幻觉、张冠李戴、无法审计 | 单向编译;引用必须锚到来源;材料不足要明说而不是编 |
| L3 流水线 | 把"想清楚"拆成可检查的步骤 | 一步到位的答案没法复核,也没法定位错在哪 | 阶段产物落盘;人工确认闸;评委独立打分;强制写反方 |
| L4 产出 | 判断要冻结得住,事后能翻回去看当时是怎么想的 | 事后诸葛亮,无法归因 | 版本快照不可变;评委评语各自独立留存 |
| L5 回路 | 让系统知道自己错了,并把教训固化回去 | 永远在重复同一类错误 | 下判断时就写好证伪条件;到期自动核对;失败卡片按类型改对应环节 |
判断对象常常涉及具体客户、人物、数字与条款。这套系统默认所有内容都是机密的, 靠分级而不是靠自觉来管控。
任何内容出到公网前必过,fail-close(拦不住就不放行)。命中即阻断并留待人工复核。
公开站内容部署前硬规则扫描:真名、客户名、内部链接一律拦下。
评委缺少反方字段、评语格式畸形,直接阻断提交——纪律靠工具执行,不靠记性。
公开 / 内部 / 机密 / 仅锚点。默认机密,越权发布需显式降级。
以「某产品线明年要不要扩张」为例,看数据在五层之间怎么流动。
| 时刻 | 发生了什么 | 落下了什么 |
|---|---|---|
| T+0 | 有人在飞书里 @ 机器人,或在终端敲一条命令 | 创建一个案例档案 |
| T+1min | 系统去知识层拉这家公司、相关人物、相关概念的背景 | 冻结一份"当时的背景快照" |
| T+3min | 草拟调研提纲:这次要查哪 5-7 个维度、请哪几位评委 | 停下来等人确认(GATE 1) |
| T+15min | 确认后,多个子代理并行去查各自那一维 | 每维一份原始证据 |
| T+25min | 合成:哪些是决策的关键变量、哪个假设最可能被证伪、各维之间哪里打架 | 一份合成稿 |
| T+35min | 评委各自读合成稿独立打分,互相看不到——维度评委还得写「我要是错了,错在哪」 | 每人一份独立评语 |
| T+45min | 合议出报告,冻结版本,算出锚点与维度评委的分歧值,推卡片回飞书 | 判断书 + 不可变的版本快照 |
| T+30 天 | 定时器到期,自动去核对当初写下的证伪信号 | 确认 / 部分成立 / 被证伪 |
| 被证伪时 | 生成失败卡片并归类,按类型去修事实、修框架、或修流程 | 下一次判断因此更准 |
因为调研方向错了,后面全白跑。GATE 1 卡在最便宜的位置——此时只花了几分钟,改提纲成本极低; 等跑完全流程才发现问错了问题,成本是几十倍。
这也是这套系统的基本立场:决策永远是人做的,系统负责把判断的过程摊开、让人看得见、能反驳。
只要能看到别人的评分,就会向均值靠拢——这是众所周知的锚定效应。一旦发生, 多评委就退化成"一个评委 + 几个复读机",分歧信息全部丢失。
而分歧恰恰是最有价值的部分:锚点和维度评委差得远,往往正说明这里有值得想清楚的东西。
不能。快照的用途是记录"当时是怎么想的"——一旦允许回头修,归因就失去了基准, "我们早就知道"会悄悄取代"我们当时判断错了"。
纠错的正确方式是发新版本。新旧版本之间的差异本身就是有价值的记录。
会同时破坏三件事:版本快照的不可变性(判断被重新编译进知识后又流回判断)、 评委的独立性(读到了本不该读的历史评语)、归因的历史轨迹 (同一家公司的多次判断被"整合",而差异本身就是数据)。
唯一的例外是受控的:评审收到的原始提交文档(评审的输入)可以经过滤后沉淀进知识库; 但报告、评语、案例档案(评审的产出)永远不进。