Skip to content

30/90/365 attribution

每个判断在生成时, 必须同时写入至少 3 个 attribution checkpoint (30 天 / 90 天 / 365 天), 每个 checkpoint 含:

json
{
  "horizon_days": 30,
  "check_at": "2026-06-29",
  "falsification_metric": "...具体可观测信号...",
  "data_source": "marsdata-mcp | feishu-mcp | WebSearch",
  "expected_signal": "...预测的具体信号文本...",
  "status": "pending",   // pending | confirmed | partial | falsified
  "actual_signal": null,
  "verified_at": null
}

为什么是 30/90/365?

  • 30 天 — 抓快变量 (PR / 客户公告 / 招聘动作 / 价格调整)
  • 90 天 — 抓产品/组织变量 (新版本上线 / 团队重组 / 单位经济变化)
  • 365 天 — 抓战略变量 (品类位置 / 市占率 / 投资人结构)

3 个时间尺度对齐 attribution 的三个层次, 让短期信号不被长期叙事吞没, 也让长期判断不被短期噪音否决。

falsification_metric 的纪律

最常掉分的镜头是 5 镜头中的 falsifiability, 主要因为 metric 写得不够具体:

太软:

  • "三个月内有明显改善"
  • "客户口碑变好"
  • "团队士气上升"

可证伪:

  • "三个月内 NPS ≥ +12, 留存 ≥ 40%, 否则视为证伪"
  • "90 天内至少 3 家 lighthouse 客户公开发布合作 (含 PR + 案例)"
  • "Q3 财报 ARR YoY ≥ +35%, 否则部分证伪"

好的 metric 必须满足:

  1. 具体数字 — 数据源能给出明确读数
  2. 数据源指明 — marsdata / 飞书 / WebSearch / 财报 etc, 不是"凭感觉"
  3. expected_signal 提前写死 — 防止事后调整阈值 ("回头看 5% 也算改善")

attribution_check.py 调度

scripts/attribution_check.py 每天 09:00 由 Hermes scheduler 触发, 扫描所有 case 的 checkpoints:

python
for checkpoint in case.attribution.checkpoints:
    if checkpoint.check_at <= today and checkpoint.status == "pending":
        actual = fetch_data(checkpoint.data_source, ...)
        verdict = compare(actual, checkpoint.expected_signal, checkpoint.falsification_metric)
        # verdict ∈ {confirmed, partial, falsified}
        update_checkpoint(checkpoint, actual, verdict)
        if verdict == "falsified":
            generate_failure_card(case, checkpoint)

到期且证伪 → 自动生成 Failure Card, 触发 EVOLUTION 模式或方法论修订。

30d 真议题 milestone

boss-vault 在 framework v0.1 的 30d 独立验证中达到 5/5 = 100% PASS (2026-05-29 milestone, 见 changelog)。这不是"全猜对了", 而是 5 个判断的 30d checkpoint 全部按预测信号兑现 (含 1 个 partial)。

90d 盲测准备就绪 (M1 · --lock-framework-prediction flag + Step 1.5 spec), 等 2026 H2 真议题触发。

attribution ≠ "我判断对了"

attribution 是判断质量的检验, 不是判断对错的盖章:

  • confirmed — 信号按预测兑现 (但不等于思路正确, 可能蒙对)
  • partial — 部分兑现 (该议题方向对, 阈值估偏)
  • falsified — 预测信号未出现 (要么思路错, 要么外部黑天鹅)
  • pending — 还没到 check_at

任何 falsified 必须分类为 6 类 Failure Card 之一, 倒推方法论 / Skill / scope / metric 哪一层该改。

延伸阅读: 5 镜头 · Falsifiability · Failure Card · 6 维度评委

判断力工程化 · Judgement, Engineered · 主站 · GitHub