Skip to content

开发路线图

本页记录项目的方法论演进与工程化计划。具体 case 细节、凭据、内部场景命名在 docs/internal/ 保留,本页仅描述工程化方向与里程碑。

版本变更记录见 Changelog


当前状态 · v1.3.0(已发布 · VM 联调闭环)

模块状态说明
多场景评委体系✅ 已发布10 个 Scene,2 类型(review / competition)
OP2 6段式报告输出总分 / 分项 / 必改 / 建议 / 删减 / 一页表
e2e + 单元测试900 passed · make smoke-scene SCENE=<slug>
Phase 2 外部视角评委3 个虚拟 persona(含免责声明)
Workshop 竞赛场景competition 模式,10分制,无 anchor
定性总结场景(meeting_summary)✅ 已上线review 型场景产出多视角会议总结 deck(每评委 判断逻辑 + 3 亮点 + 3 不足 + 一句话)+ 4:1 大屏 PPTX,不走打分门槛
VM 联调(M5)✅ 完成≥2 飞书机器人真实路由 + 两类型端到端跑通

已完成 · M5 VM 联调闭环(v1.3.0)

目标: 在云 VM 上让 ≥2 个飞书机器人各自触发对应 panel,验证路由隔离。✅ 2026-06-29 达成。

验收结果:

  • review 场景机器人 → 100分制报告 → 含 anchor judge ✅
  • competition 场景机器人 → 自定义分制报告 → 无 anchor ✅

联调过程逐层暴露并修复一条"洋葱式" bug 链(多机器人并发事件循环冲突 / 异步回推机器人身份串台 / 固定评委编组场景解析 / 跨场景评委 SKILL 路径 / LLM 限流退避重试),均为"只在真实 VM 联调才暴露"的集成问题。已合并 feature branch → main 并打 v1.3.0 tag

详见 VM 多场景部署


短期 · P3 工程强化(v1.3 目标)

✅ P3 四项工程强化已全部完成(测试基线 790 → 835),下列保留作为能力说明。

专项行业评委扩充 ✅

Phase 2 外部视角评委 3 个(数据驱动 / AI平台化 / 资本市场视角)的基础上,Phase 3 增加:

  • 行业客户视角(3 个虚拟 persona):针对垂直行业的实际用户诉求,从"甲方看效果"角度评议
  • 每个 persona 基于公开报道与行业案例构建,不绑定真实人物,含标准免责声明
  • 集成进对应 BG 级 review 场景的 panel

Workshop 排名展示 ✅

脚本: build_workshop_ranking.py
功能: 扫描多份竞赛方案 → 按总分降序(并列共享名次)→ 生成自包含排名 HTML
      → 可选飞书群投递
特点: 排名列由 panel 的评分维度动态决定,任意 competition 场景通用
用途: 年中/年终 workshop 后快速出排名看板

Scene 级使用统计 ✅

monthly_review.py--scene-breakdown flag:按场景分组统计 job 数、平均总分、 错误率、最近 job 时间,集成进月度复盘报告 §9 段。

飞书事件多场景路由 ✅

飞书事件入口按机器人 app_id 反查对应场景,把 scene_slug 注入处理流程, 确保每个机器人触发各自场景的 panel;无匹配时降级到全局配置,完全向后兼容。


下一轮 · 评委体系完整性

与最早需求逐表对照后,评分维度已 100% 对齐,6 段输出与落地优先级前三阶段已完成。 评委组合层有少量待补项(均维持虚拟 persona + 免责声明,不绑定真实人物):

  • 主场景多主题评委组合:让公司级场景按议题主题(增长差距 / AI 转型 / 价值经营) 动态选取对应评委组合,而非固定一套
  • 跨场景评委复用接入:已建的通用评委(数据平台 / 技术战略 / 资本市场视角)按需接入 更多业务线场景
  • 生态视角补缺:为特定行业线补充本地化生态视角评委(区别于现有的全球视角)

设计纪律:所有评委是基于公开观点构建的角色化框架,含标准免责声明, doctrine 待真实材料蒸馏后填充——不凭空编造特定人物观点。


中期 · anchor research 填充(v0.6)

anchor 评委(锚点视角)的心智模型文件当前为框架占位,v0.6 计划用 agent 逆向合成 完善:

五步 SOP

S1  素材预填   从访谈 transcript + 历史 raw 材料抽候选片段,每条带 source link
S2  agent 合成  派 sub-agent 起草 6 个 research 文件(身份DNA/心智模型/反共识等)
S3  质量校验   skill_lint --check-anchor-research(字数/引用/provenance 三重校验)
S4  holdout 回测  留出 2-3 个历史决策做 back-test,≥2/3 方向一致为过
S5  互动迭代   每次真实锚点反馈落 deltas.md,monthly_review 追踪 anchor model drift

confidence 分级机制

  • 当前(占位状态):confidence ≤ 0.4
  • S2 完成(agent-derived):≤ 0.6
  • 锚点本人签收:解除上限

反循环护栏:合成只用访谈 transcript / anchor raw 过滤材料 / wiki,严禁用 LLM 跑出的 review 喂 S2(循环造假)。


中长期 · boss-as-a-Service(已立项 · 2026-07-06 PRD v0.2 定稿)

把 boss 判断引擎封装为任意 agent 可调用的服务(codex / opencode 等 MCP-capable agent 均可接入)——引擎、模型、知识库三者解耦。护城河命题:boss 的价值是方法论(5 镜头 / 满分制打分 / anchor_delta / 30-90-365 归因)+ 评委 doctrine + 知识库,不是模型;把模型抽离、让调用方"借 boss 的评委和方法论 + 自己的模型"出判断,反而放大护城河。

  • BYOM(自带模型)两档:档 A「prepare-only 纯借脑」先行——引擎不调模型,返回各阶段 prompt 包(评委 doctrine + 输出强约束),调用方用自己的模型跑、回传结构化 review,引擎做确定性聚合 / 定级 / 渲染 / 出站脱敏;档 B「代跑」(调用方提供 OpenAI-compatible 端点)随后。
  • 双知识库:托管(内部授权 + 敏感度分级过滤 + 出站脱敏 fail-close)/ 自建(bundle 格式与主库同构,租户隔离,含最小生产工具链:校验器 + 脚手架)。
  • 接口:MCP server 优先,HTTP/OpenAPI 兜底;契约带 schema_version 版本化。
  • 第 0 红线(压倒一切):现有多场景评审 + 飞书机器人的正常运营在开发 / 部署 / 运行 / 回滚任何阶段不受影响——独立进程(不进消息事件循环)+ 资源限额 + 开关默认关 + 灰度 + 秒级回滚。

里程碑 M0–M6:引擎抽库 → KB 抽象 → 档 A 服务化(主干最短闭环)→ 认证体系 → 档 B → 自建 KB + 隔离 → 客户端适配。内部 PRD prd-boss-as-a-service v0.2 已定稿(confidential,决议 D1–D7 已拍板)。


架构决策待定项

决策状态说明
ADR-013accepted(主理认可 + 零影响评审通过 · CTO 会签待补)评审提交文档受控 ingestion 进知识库(去重 + 分级 + 脱敏闸 → 只进 entities/people/concepts;报告永不进);零影响架构级保证(ingestion 物理不在生产 VM);设计稿,M1 实现待启
ADR-010proposed(待双签)Cloudflare Containers 评估,静态 + 函数混合部署
feature branch → main✅ 已合并M5 联调通过,已发 v1.3.0
EvoMap / V3 公开层冻结(12月后)见 [CLAUDE.md §10.3]

不在计划内

以下明确不做 / 推迟:

  • Phase 4 专项评委(AI生态 / 政府事务 / 研究机构视角)→ Phase 3 验收后评估
  • D3 GitHub Actions 定时调度 → D2 云端稳定后再评估
  • _wikireports/ 的双向自动同步 → CLAUDE.md §3 架构原则禁止

📌 已完成(曾在本清单):PDF / DOCX 文档评审 — 已用 pypdf + python-docx 直接提取文字 实现(绕开 pandoc 外部依赖),含表格提取与"无文字层(扫描件)"防护;.doc 老二进制 引导转 .docx/PDF。


时间线

✅ DONE   v1.3.0 已发布 · 多场景 VM 联调闭环 (review + competition 两类型端到端)
           │  (含 P3 工程强化 + 评委 doctrine 源 + 多机器人并发硬化 + 429 退避重试)

NOW       competition 真·10分制输出格式 (Phase 4 按 scene lenses 打分) — 独立专项

  next     anchor research 5步 SOP 真合成 + 回测 · 归因 fetcher 接 MCP

相关: 多场景评委体系 · VM 多场景部署 · Changelog

判断力工程化 · Judgement, Engineered · 主站 · GitHub